Anthropic Claude Opus 5 പുറത്തിറക്കി: പകുതി ചിലവിൽ മികച്ച പ്രകടനം

പ്രീമിയം മോഡലായ Claude Fable 5-ന് സമാനമായ പ്രകടനം വളരെ കുറഞ്ഞ നിരക്കിൽ വാഗ്ദാനം ചെയ്തുകൊണ്ട്, ഹൈ-എൻഡ് LLM വിപണിയിൽ വിപ്ലവം സൃഷ്ടിക്കാൻ ലക്ഷ്യമിട്ട് Anthropic തങ്ങളുടെ പുതിയ ഫ്ലാഗ്ഷിപ്പ് മോഡലായ Claude Opus 5 ഔദ്യോഗികമായി പുറത്തിറക്കി. GPT-5.6 Sol പോലുള്ള എതിരാളികളിൽ നിന്നുള്ള വിലക്കയറ്റ സമ്മർദ്ദങ്ങളെ പ്രതിരോധിക്കുന്നതിനോടൊപ്പം, കോഡിംഗിനും സങ്കീർണ്ണമായ അറിവ് ആവശ്യമായ ജോലികൾക്കുമായി ഡെവലപ്പർമാർക്ക് കൂടുതൽ കാര്യക്ഷമമായ ഒരു ഉപകരണം നൽകുക എന്നതും ഈ തന്ത്രപരമായ നീക്കത്തിന്റെ ലക്ഷ്യമാണ്.

വില-പ്രകടനം എന്ന അതിർവരമ്പുകൾ മാറ്റിയെഴുതുന്നു

Claude Opus 5-ന്റെ ഏറ്റവും ശ്രദ്ധേയമായ സവിശേഷത അതിന്റെ ആകർഷകമായ വിലനിർണ്ണയ രീതിയാണ്. ഏറ്റവും ഉയർന്ന നിലവാരമുള്ള Claude Fable 5-ന് ഒരു ദശലക്ഷം ഇൻപുട്ട് ടോക്കണുകൾക്ക് $10-ഉം ഒരു ദശലക്ഷം ഔട്ട്പുട്ട് ടോക്കണുകൾക്ക് $50-ഉം ചിലവ് വരുമ്പോൾ, Opus 5 ഈ നിരക്കുകൾ പകുതിയായി കുറയ്ക്കുന്നു; അതായത് ഒരു ദശലക്ഷം ഇൻപുട്ടിന് $5-ഉം ഔട്ട്പുട്ടിന് $25-ഉം ആണ് നിരക്ക്.

വേഗത ആവശ്യമായ സാഹചര്യങ്ങൾക്കായി Anthropic ഒരു "Fast Mode" അവതരിപ്പിച്ചിട്ടുണ്ട്. ഇത് പ്രോസസ്സിംഗ് വേഗത 2.5 മടങ്ങ് വർദ്ധിപ്പിക്കുമെങ്കിലും ടോക്കൺ നിരക്ക് ഇരട്ടിയാകുന്നു. ഈ വിവിധ നിരക്കുകളും, 1 മില്യൺ ടോക്കണുകൾ ഉൾക്കൊള്ളാൻ കഴിയുന്ന വലിയ കോൺടെക്സ്റ്റ് വിൻഡോയും (context window) ചേർന്ന്, Claude Max-ന്റെ പുതിയ ഡിഫോൾട്ട് മോഡലായും Claude Pro ഉപയോക്താക്കൾക്ക് ഏറ്റവും മികച്ച ഓപ്ഷനായും Opus 5 മാറുന്നു.

കോഡിംഗിലും യുക്തിചിന്തയിലും ബെഞ്ച്മാർക്കുകളിൽ മുന്നിൽ

Opus 5 വെറുമൊരു ബജറ്റ് ഓപ്ഷൻ മാത്രമല്ല; പ്രത്യേക മേഖലകളിൽ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്ന ഒരു കരുത്തുറ്റ മോഡൽ കൂടിയാണ്. Frontier-Bench v0.1 വഴിയുള്ള ഏജൻറ്റിക് ടെർമിനൽ കോഡിംഗിൽ (agentic terminal coding), Opus 5 43.3% സ്കോർ നേടി Fable 5 (33.7%), GPT-5.6 Sol (34.4%) എന്നിവരെ പിന്നിലാക്കി. അറിവ് ആവശ്യമായ ജോലികളിലും (knowledge work) ഇത് മികവ് തെളിയിച്ചു; GDPval-AA v2 ബെഞ്ച്മാർക്കിൽ 1,861 Elo സ്കോറോടെ ഇത് മുന്നിലെത്തി.

പുതിയ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള കഴിവിനെ അളക്കുന്ന ARC-AGI-3 ബെഞ്ച്മാർക്കിൽ നിന്നുള്ള കണക്കുകളാണ് ഏറ്റവും അത്ഭുതപ്പെടുത്തുന്നത്. Opus 5 30.2% സ്കോർ നേടി, ഇത് GPT-5.6 Sol നേടിയ 7.8%-ന്റെ ഏകദേശം നാല് മടങ്ങാണ്. മോഡലിന്റെ പരിശീലന ഡാറ്റയിൽ (training data) ഇല്ലാത്ത പുതിയ രീതിയിലുള്ള ജോലികൾ കൈകാര്യം ചെയ്യാനുള്ള അതിന്റെ കഴിവിൽ വലിയ മുന്നേറ്റമാണ് ഇത് സൂചിപ്പിക്കുന്നത്.

ബുദ്ധിപരമായ എഫർട്ട് സ്കെയിലിംഗും കാര്യക്ഷമതയും

ഉപയോക്താക്കൾക്ക് low, medium, high, xhigh, max എന്നിങ്ങനെ അഞ്ച് ക്രമീകരണങ്ങൾക്കിടയിൽ മാറ്റം വരുത്താൻ സാധിക്കുന്ന ഒരു അത്യാധുനിക "effort" സിസ്റ്റം Anthropic അവതരിപ്പിച്ചു. ഇത് ടോക്കൺ ഉപയോഗവും യുക്തിചിന്തയുടെ ആഴവും (reasoning depth) തമ്മിൽ കൃത്യമായി ക്രമീകരിക്കാൻ സഹായിക്കുന്നു.

ചിലവ് കുറയ്ക്കുന്നതിനായി പൊതുവായ ജോലികൾക്ക് "low", "medium" ക്രമീകരണങ്ങൾ ഉപയോഗിക്കാൻ Anthropic ശുപാർശ ചെയ്യുന്നുണ്ടെങ്കിലും, സങ്കീർണ്ണമായ ഏജൻറ്റിക് കോഡിംഗിനായി "xhigh" ഉപയോഗിക്കാൻ അവർ നിർദ്ദേശിക്കുന്നു. രസകരമായ ഒരു കാര്യം, "max" ക്രമീകരണത്തിൽ പ്രകടനം അത്ര മെച്ചപ്പെടുന്നില്ല എന്നതാണ്; Frontier-Bench v0.1, Artificial Analysis Coding Agent Index എന്നിവയിൽ, ഉയർന്ന ചിലവ് വരുത്തിയിട്ടും Opus 5-ന്റെ പ്രകടനത്തിൽ നേരിയ കുറവ് രേഖപ്പെടുത്തി. അതിനാൽ, കാര്യക്ഷമതയ്ക്ക് ഏറ്റവും അനുയോജ്യമായ ക്രമീകരണം നിലവിൽ "xhigh" ആണെന്ന് ഇത് സൂചിപ്പിക്കുന്നു.

മെച്ചപ്പെട്ട സുരക്ഷയും സ്വയംഭരണാധികാരവും

ഉപയോക്താക്കളുടെ അഭിപ്രായങ്ങൾ പരിഗണിച്ച്, Opus 5-ന്റെ സേഫ്റ്റി ക്ലാസിഫയറുകളിൽ (safety classifiers) Anthropic മാറ്റങ്ങൾ വരുത്തിയിട്ടുണ്ട്. Fable 5-നെ അപേക്ഷിച്ച് ഇതിലെ സൈബർ ഫിൽട്ടറുകൾ ഏകദേശം 85% കുറവ് തവണ മാത്രമേ പ്രവർത്തിക്കുന്നുള്ളൂ. ഇത് നിയമാനുസൃതമായ ഗവേഷണങ്ങളെ അനാവശ്യമായി തടയുന്നു എന്ന മുൻപത്തെ വിമർശനങ്ങൾ പരിഹരിക്കാൻ സഹായിക്കുന്നു. എക്സ്പ്ലോയിറ്റ് ജനറേഷൻ (exploit generation), ബൈനറി അധിഷ്ഠിത സ്കാനിംഗ് എന്നിവ തടയുന്നുണ്ടെങ്കിലും, സോഴ്സ് കോഡ് വൾനറബിലിറ്റി ഗവേഷണങ്ങൾക്ക് (source code vulnerability research) ഇത് കൂടുതൽ അനുമതി നൽകുന്നു.

കൂടാതെ, Opus 5 മികച്ച സ്വയം തിരുത്തൽ (self-correction) ശേഷിയും പ്രകടിപ്പിക്കുന്നു. യഥാർത്ഥ ലോക പരീക്ഷണങ്ങളിൽ, ജ്യാമിതീയ രൂപങ്ങൾ (geometry) മനസ്സിലാക്കാൻ സ്വന്തമായി ഒരു കമ്പ്യൂട്ടർ വിഷൻ പൈപ്പ്‌ലൈൻ എഴുതിക്കൊണ്ട് FreeCAD-ൽ ഒരു 3D മോഡൽ നിർമ്മിക്കാൻ ഈ മോഡലിന് സാധിച്ചു—മറ്റ് മത്സര മോഡലുകൾക്ക് പോലും ചെയ്യാൻ കഴിയാത്ത ഒരു കാര്യമാണിത്.

പ്രധാന വിവരങ്ങൾ

  • വിലയിൽ വൻ കുറവ്: Claude Fable 5-ന്റെ ടോക്കൺ ചിലവിന്റെ 50% മാത്രം നിരക്കിൽ Opus 5 ഫ്ലാഗ്ഷിപ്പ് നിലവാരത്തിലുള്ള പ്രകടനം വാഗ്ദാനം ചെയ്യുന്നു.
  • യുക്തിചിന്തയിലെ മുന്നേറ്റം: പുതിയ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള ARC-AGI-3 ബെഞ്ച്മാർക്കിൽ എതിരാളികളേക്കാൾ 4 മടങ്ങ് മികച്ച പ്രകടനം ഈ മോഡൽ കാഴ്ചവെച്ചു.
  • മെച്ചപ്പെട്ട ഡെവലപ്പർ വർക്ക്ഫ്ലോ: മെച്ചപ്പെട്ട സേഫ്റ്റി ക്ലാസിഫയറുകളും പ്രത്യേക "effort" ക്രമീകരണങ്ങളും ഉള്ളതിനാൽ, ഏജൻറ്റിക് കോഡിംഗിനും ഗവേഷണത്തിനും Opus 5 കൂടുതൽ സുഗമമായ അനുഭവം നൽകുന്നു.