Sakana AI-യുടെ Fugu Ultra v1.1 പുതിയ അപ്ഡേറ്റിൽ Fable 5-നെ മറികടക്കുന്നു
പ്രധാനപ്പെട്ട സാങ്കേതിക ബെഞ്ച്മാർക്കുകളിൽ (benchmarks) വലിയ പ്രകടനം കാഴ്ചവെക്കുന്നു എന്ന് അവകാശപ്പെട്ടുകൊണ്ട്, തങ്ങളുടെ ഇന്റലിജന്റ് മോഡൽ റൂട്ടറായ Fugu Ultra v1.1-ന് Sakana AI ഒരു സുപ്രധാന അപ്ഡേറ്റ് പുറത്തിറക്കി. മികച്ച റീസണിംഗ് (reasoning), കോഡിംഗ് കപ്പാബിലിറ്റികൾ എന്നിവ കൈവരിക്കുന്നതിനായി, ക്വറികൾ (queries) മികച്ച മോഡലുകളിലേക്ക് എങ്ങനെ വിതരണം ചെയ്യണം എന്ന് പരിഷ്കരിക്കാനുള്ള ഒരു തന്ത്രപരമായ നീക്കമാണ് ഈ അപ്ഡേറ്റ്.
ബെഞ്ച്മാർക്കുകൾ തകർക്കുന്നു: Fugu Ultra v1.1-ന്റെ നേട്ടം
നൽകിയിട്ടുള്ള പ്രോംപ്റ്റുകൾക്കായി ലഭ്യമായ LLM-കളിൽ നിന്ന് ഏറ്റവും അനുയോജ്യമായ മോഡൽ തിരഞ്ഞെടുക്കുന്ന അതിന്റെ റൂട്ടിംഗ് ഇന്റലിജൻസിലാണ് (routing intelligence) Fugu Ultra v1.1-ന്റെ പ്രധാന നവീകരണം അടങ്ങിയിരിക്കുന്നത്. ആദ്യ പതിപ്പായ v1.0-നെ അപേക്ഷിച്ച് ഈ പതിപ്പ് 7.9 പോയിന്റ് വരെ പ്രകടനം മെച്ചപ്പെടുത്തിയതായി Sakana AI റിപ്പോർട്ട് ചെയ്യുന്നു.
ഏറ്റവും ശ്രദ്ധേയമായ കാര്യം, പ്രത്യേക സാങ്കേതിക വിലയിരുത്തലുകളിൽ, പ്രത്യേകിച്ച് ProgramBench, TerminalBench 2.1 എന്നീ ബെഞ്ച്മാർക്കുകളിൽ റൂട്ടർ വലിയ മുന്നേറ്റം കാഴ്ചവെച്ചു എന്നതാണ്. Fable 5 റൂട്ടറിന്റെ മോഡൽ ശേഖരത്തിൽ ഉൾപ്പെട്ടിട്ടില്ലെങ്കിൽ പോലും, മിക്ക ബെഞ്ച്മാർക്കുകളിലും Anthropic-ന്റെ Fable 5-നെക്കാൾ മികച്ച പ്രകടനം ഇപ്പോൾ Fugu Ultra v1.1 കാഴ്ചവെക്കുന്നുണ്ടെന്ന് Sakana അവകാശപ്പെടുന്നു. ഈ ഫലങ്ങൾക്ക് നിലവിൽ സ്വതന്ത്രമായ മൂന്നാം കക്ഷി പരിശോധനകൾ ലഭ്യമല്ലെങ്കിലും, നിലവിലുള്ള മോഡൽ ആർക്കിടെക്ചറുകളിൽ നിന്ന് മികച്ച പ്രകടനം പുറത്തെടുക്കുന്നതിൽ റൂട്ടിംഗ് ലോജിക് അതീവ കാര്യക്ഷമമായി മാറുന്നുവെന്ന് ഇത് സൂചിപ്പിക്കുന്നു.
സാങ്കേതിക ആർക്കിടെക്ചറും ഡെവലപ്പർ ഇന്റഗ്രേഷനും
അത്യാധുനിക മോഡലുകൾ നിലനിർത്തുന്നതിൽ Sakana വളരെ കർശനമായ സമീപനമാണ് സ്വീകരിക്കുന്നത്; ഏതൊരു പുതിയ ടോപ്പ്-ടിയർ മോഡലും Fugu ഇക്കോസിസ്റ്റത്തിൽ ഔദ്യോഗികമായി ഉൾപ്പെടുത്തുന്നതിന് ഏകദേശം രണ്ടാഴ്ചത്തെ പ്രത്യേക പരിശീലനവും വിലയിരുത്തലും ആവശ്യമാണെന്ന് കമ്പനി പ്രസ്താവിക്കുന്നു. ഇത് വിപണിയിലെ ഏറ്റവും പുതിയ വെയ്റ്റുകൾക്കും (weights) കപ്പാബിലിറ്റികൾക്കും അനുസൃതമായി റൂട്ടറിന്റെ തീരുമാനമെടുക്കൽ പ്രക്രിയ ഒപ്റ്റിമൈസ് ചെയ്യപ്പെടുന്നുണ്ടെന്ന് ഉറപ്പാക്കുന്നു.
ഡെവലപ്പർമാർക്കായി, പുതിയ Claude Code-compatible endpoint ഈ അപ്ഡേറ്റിലൂടെ അവതരിപ്പിക്കുന്നു, ഇത് ഉപയോക്താക്കൾക്ക് അവരുടെ ടെർമിനലിൽ നിന്ന് നേരിട്ട് Fugu ഉപയോഗിക്കാൻ അനുവദിക്കുന്നു. ഉയർന്ന നിലവാരത്തിലുള്ള റീസണിംഗും ടെർമിനൽ അധിഷ്ഠിത ഓട്ടോമേഷനും ആവശ്യമുള്ള എഞ്ചിനീയർമാരുടെ വർക്ക്ഫ്ലോകൾ ഇത് ലഘൂകരിക്കുന്നു. ഈ സാങ്കേതിക മുന്നേറ്റങ്ങൾക്കിടയിലും, വില മുൻ പതിപ്പിന് സമാനമായി തുടരുന്നു: ഒരു ദശലക്ഷം ഇൻപുട്ട് ടോക്കണുകൾക്ക് $5, ഒരു ദശലക്ഷം ഔട്ട്പുട്ട് ടോക്കണുകൾക്ക് $30. OpenRouter, Vercel തുടങ്ങിയ പ്രധാന പ്ലാറ്റ്ഫോമുകളിലൂടെ ഇപ്പോൾ Fugu ലഭ്യമാണ്.
വിപണി വെല്ലുവിളികളും നിയന്ത്രണങ്ങളും നേരിടുന്നു
Fugu-യുടെ ആദ്യ ലോഞ്ചിന് പിന്നാലെ ഉണ്ടായ വിമർശനങ്ങൾക്ക് ശേഷമാണ് ഈ പുതിയ പതിപ്പ് പുറത്തിറങ്ങുന്നത്. ഉയർന്ന ടോക്കൺ ഉപയോഗം, ലേറ്റൻസി (latency), അസ്ഥിരമായ ഫലങ്ങൾ എന്നിവയെക്കുറിച്ച് ആദ്യകാല വിമർശകർ ചൂണ്ടിക്കാട്ടിയിരുന്നു. ഡെവലപ്പർമാരുടെ വിശ്വാസം തിരിച്ചുപിടിക്കുന്നതിനായി കാര്യക്ഷമതയിലും പ്രത്യേക ജോലികൾ ചെയ്യാനുള്ള കപ്പാബിലിറ്റിയിലും കൂടുതൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കാനാണ് v1.1-ലൂടെ Sakana ശ്രമിക്കുന്നത്.
എന്നിരുന്നാലും, ആഗോളതലത്തിലുള്ള ഉപയോഗത്തിന് ഭൂമിശാസ്ത്രപരമായ പരിമിതികൾ ഒരു തടസ്സമായി തുടരുന്നു. GDPR-ഉം മറ്റ് യൂറോപ്യൻ യൂണിയൻ നിയന്ത്രണങ്ങളും സംബന്ധിച്ച സങ്കീർണ്ണതകൾ ചൂണ്ടിക്കാട്ടി, Sakana AI നിലവിൽ യൂറോപ്യൻ യൂണിയനിലെ (EU) അല്ലെങ്കിൽ യൂറോപ്യൻ ഇക്കണോമിക് ഏരിയയിലെ (EEA) ഉപയോക്താക്കൾക്ക് സേവനം നൽകുന്നില്ല. "മോഡൽ റൂട്ടർ" വിഭാഗം വളരുന്നതിനനുസരിച്ച്, സുതാര്യവും പരിശോധിക്കാവുന്നതുമായ ഡാറ്റയിലൂടെ ഈ പ്രകടന അവകാശവാദങ്ങൾ തെളിയിക്കാനുള്ള Sakana-യുടെ കഴിവായിരിക്കും മത്സരബുദ്ധിയുള്ള AI രംഗത്ത് അതിന്റെ നിലനിൽപ്പിന്റെ അന്തിമ പരീക്ഷണം.
പ്രധാന കാര്യങ്ങൾ
- മികച്ച ബെഞ്ച്മാർക്കിംഗ്: v1.0-നെ അപേക്ഷിച്ച് Fugu Ultra v1.1 7.9 പോയിന്റ് പുരോഗതി കാണിക്കുന്നു; Fable 5 റൂട്ടറിന്റെ ശേഖരത്തിൽ ഇല്ലെങ്കിൽ പോലും പല അളവുകോലുകളിലും Anthropic-ന്റെ Fable 5-നെ മറികടക്കുന്നു.
- ഡെവലപ്പർ കേന്ദ്രീകൃതമായ അപ്ഡേറ്റുകൾ: പുതിയ പതിപ്പ് ഒരു Claude Code-compatible ടെർമിനൽ എൻഡ്പോയിന്റ് കൂടി ഉൾപ്പെടുത്തുന്നു, ഇത് കോഡിംഗ് വർക്ക്ഫ്ലോകൾ എളുപ്പമാക്കുന്നു.
- കർശനമായ തിരഞ്ഞെടുപ്പ്: ഉയർന്ന കൃത്യതയും പ്രകടനവും നിലനിർത്തുന്നതിനായി, റൂട്ടറിൽ ചേർക്കുന്ന ഓരോ പുതിയ മോഡലിനും Sakana രണ്ടാഴ്ചത്തെ മൂല്യനിർണ്ണയ ചക്രം (evaluation cycle) ഉപയോഗിക്കുന്നു.
