പുതിയ മോഡൽ കൂടുതൽ "കഠിനമായി" തോന്നാൻ കാരണം

പല ഘട്ടങ്ങളിലൂടെ ചിന്തിക്കേണ്ടി വരുന്ന ഓട്ടോണമസ് ഏജന്റുകൾക്കായി (autonomous agents) ആണ് Google Gemini 3.8 Flash നിർമ്മിച്ചിരിക്കുന്നത്. സാധാരണയായി ഒറ്റത്തവണ കൊണ്ട് മറുപടി നൽകുന്ന Gemini 3.7 Flash-ൽ നിന്ന് വ്യത്യസ്തമായി, 3.8 ഒരു പ്രശ്നത്തെ ഉപചോദ്യങ്ങളായി വിഭജിക്കുകയും, എക്സ്റ്റേണൽ API-കൾ ഉപയോഗിക്കുകയും, തൃപ്തികരമായ ഉത്തരം ലഭിക്കുന്നത് വരെ ആവർത്തിക്കുകയും ചെയ്യുന്നു. ഈ അധികമായ ചിന്താപ്രക്രിയ കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിക്കുന്നുണ്ടെന്നും, പ്രത്യേകിച്ച് ഉയർന്ന "effort" സെറ്റിംഗുകളിൽ ഇത് കൂടുതൽ പ്രകടമാകുമെന്നും Google മുന്നറിയിപ്പ് നൽകുന്നു.

ഒരു ടാസ്ക്കിനായുള്ള ഔട്ട്പുട്ട് ടോക്കണുകൾ 3.7 Flash-നെ അപേക്ഷിച്ച് ഏകദേശം 30% വർദ്ധിക്കുന്നതായും ഇന്ററാക്ഷൻ ടേണുകൾ (interaction turns) കൂടുന്നതായും ഒരു സ്വതന്ത്ര വിശകലനം കാണിക്കുന്നു. ടോക്കൺ നിരക്കുകളിൽ മാറ്റമില്ലാത്തതിനാൽ, യഥാർത്ഥ ലോകത്തെ പല ജോലികൾക്കും (workloads) ഫലപ്രദമായ ചിലവ് ഏകദേശം 40% വർദ്ധിക്കുന്നു.

ഡെവലപ്പർമാർക്ക് പ്രസക്തമായ ബെഞ്ച്മാർക്കുകൾ

ഈ മാറ്റം കേവലം സിദ്ധാന്തമല്ല. DeepSWE v1.1 സോഫ്റ്റ്‌വെയർ എഞ്ചിനീയറിംഗ് ബെഞ്ച്മാർക്കിലെ നേരിട്ടുള്ള പരീക്ഷണങ്ങളിൽ, Gemini 3.8 Flash, Anthropic-ന്റെ Fable 5-നെ തീർച്ചയായും തോൽപ്പിച്ചു. Vals Finance Agent V2, Harvey’s Legal Agent ബെഞ്ച്മാർക്കുകളിലും ഈ മോഡൽ മുന്നിലെത്തി, സങ്കീർണ്ണമായ സാമ്പത്തിക കണക്കുകൂട്ടലുകളും സൂക്ഷ്മമായ നിയമപരമായ യുക്തികളും കൈകാര്യം ചെയ്യാൻ ഇതിന് കഴിയുമെന്ന് ഇത് തെളിയിക്കുന്നു.

Aigora.ai-യുടെ CEO ജോൺ എൻനിസ് ഇതിന്റെ നേട്ടത്തെ ഇങ്ങനെ സംഗ്രഹിച്ചു: വളരെ കുറഞ്ഞ ചിലവിലും ശ്രദ്ധേയമായ വേഗതയിലും ഈ മോഡൽ "Opus 5 കോഡിംഗ് ക്വാളിറ്റി" നൽകുന്നു. വേഗതയേറിയ ഇൻഫറൻസും (inference) സങ്കീർണ്ണമായ കോഡ് ജനറേഷനും പ്രൊഡക്ഷൻ പൈപ്പ്‌ലൈനുകളിൽ നിന്ന് മണിക്കൂറുകൾ ലാഭിക്കാൻ സഹായിക്കുന്ന Remotion വീഡിയോകൾ നിർമ്മിക്കുന്നത് പോലുള്ള ഉപയോഗങ്ങൾ അദ്ദേഹം ഉദാഹരണമായി ചൂണ്ടിക്കാട്ടുന്നു.

മാറിക്കൊണ്ടിരിക്കുന്ന AI സാമ്പത്തികശാസ്ത്രം

ഡെവലപ്പർമാർ മുമ്പ് ടോക്കൺ നിരക്ക് (price-per-token) നോക്കിയാണ് ചിലവ് കണക്കാക്കിയിരുന്നത്. എന്നാൽ മൾട്ടി-ടേൺ, ടൂൾ-ഓഗ്മെന്റഡ് ഏജന്റുകൾ (tool-augmented agents) ഈ അളവുകോലിനെ 'വിജയകരമായ ഓരോ ടാസ്ക്കിനും വേണ്ട ചിലവ്' (price-per-successful-task) എന്നതിലേക്ക് മാറ്റുന്നു. Gemini 3.8 Flash-ൽ, ഒരേ ഫലം ലഭിക്കാൻ മോഡൽ കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിക്കുന്നുണ്ടെങ്കിൽ, കുറഞ്ഞ ടോക്കൺ നിരക്ക് ഉണ്ടെന്നത് കുറഞ്ഞ ബില്ല് ലഭിക്കുമെന്ന് ഉറപ്പുനൽകുന്നില്ല.

അങ്ങേയറ്റം വിലകൂടിയ ഫ്രോണ്ടിയർ മോഡലുകൾക്കും (frontier models) ലഘുവായ സിംഗിൾ-ടേൺ ജനറേറ്ററുകൾക്കും ഇടയിലാണ് Google ഈ മോഡലിനെ പ്രതിഷ്ഠിച്ചിരിക്കുന്നത്. ഇതിനെ “intelligence-on-demand” എന്ന് വിശേഷിപ്പിക്കുന്നതിലൂടെ, വലിയതും സാവധാനത്തിലുള്ളതുമായ മോഡലുകളിൽ സാധാരണയായി ഉണ്ടാകാറുള്ള ലേറ്റൻസി (latency) ഇല്ലാതെ തന്നെ ഉയർന്ന യുക്തിപരമായ ശേഷി (reasoning power) ഉപയോഗിക്കാൻ ഡെവലപ്പർമാർക്ക് കഴിയുമെന്ന് കമ്പനി സൂചിപ്പിക്കുന്നു. ഇതിലെ വിട്ടുവീഴ്ച വ്യക്തമാണ്: കൂടുതൽ സങ്കീർണ്ണമായ ഔട്ട്പുട്ട് എന്നാൽ ഉയർന്ന ആകെ ടോക്കൺ എണ്ണം എന്നാണ് അർത്ഥം.

എപ്പോഴാണ് പഴയ വേർഷൻ ഉപയോഗിക്കേണ്ടത്

ചിലവ് കൃത്യമായി പ്രവചിക്കേണ്ട ടീമുകൾ—പ്രത്യേകിച്ച് വലിയ തോതിലുള്ള ബാച്ച് ജോലികൾ നടത്തുന്നവരോ കുറഞ്ഞ ലാഭത്തിൽ പ്രവർത്തിക്കുന്നവരോ ആണെങ്കിൽ—Gemini 3.7 Flash തന്നെ ഉപയോഗിക്കുന്നതാണ് നല്ലത്. പഴയ മോഡൽ ഇപ്പോഴും കുറഞ്ഞ ലേറ്റൻസിയും സ്ഥിരമായ ടോക്കൺ ഉപയോഗവും നൽകുന്നു, ഇത് മാസചെലവ് മുൻകൂട്ടി കാണാൻ എളുപ്പമാക്കുന്നു.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • ടൂൾ-കോൾ പ്രൈസിംഗ് (Tool-call pricing):

ചുരുക്കത്തിൽ

ഉയർന്ന യുക്തിപരമായ ശേഷി (higher reasoning) വളരെ വേഗത്തിൽ (flash-level latency) ലഭ്യമാക്കാൻ Gemini 3.8 Flash-ന് കഴിയുമെങ്കിലും, ഓരോ ഇന്ററാക്ഷനും കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിക്കുന്നുണ്ടെന്ന് ഇത് കാണിക്കുന്നു. സങ്കീർണ്ണമായ, മൾട്ടി-സ്റ്റെപ്പ് AI ഏജന്റുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർക്ക് ഇതിന്റെ പ്രകടനം മികച്ചതായി തോന്നും, എങ്കിലും മറഞ്ഞിരിക്കുന്ന ടോക്കൺ ചിലവ് പരിഗണിച്ച് ബജറ്റ് ക്രമീകരിക്കേണ്ടി വരും. മറ്റുള്ളവർക്ക്, പഴയ 3.7 Flash തന്നെ കൂടുതൽ സുരക്ഷിതവും പ്രവചിക്കാവുന്നതുമായ തിരഞ്ഞെടുപ്പായി തുടരുന്നു.