GPT-5.6-SOL മൂന്ന് മൾട്ടി-സ്റ്റെപ്പ് മാത്തമാറ്റിക്സ്, ഫിസിക്സ്, കോഡിംഗ് ടാസ്ക്കുകൾ വിജയകരമായി പൂർത്തിയാക്കിയപ്പോൾ, അതേ പ്രോംപ്റ്റുകളിൽ Kimi K3 ടോക്കൺ ബജറ്റ് തീർന്നുപോയതിനാലും ടൈം ഔട്ട് ആയതിനാലും പരാജയപ്പെട്ടു. വിശ്വസനീയവും പൂർണ്ണവുമായ ഉത്തരങ്ങൾ ആവശ്യമുള്ള ഡെവലപ്പർമാർ നേരിടുന്ന ഒരു പ്രായോഗിക പരിമിതിയാണ് ഇത് വെളിപ്പെടുത്തുന്നത്.

ഈ പരീക്ഷണം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

ഇന്റർനെറ്റ് സെർച്ച് ടൂളുകൾ ഉപയോഗിക്കാതെ, ഒരേ ടോക്കൺ പരിധിക്കുള്ളിൽ ഇരുന്ന് രണ്ട് മോഡലുകൾക്കും ഒരേ പ്രോംപ്റ്റുകളാണ് നൽകിയത്. ശാസ്ത്രീയ കണക്കുകൂട്ടലുകളിലും കോഡ് ജനറേഷനിലും സാധാരണയായി ആവശ്യമുള്ള മൾട്ടി-സ്റ്റെപ്പ് റീസണിംഗിലാണ് (multi-step reasoning) ഈ ബെഞ്ച്മാർക്ക് ശ്രദ്ധ കേന്ദ്രീകരിച്ചത്. പ്രൊഡക്ഷനിൽ, ഒരു ഫൈനൽ റിസൾട്ട് നൽകുന്നതിന് മുമ്പ് തന്നെ ടോക്കൺ പരിധി തീർന്നുപോകുന്ന ഒരു മോഡൽ, വർക്ക്ഫ്ലോകൾ തടസ്സപ്പെടുത്തുകയും ഡീബഗ്ഗിംഗ് ജോലി വർദ്ധിപ്പിക്കുകയും ചെയ്തേക്കാം.

മുഖാമുഖം നടന്ന പരീക്ഷണത്തിൽ എന്താണ് സംഭവിച്ചത്

GPT-5.6-SOL

  • മൂന്ന് വെല്ലുവിളികൾക്കും പൂർണ്ണമായ ഉത്തരം നൽകി.
  • ശരിയായ മാത്തമാറ്റിക്സ്, ഫിസിക്സ് ഡെറിവേഷനുകൾ നൽകി.
  • ലോക്കൽ ഇന്റർപ്രെറ്ററിൽ കംപൈൽ ചെയ്ത് പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്ന ഒരു Python സ്ക്രിപ്റ്റ് തയ്യാറാക്കി.
  • ഉദാഹരണ ഔട്ട്‌പുട്ടിൽ ഒരു ടെസ്റ്റ് കേസ് വിട്ടുപോയി, എങ്കിലും അതിന്റെ അടിസ്ഥാന ലോജിക് കൃത്യമായിരുന്നു.

Kimi K3

  • മാത്തമാറ്റിക്സ്, ഫിസിക്സ് പ്രശ്നങ്ങൾക്ക് വ്യക്തമായ പരിഹാരം നൽകുന്നതിൽ പരാജയപ്പെട്ടു.
  • ആവർത്തിച്ച് ടോക്കൺ പരിധിയിൽ എത്തിപ്പെട്ടതിനാൽ, ഒരു നിഗമനത്തിൽ എത്തുന്നതിന് മുമ്പ് തന്നെ റീസണിംഗ് അപൂർണ്ണമായി നിലച്ചു.
  • പ്രോഗ്രാമിംഗ് ടാസ്കിൽ 245 സെക്കൻഡിന് ശേഷം പ്രവർത്തനം നിർത്തി, പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്ന ഒരു കോഡും നൽകിയില്ല.

പ്രായോഗികമായി ഉപയോഗിക്കുന്നവർക്കുള്ള പ്രധാന കാര്യങ്ങൾ

  • റീസണിംഗ് ടോക്കണുകളും ഫൈനൽ ഔട്ട്‌പുട്ടും – Kimi K3 അതിന്റെ ടോക്കൺ ബജറ്റിന്റെ വലിയൊരു ഭാഗം ആന്തരിക ചിന്താ പ്രക്രിയകൾക്കായി (internal thought chains) ഉപയോഗിക്കുന്നു. ബജറ്റ് പരിമിതമായിരിക്കുമ്പോൾ, ഉത്തരം നൽകുന്നതിന് മുമ്പ് തന്നെ മോഡലിന്റെ ടോക്കണുകൾ തീർന്നുപോകുന്നു. ഇത് പെട്ടെന്നുള്ള ഫലങ്ങൾ ആവശ്യമുള്ള വർക്ക്ഫ്ലോകൾക്ക് അനുയോജ്യമല്ല.
  • ലോജിക്കും ടെസ്റ്റിംഗും – റീസണിംഗ് കൃത്യമായി ചെയ്യുന്ന ഒരു മോഡൽ പോലും അനുബന്ധ കാര്യങ്ങളിൽ പിഴവ് വരുത്തിയേക്കാം. GPT-5.6-SOL-ന്റെ തെറ്റായ ടെസ്റ്റ് കേസ്, ജനറേറ്റ് ചെയ്ത വാലിഡേഷൻ കോഡുകൾ മാനുവലായി പരിശോധിക്കേണ്ടതിന്റെ ആവശ്യകത നമ്മെ ഓർമ്മിപ്പിക്കുന്നു.
  • ലേറ്റൻസിയും ഫിനിഷ് റീസണുകളും (finish reasons) പ്രധാനമാണ് – പ്രൊഡക്ഷൻ പൈപ്പ്‌ലൈനുകൾ ഫൈനൽ ഉത്തരം മാത്രമല്ല, മോഡൽ എന്തുകൊണ്ട് പ്രവർത്തനം നിർത്തി (ടോക്കൺ പരിധി, ടൈം ഔട്ട് മുതലായവ), റീസണിംഗിനായി എത്ര ടോക്കണുകൾ ഉപയോഗിച്ചു എന്നിവയും രേഖപ്പെടുത്തേണ്ടതുണ്ട്.

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

ഇത്തരം മാറ്റങ്ങൾ ഉണ്ടാകുന്നത് വരെ, വിശ്വസനീയമായ ഫലങ്ങൾ ആവശ്യമുള്ള ഡെവലപ്പർമാർ, സങ്കീർണ്ണമായ കണക്കുകൂട്ടലുകളോ കോഡ് സിന്തസിസോ ആവശ്യമുള്ള ജോലികൾക്കായി GPT-5.6-SOL പോലുള്ള മോഡലുകളെയായിരിക്കും തിരഞ്ഞെടുക്കുക.

ഓട്ടോമേറ്റഡ് സിസ്റ്റങ്ങൾ നിർമ്മിക്കുന്ന ടീമുകൾക്കായി ഈ ബെഞ്ച്മാർക്ക് ഒരു ലളിതമായ നിയമം അടിവരയിടുന്നു: ഉത്തരത്തിന്റെ കൃത്യതയും, നിങ്ങൾ നിശ്ചയിച്ചിട്ടുള്ള പരിധിക്കുള്ളിൽ നിന്ന് ആ ഉത്തരത്തിൽ എത്താനുള്ള മോഡലിന്റെ കഴിവും ഒരേപോലെ പരിശോധിക്കുക. "ചിന്തിക്കുന്നുണ്ടെങ്കിലും" ഒരിക്കലും ഫലം നൽകാൻ കഴിയാത്ത ഒരു മോഡൽ ഒരു വഴിമുട്ടിപ്പിൽ (dead end) അവസാനിക്കുന്നതിന് തുല്യമാണ്.