OpenAI തങ്ങളുടെ GPT-5.6 Sol മോഡൽ ARC-AGI-3 ലോജിക് ബെഞ്ച്മാർക്കിൽ 38.3 ശതമാനം സ്കോർ നേടിയതായി പ്രഖ്യാപിച്ചു. ഇത് Anthropic-ന്റെ Claude Opus 5 (30.2 ശതമാനം) എന്ന മോഡലിനേക്കാൾ കൂടുതലാണ്. എന്നാൽ, ഔദ്യോഗിക ടെസ്റ്റ് ഹാർനസ് (test harness) ഉപയോഗിച്ച് പരിശോധിച്ചപ്പോൾ ഇതേ മോഡൽ 7.8 ശതമാനം മാത്രമാണ് സ്കോർ ചെയ്തത് എന്നത് വലിയൊരു സാങ്കേതിക തർക്കത്തിന് വഴിവെച്ചു.
എന്തുകൊണ്ടാണ് ARC-AGI-3 സ്കോർ പ്രധാനമാകുന്നത്
മുൻകൂട്ടി പഠിച്ച പാറ്റേണുകളെ ആശ്രയിക്കുന്നതിന് പകരം, പുതിയതും യുക്തിസഹവുമായ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള ഒരു മോഡലിന്റെ കഴിവിനെയാണ് ARC-AGI-3 പരിശോധിക്കുന്നത്. ഗവേഷകർ ഈ സ്കോറുകളെ "ജനറൽ ഇന്റലിജൻസ്" (general-intelligence) പുരോഗതിയുടെ സൂചകമായി കാണുന്നു. അതിനാൽ, പത്ത് പോയിന്റുകളുടെ ഈ മുന്നേറ്റം മനുഷ്യനെപ്പോലെ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള വലിയൊരു ചുവടുവെപ്പായി കണക്കാക്കപ്പെടുന്നു. ഈ കാരണത്താലാണ് ഈ വാർത്ത AI ലോകത്ത് വലിയ ചർച്ചകൾക്ക് ഇടയാക്കിയത്.
മറഞ്ഞിരിക്കുന്ന ഘടകങ്ങൾ: Retained Reasoning, Compaction
OpenAI തങ്ങളുടെ GPT-5.6 Sol മോഡലിനെ പൊതുവായ ടെസ്റ്റ് ഹാർനസ് ഉപയോഗിച്ചല്ല വിലയിരുത്തിയത്. പകരം, അവർ തങ്ങളുടെ സ്വന്തം Responses API-യും അതിലെ രണ്ട് പ്രത്യേക ഓപ്ഷനുകളും ഉപയോഗിച്ചു:
- Retained Reasoning – ഓരോ ഘട്ടവും വെവ്വേറെയായി കാണുന്നതിന് പകരം, മോഡലിന്റെ ചിന്താപ്രക്രിയയുടെ (chain of thought) തുടർച്ച നിലനിർത്തുന്നു. ഇത് ഇടയിലുള്ള യുക്തികൾ നഷ്ടപ്പെടുന്നത് തടയുന്നു.
- Compaction – മുൻപത്തെ വിവരങ്ങൾ ഒഴിവാക്കുന്നതിന് പകരം അവയെ സംഗ്രഹിച്ചുകൊണ്ട് (compress) സൂക്ഷിക്കുന്നു. ഇത് മോഡലിന് കൂടുതൽ വിവരങ്ങൾ ആധാരമാക്കി പ്രവർത്തിക്കാൻ സഹായിക്കുന്നു.
ഈ സെറ്റിംഗുകൾ ഉപയോഗിക്കുമ്പോൾ, മോഡലിന് കൂടുതൽ സങ്കീർണ്ണമായ കാര്യങ്ങൾ ചെയ്യാനും മുൻപത്തെ നിഗമനങ്ങൾ വീണ്ടും ഉപയോഗിക്കാനും സാധിക്കുന്നു, ഇത് അതിന്റെ പ്രകടനം വർദ്ധിപ്പിക്കുന്നു. എന്നാൽ ഓരോ പ്രവൃത്തിക്ക് ശേഷവും യുക്തികൾ ഒഴിവാക്കുന്ന ഔദ്യോഗിക ഹാർനസിൽ, ഇതേ മോഡലിന്റെ സ്കോർ 7.8 ശതമാനമായി കുറയുകയും Claude Opus 5-നേക്കാൾ പിന്നിലാവുകയും ചെയ്യുന്നു.
ബെഞ്ച്മാർക്ക് എന്നത് വെറും ന്യൂറൽ വെയ്റ്റുകളെ (neural weights) മാത്രമല്ല, മറിച്ച് മുഴുവൻ ഇൻഫറൻസ് പൈപ്പ്ലൈനിനെയും (inference pipeline) അളക്കേണ്ടതാണെന്ന് OpenAI വാദിക്കുന്നു. ആ കാഴ്ചപ്പാടിൽ, കോൺടെക്സ്റ്റ് നിലനിർത്താനും സംഗ്രഹിക്കാനും സഹായിക്കുന്ന API ലോജിക് അഥവാ "wrapper" എന്നത് വിലയിരുത്തപ്പെടുന്ന സിസ്റ്റത്തിന്റെ തന്നെ ഭാഗമാണ്.
നീതിയുക്തതയെക്കുറിച്ചുള്ള തർക്കം
ഈ ബെഞ്ച്മാർക്കിന് സ്പോൺസർഷിപ്പ് നൽകുന്ന ARC Prize-ന്റെ സഹസ്ഥാപകൻ ഫ്രാൻസ്വാ ഷോലെ (François Chollet) ഈ വിഷയത്തിൽ അഭിപ്രായപ്പെട്ടു. ഒരു ബെഞ്ച്മാർക്കിനെ "പരിഹരിക്കാൻ" വേണ്ടി മാത്രം നിർമ്മിച്ച കസ്റ്റം ഹാർനസുകളും, ഏതൊരു ഉപയോക്താവിനും ഉപയോഗിക്കാവുന്ന ജനറൽ പർപ്പസ് API സെറ്റിംഗുകളും തമ്മിലുള്ള വ്യത്യാസം അദ്ദേഹം ചൂണ്ടിക്കാട്ടി. പഴയ OpenAI ശൈലിയിലുള്ള completions API ആണ് യഥാർത്ഥ ARC Prize ടെസ്റ്റിംഗ് എൻവയോൺമെന്റിൽ ഉപയോഗിച്ചിരുന്നതെന്നും, അത് ആന്ത്രോപിക് (Anthropic)-ന്റെ Claude API-യിൽ ലഭ്യമായ നൂതന ഫീച്ചറുകൾ ഇല്ലാത്തതാണെന്നും ഷോലെ നിരീക്ഷിച്ചു. ഈ വ്യത്യാസം മുൻപത്തെ റൗണ്ടുകളിൽ OpenAI-ക്ക് തിരിച്ചടിയായേക്കാം.
എന്നാൽ ഈ താരതമ്യം അസാധുവാണെന്ന് അദ്ദേഹം പ്രഖ്യാപിച്ചില്ല. കൃത്യമായ സെറ്റിംഗുകളും അതുമായി ബന്ധപ്പെട്ട ചിലവുകളും വെളിപ്പെടുത്തിയാൽ ഇത്തരം താരതമ്യങ്ങൾ സ്വീകാര്യമാണെന്ന് ഷോലെ പറഞ്ഞു. സുതാര്യത ഉണ്ടെങ്കിൽ മാത്രമേ ഈ വ്യത്യാസം മോഡലിന്റെ ഘടന (architecture) മൂലമാണോ അതോ എഞ്ചിനീയറിംഗ് തന്ത്രങ്ങൾ മൂലമാണോ എന്ന് സമൂഹത്തിന് വിലയിരുത്താൻ കഴിയൂ എന്ന് അദ്ദേഹം വാദിച്ചു.
ആര് ജയിക്കുന്നു, ആര് തോൽക്കുന്നു
ഉയർന്ന സ്കോർ അംഗീകരിക്കപ്പെട്ടാൽ, OpenAI-ക്ക് പൊതുജനങ്ങളുടെ ഇടയിൽ വലിയൊരു അംഗീകാരവും ബിസിനസ്സ് കരാറുകളിൽ കൂടുതൽ കരുത്തും ലഭിക്കും. അതേസമയം, അധിക എഞ്ചിനീയറിംഗ് പാളികൾ ഇല്ലാതെ തന്നെ തങ്ങളുടെ ആർക്കിടെക്ചർ കൂടുതൽ കാര്യക്ഷമമാണെന്ന് തെളിയിക്കാൻ Claude ടീമിന് സാധിക്കും.
നിക്ഷേപങ്ങൾക്കായി ബെഞ്ച്മാർക്ക് റാങ്കിംഗുകളെ ആശ്രയിക്കുന്ന ഗവേഷകർക്കും ഡെവലപ്പർമാർക്കും ഈ സംഭവം ആശങ്കയുണ്ടാക്കിയേക്കാം. മോഡലുകൾ വലുതാകുന്തോറും, അവയുടെ ഇൻഫറൻസ് നിയന്ത്രിക്കുന്ന സോഫ്റ്റ്വെയറുകൾ നിർണ്ണായകമായേക്കാം എന്ന് ഈ സംഭവം കാണിച്ചുതരുന്നു. മികച്ച അടിത്തറയുള്ള മോഡലുകൾ ഇല്ലാതെ തന്നെ, കുറഞ്ഞ ചിലവിൽ മികച്ച ഇൻഫറൻസ് സ്റ്റാക്കുകൾ (inference stacks) നൽകുന്ന കമ്പനികൾക്ക് ഉയർന്ന സ്കോറുകൾ സ്വന്തമാക്കാൻ സാധിക്കും.
ARC-AGI-3-നും മറ്റ് ബെഞ്ച്മാർക്കുകൾക്കും ഇനി എന്ത് സംഭവിക്കും?
ഈ തർക്കം കാരണം, അനുവദനീയമായ ഇൻഫറൻസ് കോൺഫിഗറേഷനുകളെക്കുറിച്ച് (inference configurations) കർശനമായ നിയമങ്ങൾ കൊണ്ടുവരാൻ ARC Prize സംഘാടകർ നിർബന്ധിതരാകും. ഇതിനായി താഴെ പറയുന്ന കാര്യങ്ങൾ ചെയ്തേക്കാം:
- ഔദ്യോഗിക ഹാർനസ് മാത്രം ഉപയോഗിച്ചുള്ള പ്രകടനം കാണിക്കുന്ന ഒരു "ബേസ്ലൈൻ" (baseline) സ്കോർ പ്രസിദ്ധീകരിക്കുക.
- അധിക സെറ്റിംഗുകൾ ഉപയോഗിക്കുമ്പോൾ ഉണ്ടാകുന്ന ചിലവ് വിശകലനം സമർപ്പിക്കാൻ പങ്കാളികളോട് ആവശ്യപ്പെടുക. ഇതിലൂടെ ഉയർന്ന സ്കോർ ലഭിക്കാൻ എത്രത്തോളം അധിക കമ്പ്യൂട്ട് പവർ അല്ലെങ്കിൽ എഞ്ചിനീയറിംഗ് ആവശ്യമായി വരുന്നു എന്ന് വിലയിരുത്താം.
- കോൺടെക്സ്റ്റ് മാനേജ്മെന്റ് ഫീച്ചറുകൾ മികച്ച രീതിയിൽ ഉപയോഗിക്കുന്നവർക്ക് പ്രത്യേക പരിഗണന നൽകുന്ന ഒരു "സിസ്റ്റം-ലെവൽ" (system-level) വിഭാഗം ഉൾപ്പെടുത്തുക.
ഇത്തരം നീക്കങ്ങൾ മോഡലിന്റെ യഥാർത്ഥ കഴിവും എഞ്ചിനീയറിംഗ് ഒപ്റ്റിമൈസേഷനും തമ്മിലുള്ള വ്യത്യാസം വ്യക്തമാക്കാൻ സഹായിക്കും, ഇത് ഭാവിയിലെ താരതമ്യങ്ങൾ എളുപ്പമാക്കും.
എതിർവാദം: ബെഞ്ച്മാർക്കുകൾ യഥാർത്ഥ ലോകത്തെ ഉപയോഗത്തെ പ്രതിഫലിപ്പിക്കണം
കേവലം "റോ-മോഡൽ" (raw-model) മാത്രം പരിശോധിക്കുന്ന രീതി പ്രായോഗികമല്ലെന്ന് ഒരു വിഭാഗം വാദിക്കുന്നു. യഥാർത്ഥ ഉപയോഗത്തിൽ (production), ഡെവലപ്പർമാർ ലാംഗ്വേജ് മോഡലുകളിൽ കാഷിംഗ് (caching), കോൺടെക്സ്റ്റ് സംഗ്രഹം (context summarisation) തുടങ്ങിയവ സ്ഥിരമായി ഉപയോഗിക്കാറുണ്ട്. ഒരു ബെഞ്ച്മാർക്കിന്റെ ലക്ഷ്യം പ്രായോഗിക ഉപയോഗക്ഷമത പ്രവചിക്കുക എന്നതാണെങ്കിൽ, അത്തരം ഒപ്റ്റിമൈസേഷനുകളെ അത് അനുവദിക്കുകയോ പ്രോത്സാഹിപ്പിക്കുകയോ വേണം. ആ കാഴ്ചപ്പാടിൽ, OpenAI-യുടെ Retained Reasoning, Compaction എന്നിവ ഏതൊരു എതിരാളിക്കും ഉപയോഗിക്കാവുന്നതും എന്നാൽ പരസ്യമായി രേഖപ്പെടുത്തേണ്ടതുമായ നിയമാനുസൃതമായ ടൂളുകളാണ്.
ഒരു പൊതുവായ അടിസ്ഥാനം ഇല്ലാതെ, സ്കോറുകൾ മാറിക്കൊണ്ടിരിക്കുന്ന ഒരു ലക്ഷ്യമായി മാറുമെന്നും ഇത് ബെഞ്ച്മാർക്കിന്റെ ഒരു വസ്തുനിഷ്ഠമായ മാനദണ്ഡം എന്ന പങ്ക് ഇല്ലാതാക്കുമെന്നും വിമർശകർ വാദിക്കുന്നു. ഇക്കോളജിക്കൽ വാലിഡിറ്റിയും (ecological validity - യഥാർത്ഥ ഉപയോഗങ്ങളെ പ്രതിഫലിപ്പിക്കുന്നത്) മെത്തഡോളജിക്കൽ പ്യൂരിറ്റിയും (methodological purity - മോഡലിനെ വേർതിരിച്ചറിയുന്നത്) തമ്മിലുള്ള സംഘർഷമാണ് നിലവിലെ വിവാദങ്ങൾക്ക് ആക്കം കൂട്ടുന്നത്.
പ്രധാന കാര്യങ്ങൾ
GPT-5.6 Sol അവകാശവാദം AI മൂല്യനിർണ്ണയത്തിൽ വളർന്നുവരുന്ന ഒരു വിഭജനത്തെ ചൂണ്ടിക്കാണിക്കുന്നു: മോഡലിന്റെ സ്വാഭാവിക കഴിവുകളും അത് പുറത്തുകൊണ്ടുവരുന്ന എഞ്ചിനീയറിംഗ് ഇക്കോസിസ്റ്റവും തമ്മിലുള്ള വ്യത്യാസം. ഇൻഫറൻസ് സെറ്റിംഗുകളെക്കുറിച്ചും അവയുടെ ചിലവിനെക്കുറിച്ചുമുള്ള പൂർണ്ണമായ വിവരങ്ങൾ ആവശ്യപ്പെടുന്നിടത്തോളം കാലം, ജനറൽ ഇന്റലിജൻസിലേക്കുള്ള പുരോഗതിയെക്കുറിച്ചുള്ള നമ്മുടെ കാഴ്ചപ്പാടിനെ അവ്യക്തമാക്കുന്നതിന് പകരം ഈ സംവാദം കൂടുതൽ തീവ്രമാക്കിക്കൊണ്ടിരിക്കും.
