Moonshot AI-യുടെ പുതിയ Kimi K3, AA-Briefcase ബെഞ്ച്മാർക്കിൽ GPT-5.6-നെ മറികടന്നു; GPT-5.6 നേടിയ 1,495 പോയിന്റുകൾക്ക് বিপরীতে Kimi K3 1,527 പോയിന്റുകൾ നേടി. 2.8 ട്രില്യൺ പാരാമീറ്ററുകളുള്ള ഈ ഓപ്പൺ-വെയ്റ്റ് (open-weight) മോഡൽ, ദീർഘമായ കോഡിംഗ് ജോലികൾക്ക് (long-form coding tasks) അപ്രതീക്ഷിതമായി കുറഞ്ഞ ചിലവുള്ള ഒരു ഓപ്ഷനായി മാറുന്ന തരത്തിലുള്ള ഒരു പ്രൈസിംഗ് മോഡലോടെയാണ് ഈ വിജയം വരുന്നത്.
എന്തുകൊണ്ടാണ് ഈ ബെഞ്ച്മാർക്ക് പ്രധാനമാകുന്നത്
ഒറ്റപ്പെട്ട ചോദ്യങ്ങൾക്ക് (trivia questions) പകരം, തുടർച്ചയായതും യഥാർത്ഥ ലോകത്തെ ജോലിഭാരങ്ങളും (real-world workloads) അടിസ്ഥാനമാക്കിയാണ് AA-Briefcase പ്രകടനം അളക്കുന്നത്. ഉയർന്ന സ്കോർ എന്നാൽ ഒരു മോഡലിന് സന്ദർഭങ്ങൾ (context) നിലനിർത്താനും, മുൻകൂട്ടി പ്ലാൻ ചെയ്യാനും, ആയിരക്കണക്കിന് ടോക്കണുകൾക്ക് ശേഷവും ലക്ഷ്യത്തിൽ നിന്ന് വ്യതിചലിക്കാതെ പ്രവർത്തിക്കാനും കഴിയുമെന്നാണ് അർത്ഥം. അസിസ്റ്റന്റുകൾ, കോഡ് ജനറേറ്ററുകൾ അല്ലെങ്കിൽ റിസർച്ച് എയ്ഡുകൾ എന്നിവ നിർമ്മിക്കുമ്പോൾ ഡെവലപ്പർമാർ നേരിടുന്ന സാഹചര്യങ്ങളാണിവ. GPT-5.6-നെക്കാൾ Kimi K3-നുള്ള മുൻതൂക്കം, ക്ലോസ്ഡ് മോഡലുകൾ (closed models) പരമ്പരാഗതമായി ആധിപത്യം പുലർത്തിയിരുന്ന മേഖലകളിൽ ഇപ്പോൾ ഒരു ഓപ്പൺ മോഡലിനും മത്സരിക്കാൻ കഴിയുമെന്ന് കാണിക്കുന്നു.
സാങ്കേതിക വശങ്ങൾ
- Size – 2.8 ട്രില്യൺ പാരാമീറ്ററുകൾ, ഇതുവരെ പുറത്തിറങ്ങിയതിൽ വെച്ച് ഏറ്റവും വലിയ ഓപ്പൺ-വെയ്റ്റ് മോഡൽ.
- Architecture – 896 എക്സ്പെർട്ടുകളുള്ള Stable LatentMoE (Mixture-of-Experts), ഇതിൽ ഏത് നിമിഷവും 16 എക്സ്പെർട്ടുകൾ സജീവമായിരിക്കും.
- Context window – 1 മില്യൺ ടോക്കണുകളിൽ കൂടുതൽ, മുഴുവൻ പുസ്തകങ്ങളോ വലിയ കോഡ് ബേസുകളോ ഉൾക്കൊള്ളാൻ ഇത് മതിയാകും.
- Attention – Kimi Delta Attention, സ്കെയിലിംഗ് കാര്യക്ഷമത (scaling efficiency) മെച്ചപ്പെടുത്താൻ ഉപയോഗിക്കുന്ന ഒരു കസ്റ്റം ക്രമീകരണം.
ഈ തിരഞ്ഞെടുപ്പുകൾ "ലോംഗ്-ഹൊറൈസൺ" (long-horizon) ജോലികൾ കൈകാര്യം ചെയ്യാനുള്ള ശേഷി മോഡലിന് നൽകുന്നുണ്ടെങ്കിലും, അവ കമ്പ്യൂട്ട് ആവശ്യകതകളും (compute requirements) വർദ്ധിപ്പിക്കുന്നു; ഇത് വേഗതയിലും ചിലവിലും പ്രതിഫലിക്കുന്നു.
ശ്രദ്ധേയമായ പ്രൈസിംഗ്
Moonshot ടോക്കൺ പ്രൈസിംഗിനെ മൂന്ന് വിഭാഗങ്ങളായി തിരിച്ചിരിക്കുന്നു:
| ഉപയോഗ രീതി (Usage type) | 1 മില്യൺ ടോക്കണുകൾക്കുള്ള ചിലവ് |
|---|---|
| Input – cache miss | $3.00 |
| Input – cache hit | $0.30 |
| Output | $15.00 |
കോഡിംഗ് ജോലികളിൽ 90% കാഷെ-ഹിറ്റ് (cache-hit) നിരക്ക് കാണുന്നുണ്ടെന്ന് കമ്പനി പറയുന്നു. ഇത് സത്യമാണെങ്കിൽ, കോഡിംഗ് ഏജന്റുകൾക്ക് (coding agents) വളരെ കുറഞ്ഞ ചിലവുള്ള ഒരു ഓപ്ഷനാണിത്.
നിങ്ങൾ അനുഭവിക്കേണ്ടി വരുന്ന വിട്ടുവീഴ്ചകൾ (Trade-offs)
- Speed – മോഡൽ സെക്കൻഡിൽ ഏകദേശം 62 ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യുന്നു, ഇത് ശരാശരിയേക്കാൾ കുറവാണ്. ഒരു നീളമുള്ള പ്രോംപ്റ്റ് (prompt) പ്രോസസ്സ് ചെയ്യാൻ മിനിറ്റുകൾ എടുത്തേക്കാം, ഇത് ഇന്ററാക്ടീവ് ഉപയോഗത്തെ ബാധിക്കും.
- Reasoning cost – Kimi K3 ഡിഫോൾട്ടായി "മാക്സ് റീസണിംഗ് എഫർട്ട്" (max reasoning effort) രീതിയിലാണ് പ്രവർത്തിക്കുന്നത്, ഇത് കുറയ്ക്കാൻ മറ്റ് മാർഗങ്ങളില്ല. അതിനാൽ ലളിതമായ ചോദ്യങ്ങൾക്കും സങ്കീർണ്ണമായവയ്ക്ക് തുല്യമായ ടോക്കൺ ബജറ്റ് ചിലവാകുന്നു, ഇത് ദൈനംദിന ജോലികളുടെ ചിലവ് വർദ്ധിപ്പിക്കുന്നു.
- Hidden token usage – മോഡൽ സ്വയം ചേർക്കുന്ന വലിയൊരു സിസ്റ്റം പ്രോംപ്റ്റ് (system prompt) ഉണ്ടെന്ന് ചില ഉപയോക്താക്കൾ റിപ്പോർട്ട് ചെയ്യുന്നു; ഇത് ഉപയോക്താവിന്റെ റിക്വസ്റ്റിൽ കാണുന്നില്ലെങ്കിലും ബില്ലിംഗിൽ ടോക്കണുകൾ കൂട്ടിച്ചേർക്കപ്പെടുന്നു.
ഈ ഘടകങ്ങൾ കാരണം, പരസ്യപ്പെടുത്തിയ കുറഞ്ഞ വില പ്രായോഗികമായി സാവധാനത്തിലുള്ള പ്രവർത്തനവും ഉയർന്ന ടോക്കൺ ഉപയോഗവും കാരണം ഇല്ലാതാകാൻ സാധ്യതയുണ്ട്.
ലഭ്യതയും ഭാവിയിലേക്കുള്ള പാതയും
ഡെവലപ്പർമാർക്ക് ഉടൻ തന്നെ പരീക്ഷിച്ചു നോക്കാൻ സാധിക്കുന്ന രീതിയിൽ API ഇന്ന് ലഭ്യമാണ്. ജൂലൈ 27-ന് മോഡൽ വെയ്റ്റുകൾ (model weights) പുറത്തിറക്കും, അതിനുശേഷം സെൽഫ്-ഹോസ്റ്റിംഗ് (self-hosting) സാധ്യമാകും. അതുവരെ, ഉപയോക്താക്കൾക്ക് Moonshot-ന്റെ ഹോസ്റ്റഡ് സർവീസിനെ ആശ്രയിക്കേണ്ടി വരും, അതോടൊപ്പം അതിന്റെ ലേറ്റൻസിയും (latency) പ്രൈസിംഗ് രീതിയും അംഗീകരിക്കേണ്ടതുമാണ്.
ക്ലോസ്ഡ് മോഡൽ വിഭാഗത്തിന്റെ മറുവാദം
പ്രധാന പാഠം
ക്ലോസ്ഡ് മോഡലുകളും ഓപ്പൺ മോഡലുകളും തമ്മിലുള്ള അകലം കുറഞ്ഞുവരുന്നു എന്നതാണ് ഇതിലെ പ്രധാന കാര്യം. സങ്കീർണ്ണവും ദീർഘവുമായ ജോലികൾ കൈകാര്യം ചെയ്യാൻ ഓപ്പൺ-വെയ്റ്റ് മോഡലുകൾക്ക് കഴിയുമെന്ന് Kimi K3 തെളിയിക്കുന്നു.
