Moonshot AI च्या नवीन Kimi K3 ने AA-Briefcase बेंचमार्कवर GPT-5.6 ला मागे टाकले असून, GPT-5.6 च्या 1,495 गुणांच्या तुलनेत 1,527 गुण मिळवले आहेत. हे यश अशा किंमत मॉडेलसोबत (pricing model) आले आहे, ज्यामुळे हे 2.8 ट्रिलियन पॅरामीटर असलेले open-weight मॉडेल लांब कोडिंग कामांसाठी (long-form coding tasks) आश्चर्यकारकपणे स्वस्त पर्याय ठरते.

हा बेंचमार्क का महत्त्वाचा आहे

AA-Briefcase केवळ विखुरलेल्या सामान्य प्रश्नांऐवजी (trivia questions) सतत चालणाऱ्या, वास्तविक जगातील कामांवरील (real-world workloads) कामगिरी मोजते. जास्त स्कोरचा अर्थ असा आहे की, मॉडेल हजारो टोकन्समध्ये संदर्भ (context) लक्षात ठेवू शकते, आगाऊ नियोजन करू शकते आणि कामावर लक्ष केंद्रित करू शकते – नेमक्या त्याच परिस्थिती ज्यांचा सामना डेव्हलपर्सना असिस्टंट्स, कोड जनरेटर्स किंवा रिसर्च एड्स तयार करताना करावा लागतो. GPT-5.6 वर Kimi K3 चे वर्चस्व हे दर्शवते की, जिथे पारंपारिकपणे क्लोज्ड मॉडेल्सचे (closed rivals) वर्चस्व होते, तिथे आता एक ओपन मॉडेल स्पर्धा करू शकते.

तांत्रिक चित्र

  • Size – 2.8 ट्रिलियन पॅरामीटर्स, आजवर रिलीज केलेले सर्वात मोठे open-weight मॉडेल.
  • Architecture – 896 एक्सपर्ट्ससह Stable LatentMoE (Mixture-of-Experts), ज्यापैकी कोणतीही वेळ 16 एक्सपर्ट्स सक्रिय असतात.
  • Context window – 1 दशलक्ष (1 million) पेक्षा जास्त टोकन्स, जे संपूर्ण पुस्तके किंवा मोठे कोडबेस साठवण्यासाठी पुरेसे आहेत.
  • Attention – Kimi Delta Attention, स्केलिंग कार्यक्षमता सुधारण्यासाठी वापरलेला एक कस्टम बदल (tweak).

या निवडींमुळे मॉडेलला “long-horizon” कामे हाताळण्याची क्षमता मिळते, परंतु यामुळे संगणकीय गरजा (compute requirements) देखील वाढतात, ज्याचा परिणाम वेग आणि खर्चाच्या आकडेवारीवर दिसून येतो.

लक्षवेधी किंमत (Pricing)

Moonshot ने टोकन किंमत तीन भागांमध्ये विभागली आहे:

वापराचा प्रकार (Usage type) प्रति 1 दशलक्ष (1M) टोकन्सचा खर्च
Input – cache miss $3.00
Input – cache hit $0.30
Output $15.00

कंपनीचे म्हणणे आहे की कोडिंग वर्कलोडमध्ये 90% कॅश-हिट (cache-hit) दर पाहायला मिळतो. जर हे खरे असेल, तर कोडिंग एजंट्ससाठी हा एक अत्यंत स्वस्त पर्याय आहे.

तुम्हाला जाणवणारे तडजोडी (Trade-offs)

  • Speed – मॉडेल प्रति सेकंद सुमारे 62 टोकन्स प्रोसेस करते, जे क्षेत्रातील सरासरीपेक्षा (median) कमी आहे. एक मोठा प्रॉम्प्ट (prompt) प्रोसेस व्हायला काही मिनिटे लागू शकतात, जे इंटरअॅक्टिव्ह वापरासाठी महत्त्वाचे आहे.
  • Reasoning cost – Kimi K3 बाय डिफॉल्ट “max reasoning effort” सह चालते आणि ती कमी करण्यासाठी कोणताही पर्याय (knob) उपलब्ध नाही. त्यामुळे साध्या प्रश्नांसाठी देखील तितकेच टोकन बजेट खर्च होते जेणेकरून जटिल प्रश्नांसाठी लागते, ज्यामुळे दैनंदिन कामांचा खर्च वाढतो.
  • Hidden token usage – काही वापरकर्त्यांनी असे नमूद केले आहे की मॉडेल आपोआप एक मोठा 'सिस्टम प्रॉम्प्ट' (system prompt) समाविष्ट करते, ज्यामुळे अतिरिक्त टोकन्स खर्च होतात, जे बिलिंगमध्ये येतात पण वापरकर्त्याच्या विनंतीमध्ये दिसत नाहीत.

या घटकांमुळे, प्रत्यक्ष वापरामध्ये कमी किंमत ही संथ वेग आणि जास्त टोकन वापरामुळे भरून निघू शकते (offset होऊ शकते).

उपलब्धता आणि पुढील वाटचाल

API आज लाइव्ह आहे, ज्यामुळे डेव्हलपर्स त्वरित प्रयोग करू शकतात. मॉडेल वेट्स (model weights) २७ जुलै रोजी रिलीज केले जातील, त्यानंतर सेल्फ-होस्टिंग करणे शक्य होईल. तोपर्यंत, वापरकर्त्यांना Moonshot च्या होस्टेड सेवेवर अवलंबून राहावे लागेल आणि त्यासोबत येणारा लॅटन्सी (latency) आणि किंमत संरचना स्वीकारावी लागेल.

क्लोज्ड-मॉडेल गटाचा प्रतिवाद

समोर येणारा मुख्य निष्कर्ष

मुख्य निष्कर्ष म्हणजे क्लोज्ड मॉडेल्स आणि ओपन मॉडेल्समधील अंतर कमी होत आहे. Kimi K3 हे सिद्ध करते की open-weight मॉडेल्स जटिल आणि दीर्घकालीन (long-horizon) कामे हाताळू शकतात.