Moonshot AI के नए Kimi K3 ने AA-Briefcase बेंचमार्क पर GPT-5.6 को पीछे छोड़ दिया है, जिसमें इसने 1,527 का स्कोर हासिल किया, जबकि GPT-5.6 का स्कोर 1,495 था। यह जीत एक ऐसे प्राइसिंग मॉडल के साथ आती है जो इस 2.8-ट्रिलियन-पैरामीटर वाले ओपन-वेट मॉडल को लॉन्ग-फॉर्म कोडिंग कार्यों के लिए आश्चर्यजनक रूप से सस्ता विकल्प बनाता है।
यह बेंचमार्क क्यों महत्वपूर्ण है
AA-Briefcase अलग-थलग सामान्य ज्ञान के प्रश्नों के बजाय निरंतर, वास्तविक दुनिया के वर्कलोड पर प्रदर्शन को मापता है। उच्च स्कोर का अर्थ है कि एक मॉडल हजारों टोकन तक संदर्भ (context) बनाए रख सकता है, आगे की योजना बना सकता है और कार्य पर केंद्रित रह सकता है - ठीक वैसी ही स्थितियाँ जिनका सामना डेवलपर्स असिस्टेंट, कोड जनरेटर या रिसर्च एड्स बनाते समय करते हैं। GPT-5.6 पर Kimi K3 की बढ़त यह दर्शाती है कि एक ओपन मॉडल अब उन क्षेत्रों में प्रतिस्पर्धा कर सकता है जहाँ पारंपरिक रूप से क्लोज्ड प्रतिद्वंद्वी हावी रहे हैं।
तकनीकी विवरण
- आकार – 2.8 ट्रिलियन पैरामीटर, अब तक जारी किया गया सबसे बड़ा ओपन-वेट मॉडल।
- आर्किटेक्चर – 896 विशेषज्ञों के साथ Stable LatentMoE (Mixture-of-Experts), जिनमें से 16 किसी भी समय सक्रिय होते हैं।
- कॉन्टेक्स्ट विंडो – 1 मिलियन से अधिक टोकन, जो पूरी किताबों या लंबे कोडबेस को रखने के लिए पर्याप्त है।
- अटेंशन – Kimi Delta Attention, एक कस्टम टवीक (tweak) जिसका दावा है कि यह स्केलिंग दक्षता में सुधार करता है।
ये विकल्प मॉडल को "लॉन्ग-होरिज़ोन" (long-horizon) कार्यों को संभालने की क्षमता देते हैं, लेकिन ये कंप्यूट आवश्यकताओं को भी बढ़ाते हैं, जो गति और लागत के आंकड़ों में दिखाई देता है।
ध्यान आकर्षित करने वाली कीमतें
Moonshot टोकन प्राइसिंग को तीन श्रेणियों में विभाजित करता है:
| उपयोग का प्रकार | प्रति 1 मिलियन टोकन लागत |
|---|---|
| इनपुट – कैश मिस | $3.00 |
| इनपुट – कैश हिट | $0.30 |
| आउटपुट | $15.00 |
कंपनी का कहना है कि कोडिंग वर्कलोड में 90% कैश-हिट दर देखी जाती है। यदि यह सच है, तो यह कोडिंग एजेंटों के लिए एक बहुत ही सस्ता विकल्प है।
वे समझौते (trade-offs) जो आप महसूस करेंगे
- गति – मॉडल प्रति सेकंड लगभग 62 टोकन प्रोसेस करता है, जो क्षेत्र के औसत (median) से कम है। एक लंबा प्रॉम्प्ट मिनटों तक रुक सकता है, जो इंटरैक्टिव उपयोग के लिए महत्वपूर्ण है।
- रीज़निंग लागत – Kimi K3 डिफ़ॉल्ट रूप से “max reasoning effort” के साथ चलता है और इसे कम करने के लिए कोई विकल्प नहीं देता है। इसलिए, सरल प्रश्न भी जटिल प्रश्नों की तरह ही टोकन बजट खर्च करते हैं, जिससे नियमित कार्यों के लिए लागत बढ़ जाती है।
- छिपा हुआ टोकन उपयोग – कुछ उपयोगकर्ताओं ने एक बड़े सिस्टम प्रॉम्प्ट की सूचना दी है जिसे मॉडल स्वचालित रूप से इंजेक्ट करता है, जिससे ऐसे टोकन जुड़ जाते हैं जिनका बिल तो लिया जाता है लेकिन वे उपयोगकर्ता के अनुरोध में दिखाई नहीं देते हैं।
इन कारकों का अर्थ है कि व्यावहारिक रूप से धीमी प्रतिक्रिया और उच्च टोकन खपत के कारण हेडलाइन में दिखाई देने वाली कम कीमत का प्रभाव कम हो सकता है।
उपलब्धता और आगे की राह
API आज लाइव है, जिससे डेवलपर्स तुरंत प्रयोग कर सकते हैं। मॉडल वेट्स स्वयं 27 जुलाई को जारी किए जाएंगे, जिसके बाद सेल्फ-होस्टिंग संभव हो जाएगी। तब तक, उपयोगकर्ताओं को Moonshot की होस्टेड सेवा पर निर्भर रहना होगा और संबंधित लेटेंसी और प्राइसिंग स्ट्रक्चर को स्वीकार करना होगा।
क्लोज्ड-मॉडल कैंप का प्रतिवाद
उभरता हुआ निष्कर्ष
मुख्य निष्कर्ष क्लोज्ड मॉडल और ओपन मॉडल के बीच घटती दूरी है। Kimi K3 यह साबित करता है कि ओपन-वेट मॉडल जटिल, लॉन्ग-होरिज़ोन कार्यों को संभाल सकते हैं।
