Kimi K3 का API कागज़ पर सस्ता दिखता है, लेकिन छिपे हुए शुल्क और तकनीकी विवरणों की कमी इसे हेडलाइन में दिए गए आंकड़ों की तुलना में कहीं अधिक महंगा बना सकती है।

प्रचार में क्या छूट गया है

Moonshot AI की लॉन्च सामग्री एक 2.8 ट्रिलियन-पैरामीटर वाले मॉडल का दावा करती है जो "सस्ता" और "ओपन" है। प्रेस विज्ञप्ति में जल्द ही डाउनलोड करने योग्य weights देने का वादा भी किया गया है। लेकिन इनमें से कोई भी दावा टिकता नहीं है।

  • Weights उपलब्ध नहीं हैं – Moonshot ने पब्लिक चेकपॉइंट के लिए 27 जुलाई 2026 की समयसीमा तय की है। तब तक उपयोगकर्ताओं को होस्टेड API का ही उपयोग करना होगा, इसलिए "ओपन-सोर्स" का वादा कुछ भी उपयोगी प्रदान नहीं करता है।
  • 2.8 T पैरामीटर सभी सक्रिय नहीं हैं – यह संख्या आर्किटेक्चर की कुल क्षमता को दर्शाती है। K3 का Mixture-of-Experts डिज़ाइन प्रत्येक टोकन को 896 एक्सपर्ट सब-नेटवर्क्स में से 16 के माध्यम से रूट करता है। Moonshot ने यह नहीं बताया है कि एक अनुरोध (request) के लिए कितने पैरामीटर चलते हैं, जिससे मेमोरी और कंप्यूट का अनुमान लगाना असंभव हो जाता है।

वह मूल्य निर्धारण जो अच्छा दिखता है – जब तक आप शब्दों की गिनती न कर लें

प्रकाशित दरें:

  • Cache-hit इनपुट: $0.30 प्रति 1 मिलियन टोकन
  • Uncached इनपुट: $3.00 प्रति 1 मिलियन टोकन
  • आउटपुट: $15.00 प्रति 1 मिलियन टोकन

वे दरें मामूली लगती हैं, लेकिन वे टोकन वॉल्यूम को नज़रअंदाज़ करती हैं।

एक हालिया परीक्षण में K3 के आउटपुट को 130 मिलियन टोकन पाया गया, जो समान कार्यों पर अन्य प्रमुख मॉडलों द्वारा उत्पादित 63 मिलियन टोकन से दोगुने से भी अधिक है। मॉडल की अधिक शब्दकता (verbosity) सीधे तौर पर आउटपुट बिल को बढ़ा देती है—दोगुने शब्दों का मतलब है दोगुना खर्च। कोड जनरेशन, निबंध, या चैट एजेंटों के लिए, $15 प्रति मिलियन-टोकन की दर खर्च पर हावी हो सकती है।

विभिन्न उपयोगकर्ताओं के लिए इसका क्या अर्थ है

डेवलपर्स और शोधकर्ता (Researchers)

यदि आप कोडिंग सहायता या डेटा-संचालित शोध के लिए K3 का परीक्षण करते हैं, तो टोकन आउटपुट पर सख्त सीमा (hard caps) लगा दें। एक A/B टेस्ट, जो K3 की तुलना समान आउटपुट सीमाओं वाले बेसलाइन मॉडल से करता है, यह दिखाएगा कि उच्च टोकन उपयोग मॉडल के कारण है या प्रॉम्प्ट डिज़ाइन के कारण।

बजट के प्रति सचेत टीमें

Cache-hit छूट केवल तभी लागू होती है जब एक ही इनपुट दोहराया जाता है। अधिक अनुरोधों को $0.30 वाली श्रेणी में लाने के लिए स्थिर प्रॉम्प्ट प्रीफिक्स (prompt prefixes) तैयार करें जो समान इनपुट स्ट्रिंग्स उत्पन्न करते हों; यह केवल अत्यधिक दोहराव वाले वर्कलोड (जैसे, टेम्पलेटेड क्वेरीज़) के लिए काम करता है। अधिकांश विविध इनपुट $3.00 की uncached दर पर वापस आ जाएंगे।

सेल्फ-होस्टिंग पर विचार करने वाली कंपनियाँ

चेकपॉइंट रिलीज़ का इंतज़ार करना बुद्धिमानी है। मॉडल को होस्ट करने से प्रति-टोकन शुल्क समाप्त हो जाता है, लेकिन इसमें अज्ञात लाइसेंसिंग और इंफ्रास्ट्रक्चर लागत जुड़ जाती है। जब तक weights सार्वजनिक नहीं हो जाते, तब तक होस्टेड API ही एकमात्र वास्तविक विकल्प बना हुआ है।

प्रोडक्शन एनवायरनमेंट (Production environments)

केवल इसलिए स्विच न करें क्योंकि हेडलाइन कीमत प्रतिद्वंद्वियों से कम लगती है। प्रति टोकन लागत के बजाय, लंबे उत्तरों से होने वाले छिपे हुए ओवरहेड सहित प्रति पूर्ण कार्य लागत (cost per completed task) को मापने वाला एक पायलट चलाएं। तभी आप निर्णय ले सकते हैं कि क्या K3 वास्तव में पैसे बचाता है।

आगे क्या देखना है

  • 27 जुलाई 2026 चेकपॉइंट रिलीज़ – उस तारीख को weights रिलीज़ होने वाले हैं।
  • एक्टिव-पैरामीटर प्रकटीकरण (disclosure) – यह जानना कि प्रति टोकन 2.8 T में से कितने पैरामीटर चलते हैं, उपयोगकर्ताओं को हार्डवेयर का सटीक आकार निर्धारित करने में मदद करेगा।

निष्कर्ष (Bottom line)

K3 की विज्ञापित $15 प्रति मिलियन-टोकन आउटपुट कीमत केवल आधी कहानी बताती है। साथियों की तुलना में दोगुने टोकन उत्पन्न करने की इसकी प्रवृत्ति किसी भी हेडलाइन बचत को खत्म कर सकती है, विशेष रूप से लंबे उत्तर वाले कार्यों के लिए। जब तक weights उपलब्ध नहीं हो जाते और एक्टिव-पैरामीटर की संख्या स्पष्ट नहीं हो जाती, तब तक K3 को एक सस्ते विकल्प के बजाय एक प्रीमियम, संभावित रूप से अधिक शब्दवाला (verbose) सेवा के रूप में मानें। टोकन-बजट परीक्षण चलाएं, आउटपुट सीमाएं लागू करें, और केवल तभी स्विच करें जब आपने पूरे काम की वास्तविक लागत को माप लिया हो।