Kimi टीम का नवीनतम ओपन-वेट्स मॉडल, Kimi K3, 2.8-ट्रिलियन-पैरामीटर मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) बैकबोन और 1-मिलियन-टोकन कॉन्टेक्स्ट विंडो के साथ आता है, जो डेवलपर्स के लिए क्लोज्ड-API लॉक-इन के बिना स्थानीय रूप से चलाने की क्षमताओं का तुरंत विस्तार करता है।
MoE डिज़ाइन सक्रिय पैरामीटर संख्या को 104 बिलियन तक सीमित रखता है, जिससे गति को स्थिर रखते हुए मल्टी-ट्रिलियन मॉडल की तर्क करने की शक्ति मिलती है। यह दक्षता पिछले Kimi K2 रिलीज़ की तुलना में 2.5× का उछाल देती है—उन लोगों के लिए एक बड़ी छलांग जो मौजूदा ओपन मॉडल्स पर कंप्यूट या लेटेंसी की सीमाओं का सामना कर रहे हैं।
यह अपग्रेड अभी क्यों महत्वपूर्ण है
ओपन-वेट्स मॉडल पारंपरिक रूप से स्केल और कॉन्टेक्स्ट लंबाई के मामले में प्रोपराइटरी सिस्टम से पीछे रहे हैं। Kimi K3 विशाल आकार को एक ऐसे कॉन्टेक्स्ट विंडो के साथ जोड़कर इस स्थिति को बदल देता है जो पूरे एक मिलियन टोकन को समाहित कर सकता है—जो एक बार में पूरे कोड रिपॉजिटरी या एक लंबे शोध पत्र को पढ़ने के लिए पर्याप्त है। रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) पाइपलाइन, लॉन्ग-फॉर्म असिस्टेंट, या ऑटोनॉमस डिबगिंग टूल बनाने वाले डेवलपर्स के लिए, यह अतिरिक्त कॉन्टेक्स्ट चंकिंग रणनीतियों की आवश्यकता को कम कर देता है।
तकनीकी ढांचा
- Stable LatentMoE routing: टोकन को 896 एक्सपर्ट्स में भेजा जाता है, जिसमें प्रति टोकन 16 एक्सपर्ट्स सक्रिय होते हैं। यह स्पार्स एक्टिवेशन मेमोरी फुटप्रिंट को कम करता है और साथ ही ज्ञान के एक विशाल भंडार का उपयोग करता है।
- Kimi Delta Attention (KDA): एक नया अटेंशन वेरिएंट जो डीप नेटवर्क में सूचना प्रवाह को स्थिर करता है, जिससे ग्रेडिएंट अस्थिरता (gradient instability) का जोखिम कम हो जाता है जो बहुत बड़े मॉडल्स को प्रभावित कर सकता है।
- Expert-parallel training: टीम ने कंप्यूट को इस तरह व्यवस्थित किया है कि प्रत्येक एक्सपर्ट हार्डवेयर के अपने हिस्से पर चलता है, जिससे उन बॉटलनेक्स (bottlenecks) को रोका जा सके जो तब उत्पन्न होते हैं जब कई एक्सपर्ट्स एक ही संसाधनों के लिए प्रतिस्पर्धा करते हैं।
- Advanced memory management: कस्टम एलोकेशन रणनीतियाँ मॉडल को GPU मेमोरी को समाप्त किए बिना रिइन्फोर्समेंट-लर्निंग-आधारित एजेंट ट्रेनिंग का समर्थन करने देती हैं।
ओपन वेट्स क्या सक्षम करते हैं
चूंकि वेट्स सार्वजनिक हैं, इसलिए उपयोगकर्ता मॉडल के आंतरिक प्रतिनिधित्व का ऑडिट कर सकते हैं, पूर्वाग्रहों (biases) को पहचान सकते हैं, या इसे विशिष्ट डोमेन के लिए तैयार कर सकते हैं। प्रोपराइटरी डेटा पर फाइन-ट्यूनिंग के लिए अब क्लाउड कॉन्ट्रैक्ट की आवश्यकता नहीं है; पूरी पाइपलाइन ऑन-प्रीम हार्डवेयर पर चलाई जा सकती है जो टीम की एक्सपर्ट-पैरेलल आवश्यकताओं को पूरा करती है।
डेवलपर्स के लिए तत्काल उपयोग के मामले
- रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम जो एक ही प्रॉम्प्ट में विशाल डॉक्यूमेंट स्टोर से जानकारी निकाल सकते हैं।
- लॉन्ग-फॉर्म कोडिंग असिस्टेंट जो पूरे प्रोजेक्ट के कॉन्टेक्स्ट को मेमोरी में रखते हैं।
- रिपॉजिटरी-व्यापी कोड विश्लेषण उपकरण जो प्रॉम्प्ट को तोड़े बिना लाखों लाइनों को स्कैन कर सकते हैं।
- ऑटोनॉमस डिबगिंग एजेंट जो सुधारों के बारे में तर्क करते समय एक पूर्ण निष्पादन ट्रेस (execution trace) बनाए रखते हैं।
