يأتي نموذج Kimi K3، أحدث نموذج مفتوح الأوزان (open-weights) من فريق Kimi، ببنية أساسية تعتمد على تقنية خليط الخبراء (MoE) وتضم 2.8 تريليون معلمة (parameter)، ونطاق سياق (context window) يصل إلى مليون رمز (token)، مما يوسع على الفور نطاق ما يمكن للمطورين تشغيله محلياً دون الارتباط بقيود واجهات برمجة التطبيقات (API) المغلقة.
يحدد تصميم MoE عدد المعلمات النشطة عند 104 مليار معلمة، مما يوفر قدرة استنتاجية تضاهي النماذج التي تضم عدة تريليونات من المعلمات مع الحفاظ على استقرار السرعة. وتمنح هذه الكفاءة دفعة قدرها 2.5 ضعفاً مقارنة بإصدار Kimi K2 السابق—وهي قفزة نوعية لكل من واجه حدوداً في قدرات الحوسبة أو زمن الاستجابة (latency) في النماذج المفتوحة الحالية.
لماذا يكتسب هذا التحديث أهمية الآن
لطالما تأخرت النماذج مفتوحة الأوزان عن الأنظمة المملوكة (proprietary) من حيث الحجم وطول السياق. لكن Kimi K3 يغير قواعد اللعبة عبر الجمع بين الحجم الهائل ونطاق سياق يستوعب مليون رمز كامل—وهو ما يكفي لاستيعاب مستودع برمجيات كامل أو ورقة بحثية طويلة في تمريرة واحدة. وبالنسبة للمطورين الذين يبنون مسارات التوليد المعزز بالاسترجاع (RAG)، أو المساعدين ذوي النصوص الطويلة، أو أدوات تصحيح الأخطاء المستقلة، فإن السياق الإضافي يقلل الحاجة إلى استراتيجيات تقسيم النصوص (chunking).
البنية التقنية
- توجيه Stable LatentMoE: يتم توزيع الرموز عبر 896 خبيراً، مع تفعيل 16 خبيراً لكل رمز. يقلل هذا التنشيط المتفرق (sparse activation) من استهلاك الذاكرة مع الاستمرار في الاستفادة من مخزون هائل من المعرفة.
- Kimi Delta Attention (KDA): نوع جديد من آليات الانتباه (attention) يعمل على استقرار تدفق المعلومات في الشبكات العميقة، مما يقلل من مخاطر عدم استقرار التدرج (gradient instability) التي قد تعاني منها النماذج الضخمة جداً.
- التدريب المتوازي للخبراء (Expert-parallel training): قام الفريق بتنظيم الحوسبة بحيث يعمل كل خبير على جزء مخصص من الأجهزة، مما يمنع حدوث الاختناقات التي تظهر عندما تتنافس العديد من الخبراء على نفس الموارد.
- إدارة متقدمة للذاكرة: تسمح استراتيجيات التخصيص المخصصة للنموذج بدعم تدريب الوكلاء القائم على التعلم التعزيزي (reinforcement-learning) دون استنزاف ذاكرة وحدة معالجة الرسومات (GPU).
ما تتيحه الأوزان المفتوحة
بما أن الأوزان عامة، يمكن للمستخدمين مراجعة التمثيلات الداخلية للنموذج، أو رصد التحيزات، أو تخصيصه لمجالات محددة. لم يعد الضبط الدقيق (Fine-tuning) على البيانات المملوكة يتطلب عقداً سحابياً؛ إذ يمكن تشغيل المسار بالكامل على أجهزة محلية (on-prem) تلبي متطلبات التدريب المتوازي للخبراء التي وضعها الفريق.
حالات استخدام فورية للمطورين
- أنظمة التوليد المعزز بالاسترجاع (RAG) التي تسحب البيانات من مخازن مستندات ضخمة في مطالبة (prompt) واحدة.
- مساعدو البرمجة للنصوص الطويلة الذين يحتفظون بسياق المشروع بأكمله في الذاكرة.
- أدوات تحليل الكود على مستوى المستودع بالكامل، والتي تفحص ملايين الأسطر دون تجاوز حدود المطالبة.
- وكلاء تصحيح أخطاء مستقلون يحافظون على سجل تنفيذ كامل أثناء التفكير في الإصلاحات.
