Moonshot AI کے نئے Kimi K3 نے AA-Briefcase بینچ مارک پر GPT-5.6 کو پیچھے چھوڑ دیا ہے، جس نے 1,495 کے مقابلے میں 1,527 اسکور کیا۔ یہ کامیابی ایک ایسے پرائسنگ ماڈل کے ساتھ آئی ہے جو اس 2.8 ٹریلین پیرامیٹر والے open-weight ماڈل کو طویل کوڈنگ ٹاسکس کے لیے حیرت انگیز طور پر سستا آپشن بناتا ہے۔
یہ بینچ مارک کیوں اہم ہے
AA-Briefcase الگ تھلگ معلوماتی سوالات کے بجائے مسلسل اور حقیقی دنیا کے ورک لوڈز پر کارکردگی کی پیمائش کرتا ہے۔ زیادہ اسکور کا مطلب ہے کہ ایک ماڈل ہزاروں ٹوکنز کے دوران سیاق و سباق (context) کو برقرار رکھ سکتا ہے، مستقبل کی منصوبہ بندی کر سکتا ہے اور اپنے کام پر توجہ مرکوز رکھ سکتا ہے – بالکل وہی حالات جن کا سامنا ڈویلپرز کو اسسٹنٹ، کوڈ جنریٹرز یا ریسرچ ایڈز بناتے وقت کرنا پڑتا ہے۔ GPT-5.6 پر Kimi K3 کی برتری یہ ظاہر کرتی ہے کہ اب ایک اوپن ماڈل ان شعبوں میں مقابلہ کر سکتا ہے جہاں روایتی طور پر کلوزڈ ماڈلز کا راج رہا ہے۔
تکنیکی منظرنامہ
- Size – 2.8 ٹریلین پیرامیٹرز، جو اب تک کا سب سے بڑا ریلیز کیا گیا open-weight ماڈل ہے۔
- Architecture – 896 ماہرین (experts) کے ساتھ Stable LatentMoE (Mixture-of-Experts)، جن میں سے کوئی بھی 16 لمحے پر فعال ہوتے ہیں۔
- Context window – 1 ملین سے زیادہ ٹوکنز، جو پوری کتابوں یا طویل کوڈ بیسز کو محفوظ کرنے کے لیے کافی ہیں۔
- Attention – Kimi Delta Attention، ایک کسٹم تبدیلی جس کا دعویٰ ہے کہ یہ اسکیلنگ کی کارکردگی کو بہتر بناتی ہے۔
یہ انتخاب ماڈل کو "long-horizon" ٹاسکس کو سنبھالنے کی صلاحیت دیتے ہیں، لیکن یہ کمپیوٹ کی ضروریات کو بھی بڑھا دیتے ہیں، جو کہ رفتار اور لاگت کے اعداد و شمار میں نظر آتا ہے۔
پرائسنگ جو توجہ حاصل کرتی ہے
Moonshot ٹوکن کی قیمتوں کو تین حصوں میں تقسیم کرتا ہے:
| استعمال کی قسم | فی 1 ملین ٹوکنز لاگت |
|---|---|
| Input – cache miss | $3.00 |
| Input – cache hit | $0.30 |
| Output | $15.00 |
کمپنی کا کہنا ہے کہ کوڈنگ ورک لوڈز میں 90% کی cache-hit شرح دیکھی جاتی ہے۔ اگر یہ سچ ہے، تو یہ کوڈنگ ایجنٹس کے لیے ایک بہت سستا آپشن ہے۔
وہ سمجھوتے جو آپ محسوس کریں گے
- Speed – ماڈل تقریباً 62 ٹوکنز فی سیکنڈ پروسیس کرتا ہے، جو کہ فیلڈ کے اوسط سے کم ہے۔ ایک طویل پرامپٹ (prompt) منٹوں تک لگ سکتا ہے، جو انٹرایکٹو استعمال کے لیے اہم ہے۔
- Reasoning cost – Kimi K3 ڈیفالٹ کے طور پر "max reasoning effort" کے ساتھ چلتا ہے اور اسے کم کرنے کا کوئی آپشن فراہم نہیں کرتا۔ اس لیے سادہ سوالات بھی اتنے ہی ٹوکنز استعمال کرتے ہیں جتنے پیچیدہ سوالات، جس سے معمول کے کاموں کے لیے لاگت بڑھ جاتی ہے۔
- Hidden token usage – کچھ صارفین ایک بڑے سسٹم پرامپٹ کی اطلاع دیتے ہیں جسے ماڈل خود بخود شامل کر دیتا ہے، جس سے ایسے ٹوکنز بڑھ جاتے ہیں جن کے پیسے تو لیے جاتے ہیں لیکن وہ صارف کی درخواست میں نظر نہیں آتے۔
ان عوامل کا مطلب یہ ہے کہ عملی طور پر سست رفتار اور زیادہ ٹوکن کے استعمال کی وجہ سے اشتہاری طور پر کم دکھائی جانے والی قیمت کا فائدہ ختم ہو سکتا ہے۔
دستیابی اور مستقبل کا راستہ
API آج لائیو ہے، جس سے ڈویلپرز فوری طور پر تجربات کر سکتے ہیں۔ ماڈل کے ویٹس (weights) خود 27 جولائی کو ریلیز کیے جائیں گے، جس کے بعد اسے خود ہوسٹ کرنا ممکن ہو جائے گا۔ تب تک، صارفین کو Moonshot کی ہوسٹڈ سروس پر انحصار کرنا ہوگا اور اس کے ساتھ منسلک لیٹنسی (latency) اور پرائسنگ اسٹرکچر کو قبول کرنا ہوگا۔
کلوزڈ ماڈل کیمپ کا جوابی نقطہ نظر
ابھرتا ہوا خلاصہ
اہم بات کلوزڈ ماڈلز اور اوپن ماڈلز کے درمیان کم ہوتی ہوئی خلیج ہے۔ Kimi K3 ثابت کرتا ہے کہ open-weight ماڈلز پیچیدہ اور طویل مدتی کاموں کو سنبھال سکتے ہیں۔
