سائبر ایکسپلائٹس میں Kimi K3 امریکی فرنٹیر ماڈلز سے پیچھے: ڈسٹلیشن کا فرق

برطانوی AI سیکیورٹی انسٹی ٹیوٹ (UK AISI) اور امریکی سینٹر فار AI اسٹینڈرڈز اینڈ انوویشن (CAISI) کی ایک مشترکہ تشخیص نے چینی اور امریکی AI ماڈلز کے درمیان جارحانہ سائبر آپریشنز (offensive cyber operations) میں صلاحیتوں کا ایک بڑا فرق ظاہر کیا ہے۔ اگرچہ Moonshot AI کا Kimi K3 امید افزا ہے، لیکن پیچیدہ سافٹ ویئر ایکسپلائٹیشن اور نیٹ ورک حملوں کے کام سونپے جانے پر یہ اب بھی صف اول کے امریکی فرنٹیر ماڈلز سے کافی پیچھے ہے۔

ExploitBench: کمزوریوں کی تحقیق میں فرق

ایکسپلائٹ ڈویلپمنٹ کی مہارتوں کی پیمائش کے لیے، محققین نے ExploitBench کا استعمال کیا، جو کارنیگی میلن یونیورسٹی کا ایک بینچ مارک ہے جس میں 2023 کے بعد Chrome کے V8 انجن میں پائی جانے والی 41 کمزوریاں (vulnerabilities) شامل ہیں۔ نتائج نے کارکردگی کے ایک واضح فرق کو اجاگر کیا۔ صف اول کے امریکی ماڈلز نے اوسطاً 76.2% اسکور حاصل کیا، جبکہ Kimi K3 کا اسکور کافی کم 32.2% رہا۔ اگرچہ Kimi K3 نے چین کے GLM-5.2 (24.4%) سے بہتر کارکردگی دکھائی، لیکن یہ ایکسپلائٹیشن کی اعلیٰ ترین سطح: Arbitrary Code Execution (ACE) تک پہنچنے میں ناکام رہا۔

اس کے برعکس، اعلیٰ درجے کے امریکی ماڈلز نے آزمائش کیے گئے 41 کاموں میں سے 20 میں کامیابی سے ACE حاصل کر لیا، جس سے ٹارگٹ سسٹمز پر مکمل کنٹرول حاصل ہو گیا—یہ مہارت کا وہ درجہ ہے جس کی Kimi K3 نقل نہیں کر سکا۔

"The Last Ones" کے ذریعے نیٹ ورک حملوں کی سیمولیشن

اس تشخیص میں "The Last Ones" (TLO) کا استعمال کرتے ہوئے ماڈلز کا تجربہ بھی کیا گیا، جو چار سب نیٹ ورکس پر 20 ہوسٹس پر مشتمل ایک پیچیدہ 32 مرحلہ وار کارپوریٹ نیٹ ورک حملے کی سیمولیشن ہے۔ یہ ٹیسٹ ایک ایجنٹ کی کثیر المراحل مداخلت کے راستوں (multi-stage intrusion paths) پر عمل کرنے کی صلاحیت کو ماپنے کے لیے ڈیزائن کیا گیا ہے۔

Kimi K3 32 میں سے اوسطاً 17 مراحل تک پہنچ سکا، جو ایک درمیانی درجے کی صلاحیت کو ظاہر کرتا ہے۔ اگرچہ اس نے دس میں سے ایک کوشش میں مکمل حملہ کا راستہ مکمل کیا، لیکن اس میں امریکی ماڈلز جیسی مستقل مزاجی کی کمی تھی، جنہوں نے اوسطاً 28.5 مراحل مکمل کیے۔ نتائج سے پتہ چلتا ہے کہ اگرچہ Kimi K3 کمزور دفاع والے انٹرپرائز سسٹمز پر خود مختارانہ طور پر حملہ کرنے کی صلاحیت رکھتا ہے، لیکن اس میں پیچیدہ اور طویل زنجیری آپریشنز (long-chain operations) انجام دینے کے لیے مغربی فرنٹیر ماڈلز جیسی قابل اعتماد صلاحیت موجود نہیں ہے۔

ڈسٹلیشن تھیوری: یہ فرق کیوں موجود ہے؟

ایک اہم سوال اب بھی باقی ہے: چینی ماڈلز سائبر ٹاسک میں پیچھے کیوں رہ جاتے ہیں، چاہے وہ عمومی بینچ مارکس پر اچھی کارکردگی ہی کیوں نہ دکھائیں؟ رپورٹ کے مطابق اس کی وجہ "ڈسٹلیشن" (distillation) ہو سکتی ہے—یعنی فرنٹیر ماڈلز (جیسے Anthropic کا Claude) کے اعلیٰ معیار کے آؤٹ پٹس کو ٹریننگ ڈیٹا کے طور پر استعمال کرنے کا طریقہ۔

اگر Moonshot AI نے Kimi K3 کو تربیت دینے کے لیے ڈسٹلیشن کا استعمال کیا ہے، تو ممکن ہے کہ وہ اہم سائبر جارحانہ ڈیٹا سے محروم رہ گئے ہوں۔ صف اول کے امریکی ماڈلز سخت سیفٹی کلاسیفائرز کا استعمال کرتے ہیں جو جدید جارحانہ سوالات (offensive queries) کو بلاک کر دیتے ہیں۔ نتیجے کے طور پر، ان ماڈلز کے عوامی آؤٹ پٹس سے تیار کردہ ڈیٹا سیٹ میں قدرتی طور پر اس علم کی کمی ہوگی جو اعلیٰ درجے کی ایکسپلائٹیشن کے لیے ضروری ہے۔ یہی وجہ ہے کہ Kimi K3 عمومی پروگرامنگ اور استدلال (reasoning) میں مغربی ماڈلز کا مقابلہ تو کر سکتا ہے لیکن مخصوص جارحانہ سائبر ٹاسک میں نمایاں طور پر ناکام رہتا ہے۔

بڑھتی ہوئی صلاحیتیں اور مستقل خطرات

موجودہ فرق کے باوجود، CAISI کا ٹائم سیریز تجزیہ ظاہر کرتا ہے کہ امریکی اور چینی دونوں ماڈلز Elo پر مبنی اوپر کی طرف جانے والے رجحان (upward trajectory) پر ہیں۔ اوپن ماڈلز کے لیے کارکردگی کا فرق 2025 کے آغاز میں چھ سے دس ماہ سے کم ہو کر حال ہی میں صرف چار سے سات ماہ رہ گیا ہے۔ UK AISI خبردار کرتا ہے کہ اس کم ہوتے فرق کا مطلب حفاظت نہیں ہے؛ اوپن ویٹ ماڈلز کی بڑھتی ہوئی صلاحیتیں عالمی سائبر سیکیورٹی کے منظر نامے میں "غلط استعمال کا ایک مستقل اور ناقابل واپسی خطرہ" ہیں۔

اہم نکات

  • سائبر کارکردگی کا فرق: Kimi K3 نے ExploitBench پر 32.2% اسکور کیا، جو صف اول کے امریکی ماڈلز کے 76.2% اوسط سے کافی پیچھے ہے، اور Arbitrary Code Execution (ACE) حاصل کرنے میں ناکام رہا۔
  • نیٹ ورک حملے کی صلاحیت: TLO سیمولیشنز میں، Kimi K3 نے 32 مرحلہ وار حملے کے راستے میں اوسطاً 17 مراحل مکمل کیے، جس سے ثابت ہوتا ہے کہ یہ کمزور سسٹمز کو نشانہ بنا سکتا ہے لیکن اس میں اعلیٰ درجے کے امریکی ماڈلز جیسی قابل اعتماد صلاحیت نہیں ہے۔
  • ڈسٹلیشن کا کردار: سائبر مہارتوں میں کمی کی وجہ ڈسٹلیشن کے طریقے ہو سکتے ہیں، کیونکہ Claude جیسے ماڈلز کے سینسر شدہ عوامی آؤٹ پٹس پر ٹریننگ کرنے سے وہ جارحانہ ڈیٹا دستیاب نہیں ہوتا جو جدید ایکسپلائٹیشن کے لیے ضروری ہے۔