کیوں OpenAI نے ایک AI حملہ آور کا رخ کیا

روایتی ریڈ-ٹیم مشقیں سیکیورٹی انجینئرز کو ماڈلز کی دستی طور پر جانچ کرنے پر مجبور کرتی ہیں—جو کہ انسانی تخیل تک محدود ایک سست اور مہنگا عمل ہے۔ OpenAI نے اس کا جواب GPT-Red کے ذریعے دیا، جو کہ ایک سیلف پلے (self-play) سسٹم ہے جو ایک حملہ آور ماڈل کا مقابلہ ایک دفاعی ہم منصب ماڈل سے کرواتا ہے۔ حملے کا ہر راؤنڈ دفاع کرنے والے ماڈل کو نیا ڈیٹا فراہم کرتا ہے؛ حملہ آور ہر ناکامی سے سیکھتا ہے، جس سے ایک ارتقائی چکر (evolutionary loop) بنتا ہے جو ایسے ایکسپلائٹ پیٹرنز کو سامنے لاتا ہے جن کے بارے میں کوئی انسان سوچ بھی نہیں سکتا۔

اہم اعداد و شمار

  • حملے کی کامیابی: انسانی ریڈ-ٹیمرز کے 13% کے مقابلے میں GPT-Red ٹیسٹ کیسز کے 84% میں کامیاب رہا۔
  • ماڈل کی مضبوطی: OpenAI نے GPT-Red کے حاصل کردہ مشاہدات کو براہ راست ٹریننگ پائپ لائن میں شامل کیا، اور اب GPT-5.6 Sol میں چار ماہ قبل ریلیز ہونے والے فلیگ شپ ماڈل کے مقابلے میں پرامپٹ انجیکشن (prompt-injection) کی ناکامیوں میں چھ گنا کمی ریکارڈ کی گئی ہے۔
  • باقی ماندہ خطرہ: نئی دفاعی تدابیر کے باوجود، تقریباً 3.8% "مضبوط" انجیکشنز اب بھی کامیاب ہو جاتے ہیں، جو کہ Claude Opus 4.5 کے برابر کی ناکامی کی شرح ہے۔

ایک لائیو ڈیمو نے اس سسٹم کی طاقت کو واضح کیا: GPT-Red نے OpenAI کے دفتر میں ایک AI کے ذریعے کنٹرول شدہ وینڈنگ مشین کے ساتھ چھیڑ چھاڑ کی، اشیاء کی قیمتیں تبدیل کیں اور انسانی مداخلت کے بغیر آرڈرز منسوخ کر دیے۔

اس بہتری کا صارفین کے لیے کیا مطلب ہے

OpenAI کا کہنا ہے کہ GPT-5.6 Sol اپنے پیشرو کی طرح سوچنے کی رفتار اور جواب کے معیار کو برقرار رکھتا ہے، اور اس دیرینہ سیفٹی-یوٹیلیٹی ٹریڈ آف (safety-utility tradeoff) سے بچتا ہے جہاں سخت حفاظتی اقدامات کارکردگی کو متاثر کرتے ہیں۔

ایک خودکار ریڈ ٹیم کی حدود

خودکاری تمام خطرات کو ختم نہیں کرتی۔ زیادہ طاقتور انجیکشنز کے لیے 3.8% کی کامیابی کی شرح ظاہر کرتی ہے کہ ایک پیچیدہ سیلف پلے سسٹم بھی خامیاں چھوڑ دیتا ہے۔

آگے کیا دیکھنے کو ملے گا

  • تکراری اپ گریڈز: سیلف پلے لوپ مسلسل ارتقا پذیر رہے گا۔

خلاصہ

GPT-Red ثابت کرتا ہے کہ ایک AI اپنی ہی قسم کے ماڈلز میں خامیاں تلاش کرنے میں انسانوں سے زیادہ بہتر سوچ سکتا ہے، جس سے GPT-5.6 کے لیے پرامپٹ انجیکشن کی ناکامیوں میں چھ گنا کمی واقع ہوئی ہے۔ یہ پیش رفت حفاظت اور افادیت کے درمیان فرق کو کم کرتی ہے، لیکن ایک چھوٹا اور حقیقی باقی ماندہ خطرہ برقرار رہتا ہے۔ اگلا باب اس بات پر منحصر ہے کہ OpenAI کس طرح خودکار ریڈ-ٹیم کے مشاہدات کو بیرونی جانچ کے ساتھ ملا کر ان حریفوں سے آگے رہتا ہے جو خود تیزی سے AI کی طرف مائل ہو رہے ہیں۔