Google DeepMind نے ایک پائلٹ پروگرام متعارف کرایا ہے جو Gemini Flash Lite ماڈلز کی جانچ کے لیے کرپٹوگرافک ڈبل بلائنڈ بینچ مارکنگ (cryptographic double-blind benchmarking) کا استعمال کرتا ہے تاکہ ٹیسٹ پرامپٹس یا ماڈل کے ویٹس (weights) کو ظاہر کیے بغیر ان کا جائزہ لیا جا سکے۔ یہ جانچ Google Cloud کے Confidential Space کے اندر ہوتی ہے، اس لیے جائزہ لینے والا کبھی ماڈل کو نہیں دیکھتا اور ماڈل کبھی سوالات کو نہیں دیکھتا—یہ ایک ایسا طریقہ ہے جو AI کی کارکردگی کی رپورٹس میں ساکھ بحال کر سکتا ہے۔
بینچ مارک کنٹیمینیشن (contamination) کیوں اہم ہے
اگر کوئی ماڈل ایسے ڈیٹا پر تربیت حاصل کرتا ہے جو بعد میں کسی بینچ مارک میں ظاہر ہوتا ہے، تو اس کا اسکور استدلال (reasoning) کی پیمائش کرنے کے بجائے محض یادداشت (memorization) بن جاتا ہے۔ اس لیے کنٹیمینیٹڈ ٹیسٹ پر ایک مکمل نتیجہ حقیقی صلاحیت کے بارے میں کچھ نہیں بتاتا۔ محققین کو طویل عرصے سے ایک تضاد کا سامنا ہے: بینچ مارک کی تصدیق کے لیے انہیں ماڈل فراہم کرنے والے کو ٹیسٹ ڈیٹا دینا پڑتا ہے، جس سے وقت سے پہلے ڈیٹا کے ظاہر ہونے کا خطرہ ہوتا ہے، یا انہیں ملکیتی ویٹس (proprietary weights) کی حفاظت کے لیے بیرونی رسائی سے انکار کرنا پڑتا ہے، جس سے آڈٹ غیر تصدیق شدہ رہ جاتا ہے۔ ARC-AGI بینچ مارک پر Anthropic کے Fable 5 کی جانچ میں حالیہ تاخیر یہ ظاہر کرتی ہے کہ ڈیٹا کی سخت ریٹینشن پالیسیاں کس طرح آزادانہ تشخیص کو روک سکتی ہیں۔
ایک کرپٹوگرافک حل
یہ پائلٹ قانونی معاہدوں اور "زیرو لاگنگ" کے وعدوں کی جگہ ایک تکنیکی تحفظ لاتا ہے۔ Confidential Space ایک ہارڈ ویئر سے الگ شدہ انکلیو (enclave) تخلیق کرتا ہے جو Gemini Flash Lite ماڈل کو چلاتا ہے۔ جائزہ لینے والا ٹیسٹ سویٹ (test suite) اپ لوڈ کرتا ہے، جسے انکلیو ایک کرپٹوگرافک "باکس" میں سیل کر دیتا ہے جسے ماڈل نہیں کھول سکتا۔ اسی وقت، ماڈل کے ویٹس انکلیو کے اندر انکرپٹڈ رہتے ہیں، جو جائزہ لینے والے کے لیے ناقابلِ دید ہوتے ہیں۔ انکلیو ایک ریاضیاتی ثبوت تیار کرتا ہے کہ ماڈل نے انفرنس (inference) کے دوران پرامپٹس تک رسائی حاصل نہیں کی۔ اس کا نتیجہ ایک حقیقی ڈبل بلائنڈ عمل ہے: دونوں فریق اپنے راز برقرار رکھتے ہیں جبکہ تیسرا فریق ایک قابلِ تصدیق کارکردگی کا میٹرک حاصل کرتا ہے۔
کس کو فائدہ ہوگا
- ریگولیٹرز اور آڈیٹرز اب فراہم کنندگان کو تجارتی راز ظاہر کرنے پر مجبور کیے بغیر صلاحیت کے ثبوت کا مطالبہ کر سکتے ہیں۔
- سائبر سیکیورٹی، دفاع، یا کسی بھی ایسے شعبے کے ادارے جو کلاسیفائیڈ ڈیٹا ہینڈل کرتے ہیں ڈیٹا کے لیک ہونے کے خطرے کے بغیر AI ٹولز کا تجربہ کر سکتے ہیں۔
- ماڈل ڈویلپرز اپنی مسابقتی برتری برقرار رکھتے ہیں؛ انہیں اب شفافیت اور تحفظ کے درمیان انتخاب کرنے کی ضرورت نہیں ہے۔
اگر یہ طریقہ کار بڑے پیمانے پر اپنایا جاتا ہے، تو یہ فرنٹیر ماڈلز (frontier models) کی تصدیق کے لیے ڈیفالٹ طریقہ بن سکتا ہے، جس سے صنعت بھروسے پر مبنی انتظامات سے ریاضی پر مبنی ضمانتوں کی طرف منتقل ہو جائے گی۔
ممکنہ رکاوٹیں
یہ سسٹم Google Cloud کے کنفیڈینشل کمپیوٹنگ اسٹیک پر انحصار کرتا ہے، اس لیے وہ تنظیمیں جو دوسرے کلاؤڈ فراہم کنندگان کو ترجیح دیتی ہیں، انہیں انٹیگریشن میں مشکلات کا سامنا ہو سکتا ہے۔ انکلیو کے اندر ماڈلز چلانے سے لیٹنسی (latency) بڑھ جاتی ہے اور دستیاب ہارڈ ویئر ایکسلیریٹرز محدود ہو جاتے ہیں، جو بینچ مارک اسکورز کو متاثر کر سکتے ہیں۔ مزید برآں، اگرچہ کرپٹوگرافک ثبوت اس بات کی ضمانت دیتا ہے کہ ماڈل نے پرامپٹس نہیں دیکھے، لیکن یہ دیگر ہیرا پھیری کو نہیں روکتا، جیسے کہ ٹیسٹ شروع ہونے کے بعد فائن ٹیوننگ (fine-tuning) کرنا۔ ناقدین یہ دلیل دے سکتے ہیں کہ یہ حل وسیع تر ری پروڈیوسیبلٹی (reproducibility) کے مسئلے کے صرف ایک محدود حصے کو حل کرتا ہے۔
آگے کیا دیکھنا ہے
- پائلٹ سے آگے کا پھیلاؤ – دیگر AI لیبز اور کلاؤڈ فراہم کنندگان ہم آہنگ انکلیوز بنا سکتے ہیں، جس سے یہ آزمایا جا سکے گا کہ آیا ماڈل کو مختلف پلیٹ فارمز پر آڈٹ کیا جا سکتا ہے۔
- معیار سازی کے ادارے – AI سیفٹی گروپس ڈبل بلائنڈ کرپٹوگرافک آڈٹ کو سرٹیفیکیشن فریم ورکس کے حصے کے طور پر کوڈٹی فائی کر سکتے ہیں۔
- کارکردگی کے تبادلے (trade-offs) – حقیقی دنیا کے بینچ مارک رن سے یہ معلوم ہوگا کہ آیا کنفیڈینشل ایگزیکیوشن کا اضافی بوجھ (overhead) بڑے پیمانے کے ماڈلز کے لیے قابل قبول ہے۔
خلاصہ
ٹیسٹ ڈیٹا اور ماڈل دونوں کو باہمی طور پر غیر شفاف کرپٹوگرافک ماحول میں بند کر کے، Google DeepMind کا پائلٹ قابلِ اعتماد AI بینچ مارکنگ کا ایک ٹھوس راستہ فراہم کرتا ہے۔ یہ طریقہ ہر آڈٹ چیلنج کو ختم نہیں کرتا، لیکن یہ کسی بھی فریق کو اپنے قیمتی اثاثے چھوڑنے پر مجبور کیے بغیر، تعصب کے سب سے واضح ذریعے—بینچ مارک کنٹیمینیشن—کو ختم کر دیتا ہے۔ اگر کمیونٹی اس تکنیک کو اپنا لیتی ہے، تو مستقبل کی AI ترقی کی رپورٹس کو بالآخر حقیقت کے طور پر تسلیم کیا جا سکے گا۔
