گوگل DeepMind یک طرح آزمایشی را اجرا کرده است که از بنچمارکگیری دو سو کور (double-blind) مبتنی بر رمزنگاری برای ارزیابی مدلهای Gemini Flash Lite خود استفاده میکند، بدون اینکه پرامپتهای تست یا وزنهای مدل فاش شوند. این ارزیابی در داخل Confidential Space متعلق به Google Cloud اجرا میشود، بنابراین ارزیاب هرگز مدل را نمیبیند و مدل نیز هرگز سوالات را نمیبیند؛ رویکردی که میتواند اعتبار گزارشهای عملکرد هوش مصنوعی را بازگرداند.
چرا آلودگی بنچمارک اهمیت دارد
اگر مدلی روی دادههایی آموزش ببیند که بعداً در یک بنچمارک ظاهر میشوند، امتیاز آن دیگر معیار سنجش استدلال نخواهد بود و به حفظ کردن (memorization) تبدیل میشود. بنابراین، یک نتیجه بینقص در یک تست آلوده، هیچ اطلاعاتی درباره توانایی واقعی مدل ارائه نمیدهد. پژوهشگران مدتهاست با یک پارادوکس روبرو هستند: آنها یا باید برای تأیید یک بنچمارک، دادههای تست را در اختیار ارائهدهنده مدل قرار دهند که خطر افشای زودهنگام را به همراه دارد، یا باید برای محافظت از وزنهای اختصاصی، از دسترسی خارجی خودداری کنند که باعث میشود حسابرسی بدون تأیید باقی بماند. تأخیر اخیر در ارزیابی Anthropic’s Fable 5 در بنچمارک ARC-AGI نشان میدهد که چگونه سیاستهای سختگیرانه نگهداری داده میتواند ارزیابیهای مستقل را متوقف کند.
یک راهکار رمزنگاریشده
این طرح آزمایشی، قراردادهای حقوقی و وعدههای «عدم ثبت وقایع» (zero-logging) را با یک محافظت فنی جایگزین میکند. Confidential Space یک محفظه (enclave) ایزوله شده از نظر سختافزاری ایجاد میکند که مدل Gemini Flash Lite را اجرا میکند. ارزیاب مجموعه تست را آپلود میکند و محفظه آن را در یک «جعبه» رمزنگاریشده مهر و موم میکند که مدل نمیتواند آن را باز کند. همزمان، وزنهای مدل در داخل محفظه رمزنگاری شده و برای ارزیاب نامرئی باقی میماند. محفظه یک اثبات ریاضی تولید میکند که نشان میدهد مدل هرگز در طول مرحله استنتاج (inference) به پرامپتها دسترسی نداشته است. نتیجه، یک اجرای واقعاً دو سو کور است: هر دو طرف اسرار خود را حفظ میکنند در حالی که یک شخص ثالث، یک معیار عملکرد قابل تأیید دریافت میکند.
چه کسانی سود میبرند
- نهادهای تنظیمگر و حسابرسان اکنون میتوانند بدون مجبور کردن ارائهدهندگان به افشای اسرار تجاری، شواهد توانمندی را مطالبه کنند.
- شرکتها در حوزههای امنیت سایبری، دفاعی یا هر حوزه دیگری که با دادههای طبقهبندیشده سروکار دارند میتوانند ابزارهای هوش مصنوعی را بدون خطر نشت داده آزمایش کنند.
- توسعهدهندگان مدل مزیت رقابتی خود را حفظ میکنند؛ آنها دیگر مجبور نیستند بین شفافیت و محافظت، یکی را انتخاب کنند.
اگر این رویکرد گسترش یابد، میتواند به روش پیشفرض برای تأیید مدلهای پیشرو (frontier models) تبدیل شود و صنعت را از توافقات مبتنی بر اعتماد به تضمینهای مبتنی بر ریاضیات تغییر دهد.
نقاط اصطکاک احتمالی
این سیستم به پشته محاسبات محرمانه (confidential computing stack) در Google Cloud متکی است، بنابراین سازمانهایی که سایر ارائهدهندگان ابری را ترجیح میدهند، ممکن است با موانع یکپارچهسازی روبرو شوند. اجرای مدلها در داخل یک محفظه (enclave)، باعث ایجاد تأخیر (latency) میشود و شتابدهندههای سختافزاری موجود را محدود میکند که میتواند بر امتیازات بنچمارک تأثیر بگذارد. همچنین، در حالی که اثبات رمزنگاریشده تضمین میکند که مدل پرامپتها را ندیده است، از دستکاریهای دیگر مانند تنظیم دقیق (fine-tuning) پس از شروع تست جلوگیری نمیکند. منتقدان ممکن است استدلال کنند که این راهکار تنها بخش کوچکی از مسئله گستردهتر بازتولیدپذیری (reproducibility) را حل میکند.
آنچه باید در آینده زیر نظر داشت
- پذیرش فراتر از طرح آزمایشی – سایر آزمایشگاههای هوش مصنوعی و فروشندگان ابری ممکن است محفظههای سازگاری بسازند تا آزمایش کنند که آیا مدل میتواند در پلتفرمهای مختلف مورد حسابرسی قرار گیرد یا خیر.
- نهادهای استانداردگذار – گروههای ایمنی هوش مصنوعی میتوانند حسابرسیهای رمزنگاریشده دو سو کور را به عنوان بخشی از چارچوبهای صدور گواهینامه تدوین کنند.
- موازنههای عملکردی – اجرای بنچمارکها در دنیای واقعی مشخص خواهد کرد که آیا هزینه اضافی اجرای محرمانه برای مدلهای مقیاس بزرگ قابل قبول است یا خیر.
خلاصه کلام
طرح آزمایشی Google DeepMind با قفل کردن همزمان دادههای تست و مدل در یک محیط رمزنگاریشده که برای هر دو طرف کدر (opaque) است، مسیری ملموس برای بنچمارکگیری قابل اعتماد در هوش مصنوعی ارائه میدهد. این روش تمام چالشهای حسابرسی را از بین نمیبرد، اما آشکارترین منبع سوگیری یعنی «آلودگی بنچمارک» را بدون مجبور کردن هیچیک از طرفین به واگذاری ارزشمندترین داراییهایشان، حذف میکند. اگر جامعه علمی این تکنیک را بپذیرد، گزارشهای پیشرفت هوش مصنوعی در آینده بالاخره میتوانند بدون تردید مورد اعتماد قرار گیرند.
