گوگل DeepMind یک طرح آزمایشی را اجرا کرده است که از بنچمارک‌گیری دو سو کور (double-blind) مبتنی بر رمزنگاری برای ارزیابی مدل‌های Gemini Flash Lite خود استفاده می‌کند، بدون اینکه پرامپت‌های تست یا وزن‌های مدل فاش شوند. این ارزیابی در داخل Confidential Space متعلق به Google Cloud اجرا می‌شود، بنابراین ارزیاب هرگز مدل را نمی‌بیند و مدل نیز هرگز سوالات را نمی‌بیند؛ رویکردی که می‌تواند اعتبار گزارش‌های عملکرد هوش مصنوعی را بازگرداند.

چرا آلودگی بنچمارک اهمیت دارد

اگر مدلی روی داده‌هایی آموزش ببیند که بعداً در یک بنچمارک ظاهر می‌شوند، امتیاز آن دیگر معیار سنجش استدلال نخواهد بود و به حفظ کردن (memorization) تبدیل می‌شود. بنابراین، یک نتیجه بی‌نقص در یک تست آلوده، هیچ اطلاعاتی درباره توانایی واقعی مدل ارائه نمی‌دهد. پژوهشگران مدت‌هاست با یک پارادوکس روبرو هستند: آن‌ها یا باید برای تأیید یک بنچمارک، داده‌های تست را در اختیار ارائه‌دهنده مدل قرار دهند که خطر افشای زودهنگام را به همراه دارد، یا باید برای محافظت از وزن‌های اختصاصی، از دسترسی خارجی خودداری کنند که باعث می‌شود حسابرسی بدون تأیید باقی بماند. تأخیر اخیر در ارزیابی Anthropic’s Fable 5 در بنچمارک ARC-AGI نشان می‌دهد که چگونه سیاست‌های سخت‌گیرانه نگهداری داده می‌تواند ارزیابی‌های مستقل را متوقف کند.

یک راهکار رمزنگاری‌شده

این طرح آزمایشی، قراردادهای حقوقی و وعده‌های «عدم ثبت وقایع» (zero-logging) را با یک محافظت فنی جایگزین می‌کند. Confidential Space یک محفظه (enclave) ایزوله شده از نظر سخت‌افزاری ایجاد می‌کند که مدل Gemini Flash Lite را اجرا می‌کند. ارزیاب مجموعه تست را آپلود می‌کند و محفظه آن را در یک «جعبه» رمزنگاری‌شده مهر و موم می‌کند که مدل نمی‌تواند آن را باز کند. همزمان، وزن‌های مدل در داخل محفظه رمزنگاری شده و برای ارزیاب نامرئی باقی می‌ماند. محفظه یک اثبات ریاضی تولید می‌کند که نشان می‌دهد مدل هرگز در طول مرحله استنتاج (inference) به پرامپت‌ها دسترسی نداشته است. نتیجه، یک اجرای واقعاً دو سو کور است: هر دو طرف اسرار خود را حفظ می‌کنند در حالی که یک شخص ثالث، یک معیار عملکرد قابل تأیید دریافت می‌کند.

چه کسانی سود می‌برند

  • نهادهای تنظیم‌گر و حسابرسان اکنون می‌توانند بدون مجبور کردن ارائه‌دهندگان به افشای اسرار تجاری، شواهد توانمندی را مطالبه کنند.
  • شرکت‌ها در حوزه‌های امنیت سایبری، دفاعی یا هر حوزه دیگری که با داده‌های طبقه‌بندی‌شده سروکار دارند می‌توانند ابزارهای هوش مصنوعی را بدون خطر نشت داده آزمایش کنند.
  • توسعه‌دهندگان مدل مزیت رقابتی خود را حفظ می‌کنند؛ آن‌ها دیگر مجبور نیستند بین شفافیت و محافظت، یکی را انتخاب کنند.

اگر این رویکرد گسترش یابد، می‌تواند به روش پیش‌فرض برای تأیید مدل‌های پیشرو (frontier models) تبدیل شود و صنعت را از توافقات مبتنی بر اعتماد به تضمین‌های مبتنی بر ریاضیات تغییر دهد.

نقاط اصطکاک احتمالی

این سیستم به پشته محاسبات محرمانه (confidential computing stack) در Google Cloud متکی است، بنابراین سازمان‌هایی که سایر ارائه‌دهندگان ابری را ترجیح می‌دهند، ممکن است با موانع یکپارچه‌سازی روبرو شوند. اجرای مدل‌ها در داخل یک محفظه (enclave)، باعث ایجاد تأخیر (latency) می‌شود و شتاب‌دهنده‌های سخت‌افزاری موجود را محدود می‌کند که می‌تواند بر امتیازات بنچمارک تأثیر بگذارد. همچنین، در حالی که اثبات رمزنگاری‌شده تضمین می‌کند که مدل پرامپت‌ها را ندیده است، از دستکاری‌های دیگر مانند تنظیم دقیق (fine-tuning) پس از شروع تست جلوگیری نمی‌کند. منتقدان ممکن است استدلال کنند که این راهکار تنها بخش کوچکی از مسئله گسترده‌تر بازتولیدپذیری (reproducibility) را حل می‌کند.

آنچه باید در آینده زیر نظر داشت

  • پذیرش فراتر از طرح آزمایشی – سایر آزمایشگاه‌های هوش مصنوعی و فروشندگان ابری ممکن است محفظه‌های سازگاری بسازند تا آزمایش کنند که آیا مدل می‌تواند در پلتفرم‌های مختلف مورد حسابرسی قرار گیرد یا خیر.
  • نهادهای استانداردگذار – گروه‌های ایمنی هوش مصنوعی می‌توانند حسابرسی‌های رمزنگاری‌شده دو سو کور را به عنوان بخشی از چارچوب‌های صدور گواهینامه تدوین کنند.
  • موازنه‌های عملکردی – اجرای بنچمارک‌ها در دنیای واقعی مشخص خواهد کرد که آیا هزینه اضافی اجرای محرمانه برای مدل‌های مقیاس بزرگ قابل قبول است یا خیر.

خلاصه کلام

طرح آزمایشی Google DeepMind با قفل کردن همزمان داده‌های تست و مدل در یک محیط رمزنگاری‌شده که برای هر دو طرف کدر (opaque) است، مسیری ملموس برای بنچمارک‌گیری قابل اعتماد در هوش مصنوعی ارائه می‌دهد. این روش تمام چالش‌های حسابرسی را از بین نمی‌برد، اما آشکارترین منبع سوگیری یعنی «آلودگی بنچمارک» را بدون مجبور کردن هیچ‌یک از طرفین به واگذاری ارزشمندترین دارایی‌هایشان، حذف می‌کند. اگر جامعه علمی این تکنیک را بپذیرد، گزارش‌های پیشرفت هوش مصنوعی در آینده بالاخره می‌توانند بدون تردید مورد اعتماد قرار گیرند.