Google DeepMind meluncurkan uji coba percontohan yang menggunakan tolok ukur (benchmarking) kriptografis buta ganda (double-blind) untuk mengevaluasi model Gemini Flash Lite miliknya tanpa mengekspos prompt pengujian atau bobot model. Evaluasi ini dijalankan di dalam Confidential Space milik Google Cloud, sehingga evaluator tidak pernah melihat model tersebut dan model tidak pernah melihat pertanyaan yang diajukan—sebuah pendekatan yang dapat memulihkan kredibilitas laporan performa AI.

Mengapa kontaminasi tolok ukur itu penting

Jika sebuah model dilatih menggunakan data yang nantinya muncul dalam sebuah tolok ukur, skornya tidak lagi mengukur penalaran melainkan berubah menjadi penghafalan. Oleh karena itu, hasil sempurna pada tes yang terkontaminasi tidak memberikan informasi apa pun tentang kemampuan yang sebenarnya. Para peneliti telah lama menghadapi paradoks: mereka harus menyerahkan data pengujian kepada penyedia model untuk memverifikasi tolok ukur, yang berisiko menyebabkan paparan data terlalu dini, atau mereka harus menolak akses eksternal untuk melindungi bobot model yang bersifat rahasia, sehingga audit menjadi tidak terverifikasi. Penundaan baru-baru ini dalam mengevaluasi Fable 5 milik Anthropic pada benchmark ARC-AGI menunjukkan bagaimana kebijakan retensi data yang ketat dapat menghambat penilaian independen.

Solusi kriptografis

Uji coba ini mengganti kontrak hukum dan janji "zero-logging" dengan pengamanan teknis. Confidential Space menciptakan sebuah enclave yang terisolasi secara perangkat keras untuk menjalankan model Gemini Flash Lite. Evaluator mengunggah rangkaian tes, yang kemudian disegel oleh enclave dalam "kotak" kriptografis yang tidak dapat dibuka oleh model. Pada saat yang sama, bobot model tetap terenkripsi di dalam enclave, sehingga tidak terlihat oleh evaluator. Enclave tersebut menghasilkan bukti matematis bahwa model tidak pernah mengakses prompt selama proses inferensi. Hasilnya adalah pengujian buta ganda yang sesungguhnya: kedua belah pihak tetap menjaga kerahasiaan masing-masing sementara pihak ketiga menerima metrik performa yang dapat diverifikasi.

Siapa yang akan diuntungkan

  • Regulator dan auditor kini dapat menuntut bukti kemampuan tanpa memaksa penyedia untuk mengungkapkan rahasia dagang.
  • Perusahaan di bidang keamanan siber, pertahanan, atau domain apa pun yang menangani data rahasia dapat menguji alat AI tanpa risiko kebocoran data.
  • Pengembang model dapat mempertahankan keunggulan kompetitif mereka; mereka tidak lagi harus memilih antara keterbukaan atau perlindungan.

Jika pendekatan ini diskalakan, hal ini dapat menjadi metode standar untuk mensertifikasi model mutakhir (frontier models), menggeser industri dari pengaturan berbasis kepercayaan menjadi jaminan berbasis matematika.

Potensi titik hambatan

Sistem ini bergantung pada tumpukan (stack) confidential computing milik Google Cloud, sehingga organisasi yang lebih memilih penyedia cloud lain mungkin akan menghadapi hambatan integrasi. Menjalankan model di dalam enclave menambah latensi dan membatasi akselerator perangkat keras yang tersedia, yang dapat memengaruhi skor tolok ukur. Selain itu, meskipun bukti kriptografis menjamin bahwa model tidak melihat prompt, hal tersebut tidak mencegah manipulasi lain, seperti fine-tuning setelah pengujian dimulai. Kritikus mungkin berpendapat bahwa solusi ini hanya menangani sebagian kecil dari masalah reproduksibilitas yang lebih luas.

Apa yang perlu diperhatikan selanjutnya

  • Adopsi di luar uji coba percontohan – lab AI dan vendor cloud lainnya mungkin akan membangun enclave yang kompatibel, untuk menguji apakah model dapat diaudit di berbagai platform.
  • Badan penetap standar – kelompok keselamatan AI dapat mengkodifikasi audit kriptografis buta ganda sebagai bagian dari kerangka kerja sertifikasi.
  • Pertukaran performa (performance trade-offs) – pengujian tolok ukur di dunia nyata akan mengungkapkan apakah beban tambahan (overhead) dari eksekusi rahasia (confidential execution) dapat diterima untuk model skala besar.

Intinya

Dengan mengunci data pengujian dan model di dalam lingkungan kriptografis yang saling tidak transparan, uji coba Google DeepMind menawarkan jalur nyata menuju benchmarking AI yang tepercaya. Metode ini tidak menghilangkan setiap tantangan audit, tetapi ia menghilangkan sumber bias yang paling mencolok—kontaminasi tolok ukur—tanpa memaksa salah satu pihak untuk menyerahkan aset mereka yang paling berharga. Jika komunitas menerima teknik ini, laporan kemajuan AI di masa depan akhirnya dapat diterima apa adanya.