Google DeepMind wdrożyło program pilotażowy, który wykorzystuje kryptograficzne podwójnie ślepe benchmarkowanie do oceny modeli Gemini Flash Lite bez ujawniania promptów testowych lub wag modelu. Ewaluacja odbywa się wewnątrz Confidential Space w Google Cloud, dzięki czemu oceniający nigdy nie widzi modelu, a model nigdy nie widzi pytań – jest to podejście, które może przywrócić wiarygodność raportom dotyczącym wydajności AI.

Dlaczego zanieczyszczenie benchmarków ma znaczenie

Jeśli model trenuje na danych, które później pojawiają się w benchmarku, jego wynik przestaje mierzyć zdolność rozumowania, a staje się miarą zapamiętywania. Doskonały wynik w zanieczyszczonym teście nie mówi więc nic o rzeczywistych możliwościach. Badacze od dawna mierzą się z paradoksem: muszą przekazać dane testowe dostawcy modelu, aby zweryfikować benchmark, ryzykując przedwczesne ujawnienie danych, lub muszą odmówić dostępu zewnętrznego, aby chronić zastrzeżone wagi, co pozostawia audyt niezweryfikowanym. Niedawne opóźnienie w ocenie modelu Fable 5 od Anthropic w benchmarku ARC-AGI pokazuje, jak surowe polityki retencji danych mogą wstrzymywać niezależną ocenę.

Kryptograficzne rozwiązanie

Program pilotażowy zastępuje umowy prawne i obietnice „braku logowania” zabezpieczeniem technicznym. Confidential Space tworzy izolowaną sprzętowo enklawę, w której uruchamiany jest model Gemini Flash Lite. Oceniający przesyła zestaw testowy, który enklawa zamyka w kryptograficznym „pudełku”, którego model nie może otworzyć. Jednocześnie wagi modelu pozostają zaszyfrowane wewnątrz enklawy, niewidoczne dla oceniającego. Enklawa generuje dowód matematyczny na to, że model nigdy nie uzyskał dostępu do promptów podczas wnioskowania (inference). Rezultatem jest prawdziwie podwójnie ślepy przebieg: obie strony zachowują swoje tajemnice, podczas gdy strona trzecia otrzymuje weryfikowalną metrykę wydajności.

Kto może na tym zyskać

  • Regulatorzy i audytorzy mogą teraz żądać dowodów na zdolności modelu, nie zmuszając dostawców do ujawniania tajemnic handlowych.
  • Przedsiębiorstwa z sektora cyberbezpieczeństwa, obronności lub jakiejkolwiek dziedziny zajmującej się danymi zastrzeżonymi mogą testować narzędzia AI bez ryzyka wycieku danych.
  • Deweloperzy modeli zachowują swoją przewagę konkurencyjną; nie muszą już wybierać między otwartością a ochroną.

Jeśli to podejście zostanie przeskalowane, może stać się domyślną metodą certyfikacji modeli typu frontier, przesuwając branżę od porozumień opartych na zaufaniu w stronę gwarancji opartych na matematyce.

Potencjalne trudności

System opiera się na stosie bezpiecznego przetwarzania (confidential computing) Google Cloud, więc organizacje preferujące innych dostawców chmury mogą napotkać trudności z integracją. Uruchamianie modeli wewnątrz enklawy zwiększa opóźnienia i ogranicza dostępne akceleratory sprzętowe, co może wpływać na wyniki benchmarków. Ponadto, choć dowód kryptograficzny gwarantuje, że model nie widział promptów, nie zapobiega innym manipulacjom, takim jak dotrenowywanie (fine-tuning) po rozpoczęciu testu. Krytycy mogą argumentować, że rozwiązanie to dotyczy tylko wąskiego wycinka szerszego problemu powtarzalności.

Na co warto zwrócić uwagę

  • Wdrożenie poza programem pilotażowym – inne laboratoria AI i dostawcy chmury mogą budować kompatybilne enklawy, sprawdzając, czy model można audytować na różnych platformach.
  • Organy ustalające standardy – grupy ds. bezpieczeństwa AI mogą skodyfikować podwójnie ślepe audyty kryptograficzne jako część ram certyfikacji.
  • Kompromisy wydajnościowe – rzeczywiste testy benchmarkowe wykażą, czy narzut związany z bezpiecznym przetwarzaniem jest akceptowalny dla modeli na dużą skalę.

Podsumowanie

Poprzez zamknięcie zarówno danych testowych, jak i modelu w wzajemnie nieprzejrzystym środowisku kryptograficznym, pilotaż Google DeepMind oferuje konkretną ścieżkę do wiarygodnego benchmarkowania AI. Metoda ta nie eliminuje wszystkich wyzwań audytowych, ale usuwa najbardziej rażące źródło stronniczości – zanieczyszczenie benchmarków – nie zmuszając żadnej ze stron do oddania swoich najcenniejszych zasobów. Jeśli społeczność przyjmie tę technikę, przyszłe raporty o postępach w dziedzinie AI będą w końcu mogły być przyjmowane bez zastrzeżeń.