Google DeepMind a lancé un projet pilote utilisant un benchmarking cryptographique en double aveugle pour évaluer ses modèles Gemini Flash Lite sans exposer les prompts de test ni les poids du modèle. L'évaluation s'exécute à l'intérieur de Confidential Space de Google Cloud, de sorte que l'évaluateur ne voit jamais le modèle et que le modèle ne voit jamais les questions — une approche qui pourrait restaurer la crédibilité des rapports de performance de l'IA.
Pourquoi la contamination des benchmarks est un enjeu majeur
Si un modèle s'entraîne sur des données qui apparaissent ultérieurement dans un benchmark, son score ne mesure plus le raisonnement mais devient une simple mémorisation. Un résultat parfait sur un test contaminé ne dit donc rien de la capacité réelle. Les chercheurs sont confrontés depuis longtemps à un paradoxe : ils doivent soit remettre les données de test au fournisseur du modèle pour vérifier un benchmark, au risque d'une exposition prématurée, soit refuser l'accès externe pour protéger les poids propriétaires, laissant l'audit non vérifié. Le récent retard dans l'évaluation de Fable 5 d'Anthropic sur le benchmark ARC-AGI montre comment des politiques strictes de rétention des données peuvent freiner l'évaluation indépendante.
Une solution cryptographique
Le projet pilote remplace les contrats juridiques et les promesses de « zéro journalisation » par une protection technique. Confidential Space crée une enclave isolée matériellement qui exécute le modèle Gemini Flash Lite. L'évaluateur télécharge la suite de tests, que l'enclave scelle dans une « boîte » cryptographique que le modèle ne peut pas ouvrir. Parallèlement, les poids du modèle restent chiffrés à l'intérieur de l'enclave, invisibles pour l'évaluateur. L'enclave génère une preuve mathématique que le modèle n'a jamais accédé aux prompts pendant l'inférence. Le résultat est une exécution véritablement en double aveugle : les deux parties gardent leurs secrets tandis qu'une tierce partie reçoit une métrique de performance vérifiable.
Qui peut en bénéficier
- Les régulateurs et les auditeurs peuvent désormais exiger des preuves de capacité sans contraindre les fournisseurs à révéler leurs secrets commerciaux.
- Les entreprises de la cybersécurité, de la défense ou de tout domaine manipulant des données classifiées peuvent tester des outils d'IA sans risquer de fuite de données.
- Les développeurs de modèles conservent leur avantage concurrentiel ; ils n'ont plus besoin de choisir entre ouverture et protection.
Si cette approche se généralise, elle pourrait devenir la méthode par défaut pour certifier les modèles de pointe, faisant passer l'industrie d'accords basés sur la confiance à des garanties basées sur les mathématiques.
Points de friction potentiels
Le système repose sur la pile de calcul confidentiel de Google Cloud, de sorte que les organisations qui préfèrent d'autres fournisseurs de cloud pourraient rencontrer des obstacles à l'intégration. L'exécution de modèles à l'intérieur d'une enclave ajoute de la latence et limite les accélérateurs matériels disponibles, ce qui peut affecter les scores des benchmarks. De plus, bien que la preuve cryptographique garantisse que le modèle n'a pas vu les prompts, elle n'empêche pas d'autres manipulations, telles que l'ajustement fin (fine-tuning) après le début du test. Les critiques pourraient arguer que la solution ne traite qu'une part étroite du problème plus large de la reproductibilité.
À surveiller prochainement
- L'adoption au-delà du projet pilote – d'autres laboratoires d'IA et fournisseurs de cloud pourraient construire des enclaves compatibles, testant ainsi si le modèle peut être audité sur différentes plateformes.
- Les organismes de normalisation – les groupes de sécurité de l'IA pourraient codifier les audits cryptographiques en double aveugle comme faisant partie des cadres de certification.
- Les compromis de performance – les exécutions de benchmarks en conditions réelles révéleront si la surcharge de l'exécution confidentielle est acceptable pour les modèles à grande échelle.
L'essentiel
En verrouillant à la fois les données de test et le modèle dans un environnement cryptographique mutuellement opaque, le projet pilote de Google DeepMind offre une voie concrète vers un benchmarking d'IA fiable. La méthode n'élimine pas tous les défis d'audit, mais elle supprime la source de biais la plus flagrante — la contamination des benchmarks — sans forcer l'une ou l'autre des parties à céder ses actifs les plus précieux. Si la communauté adopte cette technique, les futurs rapports de progrès de l'IA pourraient enfin être pris au sérieux.
