Google DeepMind запустила пилотный проект, использующий криптографическое двойное слепое тестирование для оценки своих моделей Gemini Flash Lite без раскрытия тестовых промптов или весов моделей. Оценка проходит внутри Google Cloud Confidential Space, поэтому оценщик никогда не видит модель, а модель никогда не видит вопросы — такой подход может вернуть доверие к отчетам о производительности ИИ.

Почему важно загрязнение бенчмарков

Если модель обучается на данных, которые позже появляются в бенчмарке, её результат перестает измерять способность к рассуждению и превращается в простое заучивание. Идеальный результат на загрязненном тесте, таким образом, ничего не говорит об истинных возможностях. Исследователи давно столкнулись с парадоксом: они должны передать тестовые данные поставщику модели для проверки бенчмарка, рискуя преждевременным раскрытием информации, или же они должны отказать во внешнем доступе для защиты проприетарных весов, оставляя аудит непроверенным. Недавняя задержка в оценке Anthropic Fable 5 на бенчмарке ARC-AGI показывает, как строгие политики хранения данных могут тормозить независимую оценку.

Криптографическое решение

Пилотный проект заменяет юридические контракты и обещания «отсутствия логирования» технической защитой. Confidential Space создает аппаратно-изолированный анклав, в котором запускается модель Gemini Flash Lite. Оценщик загружает тестовый набор, который анклав запечатывает в криптографический «ящик», который модель не может открыть. В то же время веса модели остаются зашифрованными внутри анклава, невидимыми для оценщика. Анклав генерирует математическое доказательство того, что модель не имела доступа к промптам во время инференса. Результатом является по-настоящему двойное слепое тестирование: обе стороны сохраняют свои секреты, в то время как третья сторона получает проверяемую метрику производительности.

Кто выиграет

  • Регуляторы и аудиторы теперь могут требовать доказательств возможностей, не заставляя поставщиков раскрывать коммерческую тайну.
  • Предприятия в сфере кибербезопасности, обороны или любой другой области, работающей с секретными данными, могут тестировать инструменты ИИ без риска утечки данных.
  • Разработчики моделей сохраняют свое конкурентное преимущество; им больше не нужно выбирать между открытостью и защитой.

Если этот подход масштабируется, он может стать стандартным методом сертификации передовых моделей, переводя индустрию от соглашений, основанных на доверии, к гарантиям, основанным на математике.

Потенциальные точки трения

Система опирается на стек конфиденциальных вычислений Google Cloud, поэтому организации, предпочитающие других облачных провайдеров, могут столкнуться с трудностями интеграции. Запуск моделей внутри анклава увеличивает задержку и ограничивает доступные аппаратные ускорители, что может повлиять на результаты бенчмарков. Кроме того, хотя криптографическое доказательство гарантирует, что модель не видела промптов, оно не предотвращает другие манипуляции, такие как дообучение (fine-tuning) после начала теста. Критики могут возразить, что это решение решает лишь узкую часть более широкой проблемы воспроизводимости.

За чем следить дальше

  • Внедрение за пределами пилотного проекта — другие лаборатории ИИ и облачные вендоры могут создавать совместимые анклавы, проверяя, можно ли проводить аудит моделей на разных платформах.
  • Органы по стандартизации — группы по безопасности ИИ могут кодифицировать двойные слепые криптографические аудиты как часть структур сертификации.
  • Компромиссы в производительности — реальные прогоны бенчмарков покажут, будет ли накладной расход на конфиденциальное выполнение приемлемым для крупномасштабных моделей.

Итог

Блокируя как тестовые данные, так и модель внутри взаимно непрозрачной криптографической среды, пилотный проект Google DeepMind предлагает конкретный путь к созданию надежных методов тестирования ИИ. Метод не устраняет все проблемы аудита, но он убирает самый явный источник предвзятости — загрязнение бенчмарков — не заставляя ни одну из сторон отказываться от своих самых ценных активов. Если сообщество примет эту технику, будущие отчеты о прогрессе в области ИИ, наконец, можно будет принимать как истину.