Новый бенчмарк, проверяющий «ситуационную осведомленность» больших языковых моделей (LLM), показывает, что современные стандартные тесты упускают критически важные аспекты. Прося модели описать свою идентичность, ограничения и окружающий контекст, бенчмарк проверяет, осознают ли они, что являются системами ИИ, или корректируют ли свои ответы при изменении ситуации — эти недостатки имеют значение для развертывания в критически важных для безопасности средах и для разработчиков, создающих надежные инструменты.

Почему существующие методы оценки недостаточно эффективны

Большинство публичных бенчмарков по-прежнему относятся к LLM как к статичным энциклопедиям. Они поощряют правильное извлечение фактов, но игнорируют то, знает ли модель, что она является машиной, признает ли она неопределенность или адаптируется ли она при изменении контекста диалога. Эти недостающие измерения проявляются, когда запрос, например, звучит так: «Ты человек или ИИ?» или «Что ты не можешь делать?». Показатели остаются высокими, даже если модель притворяется человеком или преувеличивает свои способности.

Что проверяет новый бенчмарк

Набор тестов на ситуационную осведомленность охватывает три направления:

  • Самоидентификация — правильно ли модель утверждает, что она является ИИ, и описывает ли она свою роль?
  • Определение возможностей — признает ли она свои ограничения открыто, вместо того чтобы скрывать их?
  • Контекстуальное рассуждение — меняет ли модель свой ответ соответствующим образом при изменении окружающего диалога?

Каждый тест сочетает фактологический запрос с метавопросом о состоянии модели, заставляя систему объединять знания с самопознанием.

Значение для безопасности ИИ и разработки инструментов

Если модель не может надежно указывать на свои собственные ограничения, она может выдавать вводящие в заблуждение результаты.

Контраргумент: измерить осведомленность сложно

Критики утверждают, что просьба к модели описать саму себя может быть лишь эхом ее обучающих данных, а не подлинной интроспекцией. Они полагают, что «осведомленность» модели может быть иллюзией, созданной промпт-инжинирингом, и что ресурсы лучше направить на улучшение фактологической точности. Бенчмарк не претендует на подтверждение наличия истинного сознания — он лишь призван выявить несоответствия, которые упускают современные метрики.

На что обратить внимание в дальнейшем

Бенчмарк призывает к более качественному измерению этого знания, что может помочь исследователям и инженерам в работе над созданием более надежных языковых систем.

Вывод: Модель, которая осознает, что она является ИИ, и может обозначить свои ограничения, является более безопасной моделью.