Бенчмарк ActiveVision показывает, что современные ведущие мультимодальные большие языковые модели (LLM) справляются лишь с 10,6% задач, требующих повторного взгляда на изображение. В тесте из 17 задач на итеративное восприятие люди успешно справлялись в 96,1% случаев, в то время как GPT-5.5 показала результат 10,6%, а Claude Fable 5 — 3,5%; в одиннадцати задачах модели не дали ни одного правильного ответа.

Почему современные визуальные модели допускают ошибки

Большинство систем машинного зрения воспринимают изображение как разовый входной сигнал. «Визуальный энкодер» извлекает признаки один раз, а затем передает их языковой модели для рассуждения. Такой конвейер (pipeline) не может запросить повторный взгляд, приблизить определенную область или пересмотреть гипотезу. Люди, напротив, делают первоначальное предположение, смещают фокус, собирают новые доказательства и корректируют свой ответ. Бенчмарк формализует этот цикл: каждая задача заставляет модель наблюдать, предлагать действие, наблюдать за результатом и повторять процесс до тех пор, пока не будет сделан правильный вывод.

Что проверял бенчмарк

Исследователи разработали 17 сценариев, требующих многократного наблюдения. Результаты поражают:

  • Участники-люди: 96,1% успеха
  • GPT-5.5: 10,6% успеха
  • Claude Fable 5: 3,5% успеха
  • Одиннадцать задач: каждая протестированная модель получила нулевой результат

Даже когда модели генерировали код для повторной обработки изображения, они не замечали ошибок в собственных результатах, что подтверждает: ограничение носит архитектурный, а не чисто дата-центричный характер.

Ставки для разработчиков и индустрии

Если вы создаете автономных роботов, инспекционных дронов или любую систему, которая должна проверять визуальную информацию во времени, использование моделей с разовым анализом (single-shot) рискованно. Бенчмарк показывает, что современные визуальные конвейеры на базе LLM не могут надежно работать с восприятием, основанным на обратной связи, поэтому они будут пропускать дефекты, неправильно считать предметы или неверно интерпретировать динамические сцены. Увеличение объема обучающих данных или масштабирование параметров не поможет преодолеть этот разрыв; недостающим элементом является механизм контролируемого итеративного наблюдения.

Контраргумент: помогут ли более крупные модели?

Увеличение объема обучающих данных или масштабирование параметров не поможет преодолеть этот разрыв; недостающим элементом является механизм контролируемого итеративного наблюдения.

Пути решения

Исследователи предлагают дополнительное направление:

  • Архитектурное перепроектирование — внедрение управляемого визуального модуля, который может запрашивать новые ракурсы, обрезать области или изменять условия освещения на основе внутреннего состояния модели.

Итог: Современные мультимодальные LLM отлично справляются с ответами на вопросы по статичным изображениям, но пасуют, когда задача требует повторного взгляда. Настоящий визуальный интеллект потребует моделей, способных управлять собственным зрением, а не просто считывать картинку один раз.