Бенчмарк ActiveVision показує, що сучасні провідні мультимодальні великі мовні моделі (LLM) вирішили лише 10,6% завдань, які потребують повторного перегляду зображення. У тесті з 17 викликів ітеративного сприйняття люди досягали успіху у 96,1% випадків, тоді як GPT-5.5 показала 10,6%, а Claude Fable 5 — 3,5%; у одинадцяти завданнях моделі взагалі не дали жодної правильної відповіді.
Чому сучасні візуальні моделі мають труднощі
Більшість систем зору сприймають зображення як одноразовий вхідний сигнал. «Візуальний енкодер» витягує ознаки лише один раз, а потім передає їх мовній моделі для міркувань. Такий пайплайн не може попросити про повторний погляд, наблизити певну область або переоцінити гіпотезу. Люди, навпаки, роблять перше припущення, змінюють фокус, збирають нові докази та коригують свою відповідь. Бенчмарк формалізує цей цикл: кожне завдання змушує модель спостерігати, пропонувати дію, спостерігати за результатом і повторювати це, доки вона не дійде правильного висновку.
Що саме перевіряв бенчмарк
Дослідники розробили 17 сценаріїв, які потребують повторного спостереження. Результати вражають:
- Учасники-люди: 96,1% успіху
- GPT-5.5: 10,6% успіху
- Claude Fable 5: 3,5% успіху
- Одинадцять завдань: кожна протестована модель отримала нуль балів
Навіть коли моделі генерували код для повторної обробки зображення, вони не помічали помилок у власних результатах, що підтверджує: обмеження є архітектурним, а не суто пов'язаним із даними.
Ризики для розробників та індустрії
Якщо ви створюєте автономних роботів, інспекційні дрони або будь-яку систему, яка має перевіряти візуальну інформацію протягом певного часу, використання моделі зору з одноразовим входом є ризикованим. Бенчмарк показує, що сучасні візуальні пайплайни на основі LLM не можуть надійно працювати зі сприйняттям, що базується на зворотньому зв'язку, тому вони пропускатимуть дефекти, неправильно рахуватимуть об'єкти або хибно інтерпретуватимуть динамічні сцени. Додавання більшої кількості навчальних даних або масштабування параметрів не допоможе подолати цей розрив; відсутнім елементом є механізм контрольованого ітеративного спостереження.
Контраргумент: чи допоможуть більші моделі?
Додавання більшої кількості навчальних даних або масштабування параметрів не допоможе подолати цей розрив; відсутнім елементом є механізм контрольованого ітеративного спостереження.
Шляхи розвитку
Дослідники пропонують доповнювальний напрям:
- Архітектурне перепроектування — впровадження керованого візуального модуля, який може запитувати нові ракурси, обрізати області або змінювати умови освітлення залежно від внутрішнього стану моделі.
Висновок: Сучасні мультимодальні LLM чудово справляються з відповідями на запитання щодо статичних зображень, але пасують, коли проблема потребує повторного погляду. Справжній візуальний інтелект потребуватиме моделей, які зможуть керувати власним зором, а не просто один раз зчитувати картинку.
