Benchmark ActiveVision menunjukkan bahwa model bahasa besar (LLM) multimodal terkemuka saat ini hanya mampu menyelesaikan 10,6% tugas yang memerlukan pengamatan gambar lebih dari satu kali. Dalam pengujian terhadap 17 tantangan persepsi iteratif, manusia berhasil 96,1% dari waktu yang ada, sementara GPT-5.5 hanya mencapai 10,6% dan Claude Fable 5 mencapai 3,5%; sebelas dari tugas tersebut tidak menghasilkan satu pun jawaban benar dari model-model tersebut.

Mengapa model visi saat ini sering gagal

Sebagian besar sistem visi memperlakukan gambar sebagai input sekali jalan. Sebuah “vision encoder” mengekstrak fitur satu kali, lalu menyerahkannya ke model bahasa untuk penalaran. Alur kerja (pipeline) ini tidak dapat meminta pengamatan kedua, memperbesar (zoom in) pada suatu area, atau mengevaluasi ulang sebuah hipotesis. Sebaliknya, manusia membuat tebakan awal, mengalihkan fokus, mengumpulkan bukti baru, dan menyesuaikan jawaban mereka. Benchmark ini memformalkan siklus tersebut: setiap tugas memaksa model untuk mengamati, mengusulkan tindakan, mengamati hasilnya, dan mengulanginya hingga mencapai kesimpulan yang benar.

Apa yang diuji oleh benchmark ini

Para peneliti membangun 17 skenario yang memerlukan pengamatan berulang. Hasilnya sangat mencolok:

  • Peserta manusia: keberhasilan 96,1%
  • GPT-5.5: keberhasilan 10,6%
  • Claude Fable 5: keberhasilan 3,5%
  • Sebelas tugas: setiap model yang diuji mendapat skor nol

Bahkan ketika model menghasilkan kode untuk memproses ulang gambar, mereka tetap melewatkan kesalahan pada output mereka sendiri, yang mengonfirmasi bahwa keterbatasan ini bersifat arsitektural, bukan sekadar karena faktor data.

Risiko bagi pengembang dan industri

Jika Anda sedang membangun robot otonom, drone inspeksi, atau sistem apa pun yang harus memverifikasi informasi visual dari waktu ke waktu, model visi satu kali jalan (single-shot) sangatlah berisiko. Benchmark ini menunjukkan bahwa alur kerja visi berbasis LLM saat ini tidak dapat menangani persepsi berbasis umpan balik (feedback-driven) secara andal, sehingga mereka akan melewatkan cacat, salah menghitung barang, atau salah menafsirkan adegan dinamis. Menambah lebih banyak data pelatihan atau meningkatkan skala parameter tidak akan menutup celah tersebut; elemen yang hilang adalah mekanisme untuk pengamatan iteratif yang terkendali.

Argumen tandingan: dapatkah model yang lebih besar membantu?

Menambah lebih banyak data pelatihan atau meningkatkan skala parameter tidak akan menutup celah tersebut; elemen yang hilang adalah mekanisme untuk pengamatan iteratif yang terkendali.

Langkah ke depan

Para peneliti menyarankan arah pelengkap:

  • Redesain arsitektural – menanamkan modul visual yang dapat dikendalikan yang mampu meminta tampilan baru, memotong (crop) area, atau mengubah kondisi pencahayaan berdasarkan status internal model.

Kesimpulan: LLM multimodal saat ini sangat mahir dalam menjawab pertanyaan tentang gambar statis, tetapi gagal ketika sebuah masalah memerlukan pengamatan ulang. Kecerdasan visual yang sesungguhnya akan membutuhkan model yang dapat mengendalikan penglihatannya sendiri, bukan sekadar membaca gambar satu kali.