Modele wizualno-językowe (VLM) wciąż nie radzą sobie z podstawowymi zadaniami wizualnymi. Nowa ewaluacja PerceptionBench wykazała, że żaden z szesnastu wiodących systemów nie przekracza 60% ogólnej dokładności, a nawet najsilniejszy pozostaje poniżej 80% w przypadku jakiejkolwiek pojedynczej umiejętności. Wynik ten ostrzega programistów, że wysokie wyniki w popularnych testach opisywania obrazów (captioning) lub rozumowania nie gwarantują niezawodnego „wzroku”.

Dlaczego istniejące testy ukrywają problem

Większość publicznych benchmarków miesza opisywanie obrazów, odpowiadanie na pytania i rozumowanie oparte na zdrowym rozsądku. Gdy model generuje błędny opis, błąd może wynikać z potknięcia językowego, błędu w rozumowaniu lub zwykłego braku rozpoznania obiektu. Ponieważ te trzy komponenty są ze sobą splątane, niski wynik nie daje żadnej wskazówki na temat braków w sferze wizualnej. Zespoły budujące aplikacje czerpią zatem nadmierną pewność siebie z nagłówkowych liczb, zakładając, że model „widzi” poprawnie.

Co PerceptionBench robi inaczej

PerceptionBench izoluje dziesięć zdolności wizualnych i ocenia każdy model na zestawie zadań czysto wizualnych. Poprzez oddzielenie języka i rozumowania, benchmark pokazuje, jak dobrze radzi sobie sam komponent wizualny. We wszystkich przypadkach szesnaście najlepszych modeli VLM nie osiąga progu 60% dokładności, a najlepiej radzący sobie system nigdy nie osiąga 80% w żadnej pojedynczej umiejętności. Halucynacje – generowanie szczegółów, których nie ma na obrazie – są najczęstszym błędem, podczas gdy wzorce mocnych i słabych stron znacznie różnią się między modelami.

Kto może stracić

Programiści nie powinni zastępować dedykowanych klasyfikatorów wizualnych ogólnymi modelami AI.

Gdzie argumentacja zawodzi

Dane z PerceptionBench pokazują malejące korzyści: nawet największe modele wciąż potykają się na podstawowych zadaniach percepcyjnych.

Praktyczne kroki dla programistów

  • Zachowaj dedykowane klasyfikatory wizualne dla zadań wymagających precyzji; traktuj modele VLM jako uzupełnienie, a nie zastępstwo.
  • Dodaj warstwę weryfikacji, która sprawdza wyniki modelu za pomocą zaufanego detektora, zanim trafią one do użytkownika.
  • Wdróż lekki filtr wizualny, aby wcześnie wykrywać oczywiste halucynacje lub błędne klasyfikacje w procesie przetwarzania.

Połączenie ogólnego przeznaczenia modelu VLM ze specjalistycznym komponentem wizualnym pozwala zespołom korzystać z jego zdolności rozumowania, jednocześnie chroniąc przed jego wizualnymi martwymi polami.

Źródło: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1