Vision-Language-Modelle (VLMs) scheitern noch immer an elementaren visuellen Aufgaben. Eine neue Evaluation durch PerceptionBench ergab, dass keines der sechzehn führenden Systeme eine Gesamtgenauigkeit von über 60 % erreicht, und selbst das stärkste Modell bleibt bei jeder einzelnen Fähigkeit unter 80 %. Das Ergebnis warnt Entwickler davor, dass hohe Punktzahlen in populären Captioning- oder Reasoning-Tests keine zuverlässige Wahrnehmung garantieren.

Warum bestehende Tests das Problem verschleiern

Die meisten öffentlichen Benchmarks vermischen Bildbeschreibung, Question Answering und Commonsense-Reasoning. Wenn ein Modell eine falsche Bildunterschrift ausgibt, könnte der Fehler ein sprachlicher Ausrutscher, ein Denkfehler oder schlicht das Unvermögen sein, das Objekt zu erkennen. Da diese drei Komponenten miteinander verflochten sind, gibt eine schlechte Punktzahl keinen Aufschluss über das visuelle Defizit. Teams, die Anwendungen entwickeln, ziehen daher ein übersteigertes Selbstvertrauen aus den Schlagzeilen und gehen davon aus, dass das Modell „korrekt sieht“.

Was PerceptionBench anders macht

PerceptionBench isoliert zehn visuelle Fähigkeiten und bewertet jedes Modell anhand eines reinen Vision-Aufgabensatzes. Durch das Ausklammern von Sprache und logischem Denken zeigt der Benchmark, wie gut das visuelle Front-End für sich allein funktioniert. Durchweg bleiben die sechzehn besten VLMs unter der Genauigkeitsschwelle von 60 %, und das leistungsstärkste System erreicht bei keiner einzelnen Fähigkeit die 80 %. Halluzinationen – das Erzeugen von Details, die nicht im Bild vorhanden sind – sind der häufigste Fehler, während das Muster aus Stärken und Schwächen zwischen den Modellen stark variiert.

Wer das Nachsehen hat

Entwickler sollten spezialisierte visuelle Klassifikatoren nicht durch allgemeine KI-Modelle ersetzen.

Wo das Argument an seine Grenzen stößt

Die Daten von PerceptionBench zeigen abnehmende Erträge: Selbst die größten Modelle stolpern noch immer über grundlegende Wahrnehmungsaufgaben.

Praktische Schritte für Entwickler

  • Behalten Sie spezialisierte visuelle Klassifikatoren für Aufgaben bei, die Präzision erfordern; betrachten Sie VLMs eher als Ergänzung denn als Ersatz.
  • Fügen Sie eine Verifizierungsebene hinzu, die die Modellausgaben mit einem vertrauenswürdigen Detektor abgleicht, bevor sie den Nutzer erreichen.
  • Setzen Sie einen leichtgewichtigen Vision-Filter ein, um offensichtliche Halluzinationen oder Fehlklassifizierungen frühzeitig in der Pipeline abzufangen.

Die Kombination eines Allzweck-VLM mit einer zweckgebundenen Vision-Komponente ermöglicht es Teams, die Denkfähigkeiten des erstgenannten zu nutzen und sich gleichzeitig gegen dessen visuelle blinde Flecken abzusichern.

Quelle: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1