Les modèles vision-langage (VLM) manquent encore leur cible sur les tâches visuelles élémentaires. Une nouvelle évaluation, PerceptionBench, a révélé qu'aucun des seize systèmes de pointe ne dépasse 60 % de précision globale, et même le plus performant reste sous la barre des 80 % pour n'importe quelle compétence individuelle. Ce résultat avertit les développeurs que des scores élevés aux tests populaires de légendage ou de raisonnement ne garantissent pas une vision fiable.
Pourquoi les tests existants masquent le problème
La plupart des benchmarks publics mélangent la description d'images, la réponse aux questions et le raisonnement de bon sens. Lorsqu'un modèle génère une mauvaise légende, l'erreur peut provenir d'un lapsus linguistique, d'une erreur de raisonnement ou d'un simple échec de reconnaissance de l'objet. Comme ces trois composantes sont entremêlées, un score médiocre ne donne aucun indice sur la lacune visuelle. Les équipes qui développent des applications tirent donc une confiance excessive des chiffres mis en avant, en supposant que le modèle « voit » correctement.
Ce que PerceptionBench fait différemment
PerceptionBench isole dix capacités visuelles et évalue chaque modèle sur un ensemble de tâches de vision pure. En éliminant le langage et le raisonnement, le benchmark montre la performance réelle de l'interface visuelle. De manière générale, les seize meilleurs VLM n'atteignent pas le seuil de 60 % de précision, et le système le plus performant n'atteint jamais 80 % pour une compétence donnée. L'hallucination — la production de détails qui ne figurent pas dans l'image — est l'erreur la plus courante, tandis que la répartition des forces et des faiblesses varie considérablement d'un modèle à l'autre.
Qui risque de perdre
Les développeurs ne devraient pas remplacer les classificateurs visuels dédiés par des modèles d'IA généralistes.
Là où l'argument faiblit
Les données de PerceptionBench montrent des rendements décroissants : même les plus grands modèles trébuchent encore sur des tâches de perception de base.
Étapes pratiques pour les développeurs
- Conservez des classificateurs visuels dédiés pour les tâches exigeant de la précision ; considérez les VLM comme un complément plutôt que comme un remplacement.
- Ajoutez une couche de vérification qui recoupe les sorties du modèle avec un détecteur fiable avant qu'elles n'atteignent l'utilisateur.
- Déployez un filtre de vision léger pour détecter précocement les hallucinations évidentes ou les erreurs de classification dans le pipeline.
Associer un VLM polyvalent à un composant de vision conçu à cet effet permet aux équipes de profiter des capacités de raisonnement du premier tout en se prémunissant contre ses angles morts visuels.
Source : https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
