OpenAI affirme que son modèle GPT-5.6 Sol a atteint un taux de réussite de 38,3 % sur le benchmark de raisonnement logique ARC-AGI-3, dépassant les 30,2 % de Claude Opus 5 d'Anthropic. Cette avance n'apparaît que lorsque le modèle fonctionne via l'API Responses personnalisée d'OpenAI, qui ajoute deux astuces lors de l'inférence que le banc d'essai officiel ne permet pas.
Les prémices : une course aux armements entre benchmarks
ARC-AGI-3 sonde la capacité d'un modèle à résoudre des problèmes inédits et multi-étapes sans s'appuyer sur des faits mémorisés. Plus tôt cette année, Anthropic a annoncé un bond par quatre sur ce benchmark, plaçant Opus 5 en tête du classement public. Ce résultat a établi un nouveau point de référence pour la capacité « brute » des modèles, car le banc d'essai officiel rejette tout raisonnement intermédiaire après chaque étape, forçant le modèle à repartir de zéro à chaque fois.
L'affirmation d'OpenAI s'inscrit dans ce même climat de compétition. En publiant un score plus élevé, l'entreprise signale que sa dernière génération peut non seulement égaler, mais aussi dépasser la performance logique de son principal rival. Le titre masque toutefois une nuance technique qui redéfinit la manière dont la communauté interprète les tableaux de benchmarks.
Ce que les chiffres signifient réellement
Lorsque GPT-5.6 Sol est évalué avec le même banc d'essai officiel ARC-AGI-3 qui a donné à Opus 5 son résultat de 30,2 %, le taux de réussite du modèle s'effondre à 7,8 %. Cet écart n'est pas un bug ; c'est le résultat de deux fonctionnalités conçues par OpenAI et intégrées au modèle :
- Retained Reasoning – au lieu d'effacer la chaîne de pensée (chain-of-thought) après chaque sous-tâche, le système conserve le texte intermédiaire, permettant au modèle de se référer à des déductions antérieures et de construire un argumentaire cumulatif.
- Compaction – plutôt que de tronquer le contexte ancien pour respecter les limites de tokens, le wrapper compresse les étapes précédentes en un court résumé, préservant ainsi le fil logique tout en maintenant une taille de prompt gérable.
Ces deux mécanismes résident dans l'API Responses propriétaire. En fournissant au modèle un contexte plus riche et continu, OpenAI augmente efficacement la « mémoire » du modèle et lui permet de réutiliser son propre raisonnement. Le banc d'essai officiel, en revanche, impose un mode « stateless » (sans état) strict qui supprime ces avantages.
Pourquoi la méthodologie est importante
Cet épisode met en lumière une fracture croissante dans l'évaluation de l'IA : les scores bruts des modèles par rapport à la performance au niveau du système. OpenAI soutient qu'un benchmark devrait refléter l'ensemble de la pile technologique que les développeurs déploieront réellement : le modèle, le pipeline d'inférence et la gestion de la mémoire. De ce point de vue, un score de 38,3 % indique à une équipe produit que l'offre combinée peut résoudre plus de tâches réelles qu'un modèle évalué de manière isolée.
Les critiques affirment que cela brouille le progrès scientifique. Si chaque laboratoire ajoute des wrappers sur mesure, le classement devient un assemblage de tours de passe-passe techniques plutôt qu'une comparaison pure de l'intelligence des modèles. Le banc d'essai officiel ARC-AGI-3 existe pour garantir l'équité, en s'assurant qu'un chiffre plus élevé signale un modèle sous-jacent réellement plus puissant, et non un wrapper plus intelligent.
Enjeux pour les développeurs et les investisseurs
Pour les startups qui développent des produits basés sur l'IA, la distinction est concrète. Un modèle capable de conserver son raisonnement et de compacter le contexte peut nécessiter moins d'ingénierie de prompt, une latence d'inférence plus faible et moins d'appels API pour parvenir à une solution. Cela se traduit par des factures de calcul moins élevées et des expériences utilisateur plus fluides. Les entreprises qui livrent un système clé en main — modèle plus couche d'inférence optimisée — acquièrent un avantage concurrentiel là où la vitesse et le coût sont primordiaux.
Les investisseurs surveillent la progression dans les benchmarks comme indicateurs des revenus futurs. Une avance qui fait la une peut booster la valorisation d'une entreprise, même si la capacité brute du modèle sous-jacent est équivalente à celle de ses rivaux. Le débat sur ce que les chiffres représentent influence donc la manière dont les capitaux circulent dans le secteur de l'IA.
À surveiller ensuite
- Réponses des organismes de normalisation – les organisateurs de benchmarks pourraient durcir les règles concernant les astuces d'inférence « externes » ou ajouter une catégorie « système » distincte qui les autorise explicitement. Leur réponse façonnera la prochaine vague de classements publics.
- Wrappers open-source – si la communauté publie ses propres implémentations du « retained reasoning » et de la « compaction », cet avantage pourrait devenir une fonctionnalité de base plutôt qu'un atout propriétaire.
- Bancs d'essai en conditions réelles – les entreprises publient de plus en plus leurs performances sur des ensembles de problèmes propriétaires (par exemple, des suites internes de génération de code). Ces résultats, bien que moins comparables, commenceront à compter davantage qu'un seul benchmark public.
Contre-argument : s'agit-il de « manipuler » le benchmark ?
Certains chercheurs qualifient l'utilisation d'API personnalisées de « benchmark gaming », arguant que cela gonfle les scores sans faire progresser la compréhension fondamentale des modèles. Ils soulignent qu'un modèle dont les performances s'effondrent pour atteindre un niveau à un seul chiffre sous des contraintes strictes est encore loin de l'objectif de l'AGI. La crainte est que le domaine ne commence à récompenser les raccourcis d'ingénierie plutôt que les véritables avancées en matière de capacités de raisonnement.
Du côté d'OpenAI, on souligne que la distinction entre modèle et système est de plus en plus artificielle. Les applications d'IA modernes font rarement tourner un modèle en vase clos ; elles reposent toujours sur une couche de service qui gère la mise en cache, l'assemblage du contexte et le post-traitement des sorties. Sous cet angle, mesurer l'ensemble du pipeline est une approche plus honnête de ce que les utilisateurs expérimentent réellement.
À retenir
L'histoire de GPT-5.6 Sol montre que les victoires actuelles sur les benchmarks dépendent autant de l'ingénierie de l'inférence que de la taille du modèle. La question de savoir si la communauté adoptera les scores au niveau du système ou s'il faudra limiter les wrappers personnalisés déterminera la manière dont nous interpréterons les prochains titres de « leaderboards ». Pour quiconque construit ou finance des produits d'IA, la leçon est claire : les chiffres bruts comptent, mais le logiciel environnant peut être le facteur décisif de la performance en conditions réelles.
