Le mouvement de l'IA open-source a produit des modèles véritablement impressionnants. DeepSeek traite désormais plus d'un tiers de tous les tokens circulant via la passerelle IA de Vercel. Le GLM-5.2 de Z.ai se classe confortablement dans le top quatre de la plateforme en termes de volume. Il ne s'agit pas de projets de passionnés. Ce sont des systèmes de niveau production gérant de réelles charges de travail d'entreprise à une échelle massive. Compte tenu de ces chiffres, il serait facile de supposer que les laboratoires de pointe comme Anthropic font face à une menace existentielle pour leur position sur le marché.
Cette supposition passe à côté de ce qui se passe réellement.
Le véritable rôle des modèles de pointe
Le PDG de Decagon, Jesse Zhang, a proposé une manière plus claire de comprendre la distinction entre l'IA propriétaire et l'IA open-source. La compétition n'est pas une simple course pour se remplacer mutuellement. Au lieu de cela, les deux catégories servent différentes phases d'un cycle de vie unique en entreprise.
Les modèles de pointe font office de couche de découverte. Lorsqu'une entreprise commence à explorer comment l'IA pourrait transformer un processus interne, la tâche est presque toujours mal définie. Les données d'entrée sont désordonnées. Les résultats souhaités sont vagues. Le succès exige de raisonner à travers l'ambiguïté, de gérer des cas limites que l'équipe n'a pas encore répertoriés et de s'adapter à des prompts qui changent d'heure en heure. Il s'agit de travail de prototypage et de preuve de concept. Cela exige le système le plus performant disponible, peu importe le coût, car l'alternative est une expérience ratée qui n'apprend rien.
Dans cette phase, un modèle de pointe coûteux n'est pas une charge superflue. C'est le coût d'une étude de marché compressé en quelques appels d'API. Une fois que le cas d'usage est prouvé et que le flux de travail est cartographié, la nature du problème change. L'ambiguïté disparaît. Les entrées se standardisent. Les prompts se stabilisent. La tâche est devenue routinière. À ce stade, de nombreuses entreprises migrent la charge de travail vers un modèle plus léger et moins coûteux. Les alternatives open-source prennent le relais et occupent l'étape de production, tandis que les modèles de pointe restent en première ligne, gérant la prochaine vague de problèmes inconnus.
Il ne s'agit pas d'une théorie sur la manière dont l'IA devrait fonctionner. C'est une description de la manière dont les budgets se déplacent déjà.
Lorsque les charges de travail migrent vers le marché de masse
La migration vers l'open source est réelle et elle est visible dans les données de trafic. L'envolée de DeepSeek, qui représente désormais plus d'un tiers du volume de tokens sur l'infrastructure de Vercel, montre que les entreprises exécutent d'énormes quantités d'inférence via des modèles moins chers. Le GLM-5.2 de Z.ai s'est également taillé une place dans le top quatre en gérant un trafic stable et prévisible.
Ces modèles excellent dans les tâches qui ont été maîtrisées. Pensez à l'extraction de données à haut volume à partir de formulaires standardisés, au tri initial du support client qui oriente les tickets en fonction de mots-clés évidents, ou encore au linting de code de routine et à la génération de documentation. Les prompts sont basés sur des modèles. Les modes d'erreur sont compris. Le risque commercial d'un mauvais résultat est contenu. Lorsque le travail est défini et répétitif, le coût de l'inférence devient la préoccupation principale. Exécuter cette même charge de travail sur un modèle à six cents au lieu d'un niveau premium est immédiatement rentable.
Mais le volume n'est pas le chiffre d'affaires. Le fait que les modèles open-source dominent le nombre de tokens ne signifie pas qu'ils dominent la création de valeur. Le volume de tokens mesure l'activité. Les dépenses en tokens mesurent ce que les entreprises sont prêtes à payer pour une capacité irremplaçable.
Là où l'argent circule réellement
Les données de la passerelle IA de Vercel rendent la fracture économique impossible à ignorer. Malgré la dominance de DeepSeek en termes de trafic brut de tokens, Anthropic continue de capter plus de la moitié des dépenses totales en IA sur la plateforme. L'écart entre l'activité et les dépenses tient à un différentiel de prix stupéfiant.
Selon les données d'OpenRouter, l'Opus 4.8 d'Anthropic coûte environ 1,37 $ par million de tokens. Le V4Flash de DeepSeek coûte environ six cents pour le même volume. Opus est affiché à un prix environ vingt-trois fois plus élevé. Ce multiplicateur compte bien plus que le nombre brut de tokens ne le pourra jamais. Une équipe de développement pourrait transférer quatre-vingt-dix pour cent de son volume d'inférence vers le modèle le moins cher et voir tout de même le modèle coûteux représenter la majorité de son budget.
Cette divergence n'est pas un accident. Elle reflète la réalité selon laquelle les fournisseurs de modèles de pointe vendent quelque chose de différent. Ils ne vendent pas seulement des tokens. Ils vendent la capacité de raisonner sur des problèmes qui ne disposent pas de méthodes établies. Les entreprises qui paient des tarifs premium ne le font pas par ignorance. Elles le font parce que les tâches qu'elles confient à ces modèles sont soit à enjeux élevés, soit structurellement complexes. Une équipe juridique analysant une nouvelle exposition réglementaire ne peut tolérer une citation hallucinée. Une équipe produit concevant un workflow agentique multi-étapes a besoin que le modèle enchaîne correctement la logique sur plusieurs tours de parole. Le coût d'un échec dans ces scénarios dépasse de loin le coût de l'appel API.
Les dépenses d'investissement se dirigent vers la couche où la valeur est encore en cours de création, et non simplement exécutée.
Le marché croît plus vite que la migration
Si les modèles open-source sont tellement moins chers, et que les entreprises déplacent activement leurs charges de travail matures vers eux, pourquoi les dépenses liées aux modèles de pointe ne se sont-elles pas effondrées ? La réponse est que le marché total des tâches d'IA exploitables s'étend plus vite que n'importe quel modèle ne peut les transformer en commodité.
Chaque fois qu'une entreprise automatise avec succès un flux de travail prévisible avec une alternative open-source, deux choses se produisent. Premièrement, cette équipe économise de l'argent sur l'exécution. Deuxièmement, ces ressources et ces talents sont réorientés vers des problèmes adjacents plus difficiles. Le travail de routine est désormais géré par des machines, ce qui signifie que les humains peuvent se concentrer sur l'irrégulier, le stratégique et l'imprévisible. Le nouveau problème découvert nécessite presque toujours la profondeur de raisonnement d'un modèle de pointe.
Ce schéma se répète dans tous les secteurs. Une banque automatise la révision de documents à l'aide d'un modèle peu coûteux, puis tourne son attention vers la construction d'un modèle de risque dynamique qui nécessite un jugement nuancé. Une entreprise de logiciels automatise la génération de tests, puis tente de construire un agent de débogage autonome qui doit tracer des erreurs à travers des systèmes distribués. La frontière continue de progresser. Dès qu'une tâche devient une commodité, un cas d'utilisation plus complexe émerge et exige des capacités premium.
De nombreuses tâches d'entreprise restent également trop sensibles pour être confiées à la génération actuelle d'alternatives open-source. Le support au triage médical, les prévisions financières sous surveillance réglementaire et l'analyse de la stratégie de direction comportent des risques de perte qui rendent le coût d'inférence dérisoire face à l'exactitude et à la fiabilité. Ces charges de travail créent un segment premium durable. Le résultat est une économie stable à deux niveaux : une couche à haute marge pour le raisonnement complexe et la découverte, et une couche de commodité à haut volume pour l'exécution de la production de routine.
Ce que cela signifie pour les acheteurs en entreprise
La conclusion pratique est que la sélection du modèle doit suivre la maturité du travail, et non l'idéologie. Construisez et validez de nouvelles applications d'IA sur les modèles de pointe les plus performants auxquels vous avez accès. Payez le prix fort durant la phase de découverte. Il est moins coûteux de le faire que de construire sur un modèle limité, de ne pas parvenir à prouver sa valeur et d'abandonner le projet. Une fois que les entrées, les sorties et les modes de défaillance sont connus, optimisez alors de manière agressive. Transférez la charge de travail stable vers une alternative open-source et réalisez des économies de coûts.
Vouloir forcer chaque tâche dans un seul niveau est une recette pour le gaspillage de capital ou la perte de capacités. Les entreprises qui naviguent correctement dans ce paysage utiliseront des architectures hybrides par défaut, et non par compromis.
L'idée n'est pas que l'open source est en train de perdre, ou que les laboratoires de pointe sont invincibles. C'est que les deux segments croissent, mais qu'ils croissent dans des directions différentes. Les modèles open-source absorbent le monde connu des tâches d'IA. Les modèles de pointe revendiquent l'inconnu. Pour l'avenir prévisible, c'est un arrangement confortable pour les deux.
