Le rapport de Vercel de juin sur la part de jetons (tokens) montre que les modèles à poids ouverts gèrent 29 % des jetons de la passerelle (gateway), contre 11 % en avril, DeepSeek représentant à lui seul 22,6 % de ce volume. Ce bond signale un changement rapide : les développeurs s'éloignent d'un modèle unique « optimal » pour traiter les modèles d'IA comme une infrastructure routable.
Pourquoi les développeurs traitent les modèles comme une infrastructure
Les modèles à poids ouverts bon marché — dont beaucoup proviennent de fournisseurs chinois — ne coûtent qu'une fraction des offres premium comme Anthropic. Pour des tâches courantes telles que l'extraction de code, le nettoyage de texte ou de simples recherches de données, un modèle qui coûte des centimes plutôt que des dollars peut être plus attractif, même s'il est quelques pourcents moins précis.
Le résultat est un nouveau modèle de conception. Une application envoie d'abord une requête à un modèle à bas coût pour la partie « ennuyeuse » du travail. Si le résultat passe un simple contrôle de qualité, le pipeline se poursuit ; sinon, un modèle plus coûteux est sollicité pour un second passage ou une décision finale. La logique de routage devient l'élément critique, et non le choix d'un modèle unique.
Ce que disent les chiffres
Les données de Vercel, issues de sa passerelle qui sert d'interface à plusieurs fournisseurs d'IA, montrent que les modèles à poids ouverts passent de la périphérie au premier plan. En avril, ils ne représentaient qu'un peu plus d'un dixième de l'ensemble des jetons ; en juin, ils étaient proches d'un tiers. DeepSeek, un modèle chinois, a contribué à lui seul à plus d'un cinquième du volume de jetons.
Les modèles haut de gamme dominent toujours les dépenses. Anthropic, par exemple, continue de capter la majeure partie des dépenses monétaires car son prix par jeton est plus élevé. Le calcul est simple : les modèles bon marché remportent les tâches à haut volume et faible marge, tandis que les modèles coûteux conservent les tâches à forte marge et à fort impact.
Implications pour les agents d'IA
Un agent d'IA effectue généralement une séquence d'étapes : planification, récupération de données, invocation d'outils et affinement des résultats. Lorsque chaque étape peut être assignée au modèle le plus rentable, le coût de fonctionnement global chute de manière spectaculaire.
- La récupération et l'extraction de données n'ont souvent besoin que d'une compréhension linguistique de base, une tâche dans laquelle les modèles bon marché excellent.
- Le jugement final — la partie qui décide si la réponse est acceptable — reste le domaine des modèles premium qui offrent une fiabilité plus élevée.
Cette approche multicouche permet aux développeurs d'automatiser des charges de travail plus importantes sans faire exploser les budgets. Elle impose également un passage du « choisir le meilleur modèle » à « mesurer le succès par étape et router en conséquence ».
Risques et limites
L'aspect économique est convaincant, mais la transition n'est pas sans friction.
- Conformité : Certaines juridictions imposent des règles strictes de manipulation des données qui peuvent limiter l'utilisation de modèles hébergés à l'étranger.
- Complexité de l'hébergement : Les grands modèles premium sont difficiles à exécuter en interne, les organisations doivent donc s'appuyer sur des API externes, ce qui peut augmenter la latence et les préoccupations liées au verrouillage technologique (vendor lock-in).
En raison de ces facteurs, il est peu probable que les modèles bon marché remplacent entièrement les modèles premium. Au lieu de cela, ils deviennent la solution par défaut pour le travail de routine, tandis que les modèles premium restent dans la « couche de décision » où leur coût plus élevé est justifié.
Ce qu'il faut surveiller ensuite
- Outils de routage : À mesure que la couche de routage devient centrale, nous pouvons nous attendre à une vague de SDK et de plateformes qui automatisent la sélection des modèles en fonction de la latence, du coût et des seuils de confiance.
Les développeurs qui commencent à mesurer le succès au niveau de la tâche, à suivre les tentatives de réessai et à séparer clairement le « volume » du « jugement » seront les mieux positionnés pour profiter de cette mentalité d'infrastructure émergente.
À retenir : La pile d'IA est en train de se transformer : d'un choix de modèle unique, elle devient un problème de routage, où les modèles à poids ouverts bon marché gèrent l'essentiel du travail et les modèles premium sont réservés aux décisions à fort impact. Maîtriser ce routage sera le prochain avantage concurrentiel pour les concepteurs d'IA.
