Les entreprises déploient massivement des infrastructures d'IA, pourtant un « fossé de calcul » croissant apparaît entre les dépenses d'investissement et la supervision opérationnelle. Alors que les organisations se précipitent pour sécuriser le matériel, elles découvrent que leur capacité à mesurer l'économie unitaire et l'utilisation des GPU ne suit pas la vitesse des investissements.
Le fossé de calcul : investissements rapides contre faible visibilité
Une étude de VentureBeat Pulse Research portant sur 107 entreprises montre un décalage flagrant dans le cycle de vie de l'IA. Les entreprises injectent des capitaux dans l'infrastructure mais manquent de télémétrie pour la gérer. Les intentions de dépenses montent en flèche, mais la maturité de la production reste faible ; seules 21 % des entreprises interrogées exploitent l'IA en production à grande échelle.
Le symptôme le plus critique est l'inefficacité. Quatre-vingt-trois pour cent des entreprises signalent une utilisation des GPU de 50 % ou moins. Pire encore, moins de la moitié (44 %) peuvent suivre rigoureusement ce que leur calcul d'IA coûte réellement. Des investissements massifs et rapides se déploient donc sans la visibilité nécessaire pour piloter l'économie à long terme.
Dynamique changeante des fournisseurs et taux d'attrition élevé
Les hyperscalers traditionnels et les API de modèles dominent la pile. Google Cloud mène avec 48 % d'utilisation, suivi de Microsoft Azure (29 %), AWS (22 %) et Oracle Cloud (22 %). La consommation de modèles se concentre autour de Gemini (41 %) et OpenAI (40 %). Les clouds d'IA spécialisés tels que CoreWeave, Lambda et Together détiennent moins de 2 % du marché.
La volatilité est élevée. Soixante-quatre pour cent des entreprises prévoient de changer ou d'ajouter un fournisseur d'infrastructure dans les douze prochains mois, et 38 % ont l'intention de le faire au cours du prochain trimestre. L'intégration aux piles existantes motive 41 % de ces décisions, tandis que le coût total de possession (TCO) en représente 35 %. Seuls 8 % citent les prix affichés des tokens comme facteur principal.
La prochaine frontière : clouds spécialisés et bande passante mémoire
Les entreprises qui dépassent le stade de l'expérimentation s'intéressent aux clouds spécialisés dans l'IA. Quarante-cinq pour cent prévoient d'évaluer de tels fournisseurs au cours de l'année à venir — le domaine d'évaluation prévu le plus important.
Une nouvelle contrainte technique émerge : la bande passante mémoire, et non la puissance de calcul brute des GPU, limitera l'inférence à grande échelle. Seules environ 20 % des entreprises sont conscientes de ce goulot d'étranglement ou prennent des mesures pour y remédier. Pour les développeurs et les CTO, la maîtrise de la bande passante fera la différence entre une inférence évolutive et des coûts incontrôlés.
Points clés
- L'inefficacité est la norme : 83 % des entreprises font fonctionner les GPU à une utilisation ≤ 50 % ; moins de la moitié peuvent suivre avec précision les dépenses de calcul.
- L'attrition des fournisseurs est élevée : 64 % prévoient de changer ou d'ajouter un fournisseur d'ici un an, en privilégiant l'intégration (41 %) et le TCO (35 %).
- Virage vers la spécialisation : 45 % évalueront des clouds d'IA de niche pour combler le fossé de calcul.
- L'imminence de la bande passante mémoire : Environ 20 % des entreprises reconnaissent ou s'attaquent à ce goulot d'étranglement émergent.
Article
Une enquête de VentureBeat Pulse Research auprès de 107 entreprises montre que 83 % font fonctionner les GPU à la moitié de leur capacité ou moins, tandis que seulement 44 % peuvent déterminer le coût exact de chaque heure de calcul. Ce décalage pousse 64 % des répondants à prévoir un changement ou l'ajout d'un fournisseur d'infrastructure au cours de l'année à venir.
Pourquoi le « fossé de calcul » est crucial aujourd'hui
Les chiffres clés brossent un tableau sombre : les dépenses en IA grimpent, mais la maturité de la production accuse un retard. Seules 21 % des entreprises déclarent exploiter l'IA à grande échelle en production, ce qui signifie que la majeure partie des investissements se trouve dans les laboratoires, les preuves de concept ou le matériel inactif. Une faible utilisation des GPU se traduit directement par un gaspillage de capital — des serveurs à moitié remplis consomment toujours de l'énergie, nécessitent un refroidissement et occupent de l'espace en rack. Lorsque moins de la moitié des organisations peuvent suivre le coût par GPU, la budgétisation devient une devinette, et les directeurs financiers font face à une boîte noire capable de faire exploser le budget technologique annuel.
Comment en sommes-nous arrivés là
La course a commencé lorsque les hyperscalers ont déployé des instances spécifiques à l'IA et des API de type « model-as-a-service ». Google Cloud héberge désormais 48 % des charges de travail interrogées, suivi de Microsoft Azure (29 %), AWS (22 %) et Oracle Cloud (22 %). La consommation de modèles reflète cette répartition, Gemini et OpenAI capturant chacun environ 40 % de l'utilisation. L'attrait était clair : un cloud de confiance, des GPU prêts à l'emploi et un modèle de paiement à l'usage promettant des coûts transparents.
L'étude révèle un coût caché. Les difficultés d'intégration dominent la décision de changement : 41 % citent la difficulté d'intégrer la pile du fournisseur dans les pipelines existants, tandis que 35 % pointent du doigt le coût total de possession. Seuls 8 % affirment que les prix affichés des tokens les éloignent, montrant que les tarifs bruts importent moins que l'adéquation avec l'écosystème.
Les enjeux pour les fournisseurs et les acheteurs
Pour les trois géants du cloud, une part de marché dominante offre un levier, pourtant l'intention d'attrition signale une érosion de cette emprise.
Les acheteurs sont confrontés à deux risques. Premièrement, une faible utilisation continue gonfle le coût par inférence ou par tâche d'entraînement, érodant ainsi la rentabilité de l'IA. Deuxièmement, le manque de visibilité sur les coûts entrave la planification stratégique ; sans une économie unitaire claire, il est difficile de justifier de nouveaux investissements ou de fixer les prix des produits enrichis par l'IA.
L'essor des clouds IA spécialisés
Les clouds IA spécialisés — CoreWeave, Lambda et Together — détiennent actuellement moins de 2 % du marché. Quarante-cinq pour cent des entreprises déclarent qu'elles évalueront ces fournisseurs de niche au cours de l'année à venir, ce qui en fait le principal domaine d'évaluation des fournisseurs prévu. Leur proposition de valeur repose sur une intégration plus étroite avec les chaînes d'outils d'IA, une facturation plus granulaire et un matériel optimisé pour les charges de travail d'IA, ce qui peut porter l'utilisation des GPU bien au-delà du plafond de 50 % qui pèse sur la plupart des entreprises aujourd'hui.
Un angle mort technique : la bande passante mémoire
La conversation sur le matériel évolue. À mesure que les charges de travail d'inférence augmentent, la bande passante mémoire — la vitesse à laquelle les données entrent et sortent d'un GPU — devient un goulot d'étranglement, éclipsant la puissance de calcul brute. Pourtant, seulement environ 20 % des entreprises interrogées reconnaissent cette contrainte ou prennent des mesures pour y remédier. Négliger la bande passante peut signifier que même un GPU pleinement utilisé ne peut pas fournir le débit requis, ce qui entraîne une augmentation du nombre d'instances et des coûts plus élevés.
Contrepoint : les hyperscalers dominent toujours
Il serait prématuré de déclarer la fin de l'ère des hyperscalers. Leur envergure, leur empreinte mondiale et leurs contrats d'entreprise existants en font encore le choix par défaut pour beaucoup. L'enquête montre qu'une majorité de charges de travail restent sur ces plateformes et, pour les organisations ayant des stratégies multi-cloud ancrées, l'inertie peut l'emporter sur l'attrait d'une utilisation plus élevée. De plus, la part de marché limitée des clouds spécialisés suggère que l'intérêt est élevé, mais que la migration sera progressive.
À surveiller ensuite
- Contraintes de bande passante mémoire : À mesure que les charges de travail d'inférence augmentent, la bande passante peut devenir un goulot d'étranglement critique, influençant la sélection du matériel et les décisions d'architecture.
Points clés
- L'inefficacité est la norme : 83 % des entreprises utilisent les GPU à ≤ 50 % de leur capacité ; seules 44 % peuvent suivre avec précision leurs dépenses de calcul.
- Le taux de rotation des fournisseurs est élevé : 64 % prévoient de changer ou d'ajouter un fournisseur d'infrastructure d'ici un an, sous l'impulsion de l'intégration (41 %) et du TCO (35 %).
- Les clouds spécialisés sont en plein essor : 45 % évalueront des clouds IA de niche au cours des douze prochains mois, cherchant à combler l'écart de calcul.
- La bande passante mémoire est une contrainte imminente : Environ 20 % des entreprises sont conscientes de ce goulot d'étranglement émergent ou tentent d'y remédier.
L'écart entre les dépenses en IA et la visibilité économique n'est plus une simple note de bas de page ; il remodèle les stratégies d'approvisionnement et incite à la migration vers des fournisseurs capables de prouver que chaque dollar est utilisé de manière plus efficace.
