Vercel a ajouté les « AI Gateway Budgets », un plafond de dépenses par projet et par clé API qui bloque automatiquement les appels ultérieurs aux modèles de langage de grande taille (LLM) une fois qu'une limite prédéfinie est atteinte. Cette fonctionnalité est destinée à stopper l'explosion des coûts liés à l'IA, qui peut survenir à cause d'une seule boucle défectueuse ou d'un bug de retry.

Pourquoi un bouton d'arrêt d'urgence dédié uniquement à l'IA est essentiel

Les développeurs utilisant l'AI Gateway de Vercel acheminent les requêtes LLM via l'infrastructure de Vercel et paient pour les jetons (tokens) consommés par ces modèles. Une seule boucle d'injection de prompt ou une politique de retry mal configurée peut générer des milliers de requêtes de jetons en quelques minutes, transformant un budget modeste en une facture à cinq chiffres. Les outils de gestion des dépenses existants sur Vercel fonctionnent au niveau du compte et limitent tout le trafic sortant, pas seulement les appels d'IA. Cette approche trop globale peut paralyser le front-end ou l'API d'un site, même si l'utilisation de l'IA est le seul problème.

En quoi les AI Gateway Budgets diffèrent des contrôles de dépenses standards

  • Périmètre – Les budgets s'appliquent uniquement aux dépenses de jetons d'IA, laissant le reste du compte intact.
  • Granularité – Les limites peuvent être définies au niveau de l'équipe, du projet ou d'une clé API individuelle.
  • Comportement – Lorsqu'une limite est atteinte, la passerelle renvoie une réponse HTTP 402 « Payment Required », signalant que la requête a été bloquée car le budget est épuisé.
  • Isolation – Un projet unique qui atteint son plafond ne peut pas épuiser le reliquat de l'équipe, protégeant ainsi les autres projets des dommages collatéraux.

Configurer un budget en quelques minutes

Vercel vous permet de configurer des budgets via le tableau de bord web ou l'interface de ligne de commande (CLI). La CLI est utile pour l'automatisation (scripting) sur de nombreux environnements.

Limite à l'échelle de l'équipe (mensuelle)

vercel ai-gateway budgets set team --limit 500 --refresh-period monthly

Limite spécifique au projet (mensuelle)

vercel ai-gateway budgets set project my-project --limit 200 --refresh-period monthly

Les budgets se cumulent, c'est donc la limite la plus restrictive des deux qui s'applique. Si le projet atteint son plafond de 200 $, les requêtes s'arrêtent même si l'équipe dispose encore de 300 $.

Clé orientée prestataire

vercel ai-gateway api-keys create --name contractor \
  --limit 50 --refresh-period none --expiration 30d

La clé expire après 30 jours et s'arrête après 50 $ de dépenses d'IA, offrant ainsi une fenêtre d'accès limitée dans le temps et bien définie pour les contributeurs externes.

Ce que les limites font réellement

  • Plafond souple (Soft cap) – La requête qui fait dépasser le seuil de dépenses est tout de même exécutée, un léger dépassement est donc possible.
  • Délai d'application – Les budgets sont évalués toutes les minutes ou deux ; une rafale d'appels juste après l'atteinte d'une limite peut passer avant que le blocage ne s'active.
  • Pas de couverture pour le BYOK – Si vous utilisez vos propres clés de fournisseur cloud (BYOK) pour facturer directement un fournisseur de LLM externe, le système de budget de Vercel ne peut pas voir ce trafic, le plafond ne s'applique donc pas.

Quand la fonctionnalité brille, et quand elle montre ses limites

Le bouton d'arrêt d'urgence est une réponse pragmatique au problème du « choc de la facture d'IA » qui hante de nombreuses équipes SaaS. Pour la plupart des projets hébergés sur Vercel qui s'appuient sur l'AI Gateway intégrée, le budget peut être configuré en moins de dix minutes et constitue un filet de sécurité contre les dépenses excessives accidentelles.

Cependant, la nature de « plafond souple » signifie qu'un pic de consommation de courte durée peut encore coûter quelques dollars de plus que la limite. Les équipes qui ont besoin d'arrêts nets et immédiats (hard stops) pourraient trouver le délai d'une minute insuffisant. De plus, les entreprises qui acheminent le trafic LLM via leurs propres identifiants cloud doivent s'appuyer sur des mécanismes de contrôle des coûts externes, car les budgets de Vercel ne verront pas cette utilisation.

À surveiller ensuite

  • Métriques d'adoption – Les premiers retours des développeurs indiqueront si la granularité des budgets résout les scénarios de dépassement de coûts les plus courants.
  • Extensions de fonctionnalités – Les demandes d'alertes en temps réel, d'intervalles d'application plus serrés ou de plafonds prenant en compte le BYOK pourraient façonner les futures mises à jour.
  • Réponse de la concurrence – D'autres plateformes serverless pourraient introduire des contrôles de dépenses similaires spécifiques à l'IA, faisant de la décision de Vercel une norme plus large dans l'industrie.

L'essentiel

Les AI Gateway Budgets de Vercel offrent aux développeurs un moyen rapide, par projet, d'arrêter les dépenses de jetons d'IA avant qu'elles ne se transforment en une facture surprise. L'outil est facile à activer, fonctionne au niveau où la plupart des incidents de dérapage de coûts se produisent, et renvoie une erreur claire lorsque les limites sont franchies. Ses principaux inconvénients — un léger dépassement, un délai d'application d'une minute et une absence de visibilité sur le trafic BYOK — sont transparents, laissant aux équipes le soin de décider si le compromis correspond à leur tolérance au risque. Pour quiconque effectue des appels LLM sur Vercel, ce nouveau bouton d'arrêt d'urgence est une protection pratique qui mérite d'être configurée dès aujourd'hui.