A Vercel adicionou o “AI Gateway Budgets”, um limite de gastos por projeto e por chave de API que bloqueia automaticamente novas chamadas de modelos de linguagem de grande escala (LLM) assim que um limite predefinido é atingido. O recurso visa interromper custos de IA descontrolados que podem explodir devido a um único loop malicioso ou erro de tentativa de reenvio (retry).

Por que um kill switch dedicado apenas para IA é importante

Desenvolvedores que utilizam o AI Gateway da Vercel roteiam requisições de LLM através da infraestrutura da Vercel, pagando pelos tokens que esses modelos consomem. Um único loop de injeção de prompt ou uma política de retry mal configurada pode gerar milhares de requisições de tokens em minutos, transformando um orçamento modesto em uma conta de cinco dígitos. As ferramentas de gerenciamento de gastos existentes na Vercel operam no nível da conta e limitam todo o tráfego de saída, não apenas as chamadas de IA. Essa abordagem imprecisa pode comprometer o front-end ou a API de um site, mesmo quando o uso de IA é o único problema.

Como o AI Gateway Budgets difere dos controles de gastos padrão

  • Escopo – Os orçamentos aplicam-se apenas aos gastos com tokens de IA, deixando o restante da conta intacto.
  • Granularidade – Os limites podem ser definidos no nível da equipe, do projeto ou de uma chave de API individual.
  • Comportamento – Quando um limite é atingido, o gateway retorna uma resposta HTTP 402 “Payment Required”, sinalizando que a requisição foi bloqueada porque o orçamento se esgotou.
  • Isolamento – Um único projeto que atinja seu limite não pode consumir a verba restante da equipe, protegendo outros projetos de danos colaterais.

Configurando um orçamento em minutos

A Vercel permite configurar orçamentos através do painel web ou da interface de linha de comando (CLI). A CLI é útil para automação (scripting) em diversos ambientes.

Limite para toda a equipe (mensal)

vercel ai-gateway budgets set team --limit 500 --refresh-period monthly

Limite específico do projeto (mensal)

vercel ai-gateway budgets set project my-project --limit 200 --refresh-period monthly

Os orçamentos são cumulativos, portanto, o limite mais restritivo dos dois será aplicado. Se o projeto atingir seu teto de US$ 200, as requisições param, mesmo que a equipe ainda tenha US$ 300 restantes.

Chave orientada a prestadores de serviço

vercel ai-gateway api-keys create --name contractor \
  --limit 50 --refresh-period none --expiration 30d

A chave expira após 30 dias e é interrompida após US$ 50 de gastos com IA, proporcionando uma janela de acesso limpa e com tempo determinado para colaboradores externos.

O que os limites realmente fazem

  • Limite flexível (Soft cap) – A requisição que ultrapassa o limite de gastos ainda é concluída, portanto, um pequeno excesso é possível.
  • Atraso na aplicação (Enforcement lag) – Os orçamentos são avaliados uma vez a cada um ou dois minutos; uma rajada de chamadas logo após o limite ser atingido pode passar antes que o bloqueio seja ativado.
  • Sem cobertura para BYOK – Se você utilizar suas próprias chaves de provedor de nuvem (BYOK) para faturar diretamente com um provedor de LLM externo, o sistema de orçamento da Vercel não conseguirá visualizar esse tráfego, portanto, o limite não se aplica.

Quando o recurso brilha e quando ele deixa a desejar

O kill switch é uma resposta pragmática ao problema do “choque de faturas de IA” que tem assombrado muitas equipes de SaaS. Para a maioria dos projetos hospedados na Vercel que dependem do AI Gateway integrado, o orçamento pode ser configurado em menos de dez minutos e oferece uma rede de segurança contra gastos excessivos acidentais.

No entanto, a natureza de "soft cap" significa que um pico de curto prazo ainda pode custar alguns dólares além do limite. Equipes que precisam de interrupções absolutas (hard stops) podem considerar o atraso de nível de minutos insuficiente. Além disso, empresas que roteiam o tráfego de LLM através de suas próprias credenciais de nuvem devem confiar em mecanismos externos de controle de custos, já que os orçamentos da Vercel não visualizarão esse uso.

O que observar a seguir

  • Métricas de adoção – O feedback inicial dos desenvolvedores indicará se a granularidade do orçamento resolve os cenários de excesso de custos mais comuns.
  • Extensões de recursos – Solicitações de alertas em tempo real, intervalos de aplicação mais rigorosos ou limites compatíveis com BYOK podem moldar atualizações futuras.
  • Resposta da concorrência – Outras plataformas serverless podem introduzir controles de gastos específicos para IA semelhantes, transformando o movimento da Vercel em um padrão mais amplo da indústria.

Resumo final

O AI Gateway Budgets da Vercel oferece aos desenvolvedores uma maneira rápida e por projeto de interromper os gastos com tokens de IA antes que eles se transformem em uma fatura surpresa. A ferramenta é fácil de ativar, funciona no nível onde a maioria dos incidentes de custos descontrolados acontece e retorna um erro claro quando os limites são violados. Suas principais desvantagens — um pequeno excesso, um atraso de aplicação de nível de minutos e a falta de visibilidade sobre o tráfego BYOK — são transparentes, deixando para as equipes a decisão de se o equilíbrio atende à sua tolerância ao risco. Para qualquer pessoa que execute chamadas de LLM na Vercel, o novo kill switch é uma salvaguarda prática que vale a pena configurar hoje mesmo.