A engenharia de software sempre perseguiu as métricas de produtividade erradas. Gestores contavam linhas de código. Equipes ágeis acompanhavam story points. Nada disso media de forma confiável se um desenvolvedor estava pensando com clareza ou apenas digitando muito. O CEO da Nvidia, Jensen Huang, acredita ter um indicador melhor, e ele não tem nada a ver com teclados. Durante uma aparição recente no All-In Podcast após a GTC 2026, Huang argumentou que a verdadeira medida do valor de um engenheiro moderno é quantos tokens de IA ele consome em relação ao seu salário. A mensagem foi direta: se você ganha meio milhão de dólares por ano, mas gasta menos da metade disso em serviços de modelos de linguagem de grande escala (LLM), você provavelmente está falhando em usar as ferramentas que justificam seu contracheque.

Uma Proporção Rígida

A métrica descrita por Huang é surpreendentemente simples. Pegue a remuneração anual de um engenheiro. Compare-a com o seu gasto anual com chamadas de API de LLM, execuções de fine-tuning e inferência de agentes. Se um engenheiro altamente qualificado que ganha US$ 500.000 por ano acumula menos de US$ 250.000 em custos de tokens de IA, Huang vê um problema. Isso sugere que o desenvolvedor está trabalhando isolado da assistência moderna ou tratando a IA como um mecanismo de busca glorificado, em vez de um colaborador genuíno.

Isso não é uma licença para gastos imprudentes. É um teste de carga cognitiva. A premissa de Huang é que engenheiros de elite devem delegar o máximo possível de trabalho mental maçante aos modelos mais capazes disponíveis. Sessões de depuração que antes se estendiam por três dias podem ser comprimidas em horas quando um modelo mantém todo o código-fonte em contexto. Debates de design de sistema que costumavam exigir reuniões longas podem ser resolvidos por meio de prototipagem rápida com um modelo de raciocínio. Para Huang, o limite de US$ 250.000 é menos um teto orçamentário e mais um piso. Representa o subsídio mínimo de inteligência que um engenheiro de alto nível deve precisar para operar em capacidade total.

Desenvolvedores que ficam abaixo dessa linha estão fazendo trabalho demais por conta própria. Eles rastreiam bugs manualmente, escrevem boilerplate à mão e releem documentações que um modelo bem instruído poderia sintetizar em segundos. Em uma era em que os custos de inferência estão caindo e as janelas de contexto estão se expandindo, a frugalidade com tokens sinaliza subutilização, não disciplina. Um engenheiro que falha em utilizar agressivamente a IA para aumentar sua produção está, por essa lógica, com desempenho abaixo do esperado.

Tokens como um Indicador de Alavancagem

A gestão de engenharia tradicional adora resultados tangíveis. Tickets do Jira fechados. Commits enviados. Funcionalidades entregues. Esses números parecem seguros porque são contáveis. O framework de Huang descarta-os em grande parte. Sob sua lógica, um engenheiro sênior pode produzir menos commits brutos do que uma contratação de nível médio, enquanto gera muito mais valor, porque seu verdadeiro produto são as decisões. Os tokens tornam-se o livro de registro dessas decisões.

Quando um engenheiro gasta pesadamente em inferência de LLM, ele não está apenas comprando geração de texto. Ele está comprando pensamento paralelizado. Um engenheiro de US$ 500.000 lançando janelas de contexto massivas em um problema de refatoração está, essencialmente, executando uma dúzia de threads cognitivas simultâneas, verificando casos de borda em microserviços e testando as suposições arquiteturais sob estresse sem ainda escrever uma única linha de código de produção. Os tokens convertem horas de salário em resultados comprimidos. Eles compram velocidade, visão arquitetural e capacidades de depuração que, de outra forma, consumiriam centenas de horas manuais.

Isso inverte a antiga estrutura de incentivos. Líderes de engenharia historicamente negociaram arduamente por descontos em computação em nuvem e trataram a aquisição de SaaS como um centro de custo a ser minimizado. Huang sugere que essa mentalidade está invertida para a IA. O orçamento de tokens deve escalar com o talento. Se você contrata cérebros caros e depois os priva dos modelos mais caros, você os prende em fluxos de trabalho manuais. Eles se tornam digitadores de alto custo. O objetivo é o que Huang implica ser a densidade de inteligência: o máximo de cognição aplicada por hora humana, mesmo que a conta da nuvem pareça alarmante à primeira vista. Se um engenheiro não está consumindo tokens suficientes para justificar sua alta remuneração, ele provavelmente está falhando em delegar o trabalho cognitivo pesado para a IA, limitando assim seu impacto potencial na organização.

Mantenha a Equipe, Expanda o Processamento

O aumento dos custos operacionais geralmente desencadeia revisões de quadro de funcionários. CFOs veem contas de API infladas e perguntam reflexivamente quem pode ser cortado. Huang oferece a prescrição oposta. Em vez de encolher a equipe para caber em um orçamento, as empresas devem otimizar o orçamento para capacitar a equipe.

O argumento baseia-se nos custos de substituição e na sobrecarga de coordenação. Uma organização de software legada pode alocar trinta engenheiros para manter um monólito, revisar os pull requests uns dos outros e migrar serviços lentamente. Uma equipe menor de cinco engenheiros profundamente aumentados, cada um consumindo cotas de tokens de nível empresarial, poderia igualar ou exceder essa produtividade. A economia não é encontrada no item de linha da API em si. Ela aparece na ausência de latência de comunicação, ciclos de contratação e atrito burocrático.

Esta estratégia só funciona se você contratar engenheiros que consigam direcionar fluxos massivos de tokens com intenção. Existe uma diferença material entre um desenvolvedor que cola um stack trace em um chatbot e um que orquestra pipelines multiagentes, mantém bibliotecas de contexto ricas e valida rigorosamente saídas alucinadas. Este último perfil é mais difícil de encontrar. É precisamente por isso que Huang vincula a métrica ao salário. Uma alta remuneração deve estar correlacionada com uma alta habilidade de orquestração. Você não paga meio milhão de dólares a alguém para dar um prompt em um modelo uma vez por semana. Você os paga para gerenciar um ecossistema de raciocínio automatizado que constrói sistemas complexos em velocidades sem precedentes.

O Que Isso Significa na Prática

Para organizações de engenharia, a relação token-salário é menos uma regra contábil rígida e mais um ponto de controle cultural. Os líderes devem se perguntar se seus desenvolvedores mais bem pagos têm o acesso, o treinamento e a autoridade para consumir IA de forma agressiva. Eles estão realizando análises de contexto longo em código legado ou ainda estão fazendo grep nos logs linha por linha? Estão usando ferramentas de codificação agênticas para testes de integração ou estão escrevendo mocks manualmente? Seus projetos estão limitados pela atenção humana ou pelos limites de taxa da API?

Se a resposta apontar para gargalos humanos, a solução raramente é exigir mais horas. Geralmente, é aumentar o teto de tokens. Deixe o engenheiro subir mais agentes. Deixe-os manter uma janela de contexto persistente aberta para toda a service mesh. Deixe-os iterar sobre a arquitetura cinquenta vezes em uma tarde, em vez de duas vezes em uma semana. Quando o consumo de tokens é visto como um sinal de engenharia de alto impacto, em vez de um custo desnecessário, as estruturas de permissão dentro das empresas mudam.

Claro que o gasto por si só não garante nada. Tokens despejados em consultas triviais ou prompts mal delimitados são simplesmente desperdício. A disciplina reside em direcionar computação pesada para problemas de alto valor: design entre serviços, auditoria de segurança, clonagem de comportamento para migrações de legado e geração de dados de treinamento sintéticos. Os engenheiros que dominam esse direcionamento tornam-se multiplicadores. Aqueles que não o fazem, independentemente de sua remuneração, parecem caros da maneira exatamente errada.

A Real Conclusão

A tese de Huang é, em última análise, sobre redefinir os gastos com IA. Pare de tratar os tokens de LLM como um imposto operacional. Trate-os como matéria-prima que é convertida em velocidade de engenharia. Nessa perspectiva, o engenheiro que