Software engineering has always chased the wrong productivity metrics. Managers counted lines of code. Agile teams tracked story points. None of it reliably measured whether a developer was thinking clearly or simply typing a lot. Nvidia CEO Jensen Huang thinks he has a better gauge, and it has nothing to do with keyboards. During a recent appearance on the All-In Podcast following GTC 2026, Huang argued that the real measure of a modern engineer’s value is how many AI tokens they consume relative to their salary. The message was direct: if you earn half a million dollars a year but spend less than half that on large language model services, you are probably failing to use the tools that justify your paycheck.

Una proporción implacable

La métrica que describió Huang es sorprendentemente simple. Tome la compensación anual de un ingeniero. Compárela con su gasto anual en llamadas a la API de LLM, ejecuciones de fine-tuning e inferencia agéntica. Si un ingeniero altamente capacitado que gana 500.000 dólares al año acumula menos de 250.000 dólares en costos de tokens de IA, Huang ve un problema. Sugiere que el desarrollador está trabajando de forma aislada de la asistencia moderna o tratando a la IA como un buscador glorificado en lugar de un colaborador genuino.

Esto no es una licencia para el gasto imprudente. Es una prueba de la capacidad de carga cognitiva. La premisa de Huang es que los ingenieros de élite deberían delegar la mayor cantidad posible de tareas mentales tediosas a los modelos más capaces disponibles. Las sesiones de depuración que antes se extendían durante tres días pueden comprimirse en horas cuando un modelo mantiene todo el código base en contexto. Los debates de diseño de sistemas que solían requerir reuniones prolongadas pueden resolverse mediante el prototipado rápido con un modelo de razonamiento. Para Huang, el umbral de 250.000 dólares es menos un techo presupuestario y más un suelo. Representa el subsidio de inteligencia mínimo que un ingeniero de primer nivel debería necesitar para operar a plena capacidad.

Los desarrolladores que caen por debajo de esa línea están haciendo demasiado trabajo por sí mismos. Rastrean errores manualmente, escriben código repetitivo (boilerplate) a mano y vuelven a leer documentación que un modelo bien instruido podría sintetizar en segundos. En una era en la que los costos de inferencia están bajando y las ventanas de contexto se están expandiendo, la frugalidad con los tokens indica una infrautilización, no disciplina. Un ingeniero que no utiliza agresivamente la IA para aumentar su rendimiento está, bajo esta lógica, rindiendo por debajo de su potencial.

Los tokens como indicador de apalancamiento

A la gestión de ingeniería tradicional le encantan los resultados tangibles. Tickets de Jira cerrados. Commits enviados. Funcionalidades lanzadas. Estos números parecen seguros porque son cuantificables. El marco de trabajo de Huang los descarta en gran medida. Bajo su lógica, un ingeniero de nivel senior staff podría producir menos commits brutos que una contratación de nivel medio mientras genera mucho más valor, porque su verdadero producto son las decisiones. Los tokens se convierten en el libro de contabilidad de esas decisiones.

Cuando un ingeniero gasta mucho en inferencia de LLM, no está simplemente comprando generación de texto. Está comprando pensamiento paralelizado. Un ingeniero de 500.000 dólares que aplica ventanas de contexto masivas a un problema de refactorización está, esencialmente, ejecutando una docena de hilos cognitivos simultáneos, verificando casos de borde en microservicios y poniendo a prueba supuestos arquitectónicos sin haber escrito aún una sola línea de código de producción. Los tokens convierten las horas de salario en resultados comprimidos. Compran velocidad, previsión arquitectónica y capacidades de depuración que, de otro modo, consumirían cientos de horas manuales.

Esto invierte la antigua estructura de incentivos. Los líderes de ingeniería históricamente han negociado duramente descuentos en computación en la nube y han tratado la adquisición de SaaS como un centro de costos que debe minimizarse. Huang sugiere que esa mentalidad es errónea para la IA. El presupuesto de tokens debería escalar con el talento. Si contratas cerebros caros y luego los privas de los modelos más costosos, los atrapas en flujos de trabajo manuales. Se convierten en mecanógrafos de alto precio. El objetivo es lo que Huang implica que es la densidad de inteligencia: la máxima cognición aplicada por hora humana, incluso si la factura de la nube parece alarmante a primera vista. Si un ingeniero no consume suficientes tokens para justificar su alta compensación, es probable que no esté delegando el trabajo cognitivo pesado a la IA, limitando así su impacto potencial en la organización.

Mantener al equipo, expandir la computación

El aumento de los costos operativos suele desencadenar revisiones de plantilla. Los directores financieros (CFO) ven facturas de API disparadas y, por reflejo, preguntan a quién se puede recortar. Huang ofrece la prescripción opuesta. En lugar de reducir el equipo para ajustarse a un presupuesto, las empresas deberían optimizar el presupuesto para empoderar al equipo.

El argumento se basa en los costos de reemplazo y la sobrecarga de coordinación. Una organización de software legacy podría emplear a treinta ingenieros para mantener un monolito, revisar los pull requests de los demás y migrar servicios lentamente. Un equipo más pequeño de cinco ingenieros profundamente aumentados, cada uno consumiendo cuotas de tokens de nivel empresarial, podría igualar o superar ese rendimiento. El ahorro no se encuentra en la partida de la API en sí. Aparece en la ausencia de latencia de comunicación, ciclos de contratación y lastre burocrático.

Esta estrategia solo funciona si contratas ingenieros que puedan dirigir flujos masivos de tokens con intención. Existe una diferencia material entre un desarrollador que pega un stack trace en un chatbot y uno que orquesta pipelines multiagente, mantiene librerías de contexto enriquecidas y valida rigurosamente los resultados alucinados. Este último perfil es más difícil de encontrar. Es precisamente por eso que Huang vincula la métrica al salario. Una alta compensación debería correlacionarse con una alta capacidad de orquestación. No le pagas a alguien medio millón de dólares para que le envíe un prompt a un modelo una vez a la semana. Le pagas para que gestione un ecosistema de razonamiento automatizado que construya sistemas complejos a velocidades sin precedentes.

Qué significa esto en la práctica

Para las organizaciones de ingeniería, la relación token-salario es menos una regla contable rígida y más un punto de control cultural. Los líderes deberían preguntarse si sus desarrolladores mejor pagados tienen el acceso, la capacitación y el mandato para consumir IA de forma agresiva. ¿Están realizando análisis de contexto largo en código legacy, o siguen haciendo grep en los logs línea por línea? ¿Están utilizando herramientas de codificación agénticas para pruebas de integración, o están escribiendo mocks a mano? ¿Están sus proyectos estancados por la atención humana o por los límites de tasa de la API?

Si la respuesta apunta hacia cuellos de botella humanos, la solución rara vez es exigir más horas. Por lo general, es aumentar el techo de tokens. Permite que el ingeniero despliegue más agentes. Permite que mantengan una ventana de contexto persistente abierta para toda la malla de servicios (service mesh). Permíteles iterar sobre la arquitectura cincuenta veces en una tarde en lugar de dos veces en una semana. Cuando el consumo de tokens se ve como una señal de ingeniería de alto apalancamiento en lugar de un costo innecesario, las estructuras de permisos dentro de las empresas cambian.

Por supuesto, el gasto por sí solo no garantiza nada. Los tokens vertidos en consultas triviales o prompts con un alcance deficiente son simplemente desperdicio. La disciplina reside en dirigir la computación intensiva hacia problemas de alto valor: diseño entre servicios, auditoría de seguridad, clonación de comportamiento para migraciones de sistemas legacy y generación de datos de entrenamiento sintéticos. Los ingenieros que dominan ese enfoque se convierten en multiplicadores. Aquellos que no lo hacen, independientemente de su compensación, resultan costosos de la manera exactamente incorrecta.

La verdadera conclusión

La tesis de Huang trata, en última instancia, de redefinir el gasto en IA. Deja de tratar los tokens de los LLM como un impuesto operativo. Trátalos como materia prima que se convierte en velocidad de ingeniería. Bajo ese enfoque, el ingeniero que