Програмна інженерія завжди гналася за неправильними метриками продуктивності. Менеджери рахували рядки коду. Agile-команди відстежували story points. Ніщо з цього не давало надійного розуміння того, чи думає розробник чітко, чи просто багато друкує. Генеральний директор Nvidia Дженсен Хуанг вважає, що має кращий показник, і він не має нічого спільного з клавіатурами. Під час нещодавньої появи в подкасті All-In після GTC 2026 Хуанг стверджував, що справжнє мірило цінності сучасного інженера — це те, скільки AI-токенів він споживає відносно своєї зарплати. Послання було прямим: якщо ви заробляєте пів мільйона доларів на рік, але витрачаєте на сервіси великих мовних моделей менше половини цієї суми, ви, ймовірно, не використовуєте інструменти, які виправдовують вашу зарплату.
Суворий коефіцієнт
Метрика, яку описав Хуанг, вражає своєю простотою. Візьміть річну винагороду інженера. Порівняйте її з його річними витратами на виклики LLM API, запуски fine-tuning та агентний інференс. Якщо висококваліфікований інженер із зарплатою $500,000 на рік витрачає менше $250,000 на AI-токени, Хуанг бачить у цьому проблему. Це свідчить про те, що розробник або працює ізольовано від сучасних помічників, або сприймає AI як вдосконалений пошуковий рушій, а не як справжнього колегу.
Це не дозвіл на безрозсудні витрати. Це тест на когнітивну вантажопідйомність. Теза Хуанга полягає в тому, що елітні інженери мають перекладати якомога більше ментальної рутини на найпотужніші доступні моделі. Сесії налагодження (debugging), які раніше розтягувалися на три дні, можуть стиснутися до кількох годин, коли модель утримує весь кодовий базис у контексті. Дебати щодо дизайну систем, які раніше потребували тривалих нарад, можуть вирішуватися через швидке прототипування за допомогою reasoning-моделі. Для Хуанга поріг у $250,000 — це не стільки стеля бюджету, скільки підлога. Це мінімальна субсидія на інтелект, яка потрібна топовому інженеру для роботи на повну потужність.
Розробники, які не дотягують до цієї межі, роблять занадто багато роботи самостійно. Вони вручну відстежують баги, пишуть шаблонний код (boilerplate) власноруч і перечитують документацію, яку добре сформульований запит до моделі міг би синтезувати за лічені секунди. В епоху, коли вартість інференсу падає, а контекстні вікна розширюються, економія токенів свідчить про недовикористання ресурсів, а не про дисципліну. Інженер, який не використовує AI агресивно для розширення своїх можливостей, згідно з цією логікою, працює неефективно.
Токени як показник важеля впливу
Традиційне управління інженерними командами любить відчуваний результат. Закриті тікети в Jira. Запушені коміти. Випущені фічі. Ці цифри здаються безпечними, бо їх можна порахувати. Фреймворк Хуанга здебільшого відкидає їх. Згідно з його логікою, senior staff engineer може створювати менше сирих комітів, ніж працівник середнього рівня, але при цьому генерувати набагато більше цінності, оскільки його справжній продукт — це рішення. Токени стають реєстром цих рішень.
Коли інженер витрачає значні кошти на LLM-інференс, він купує не просто генерацію тексту. Він купує паралелізоване мислення. Інженер із зарплатою $500,000, який використовує величезні контекстні вікна для вирішення завдання з рефакторингу, по суті запускає десяток одночасних когнітивних потоків, перевіряючи граничні випадки в мікросервісах і стрес-тестуючи архітектурні припущення, ще не написавши жодного рядка робочого коду. Токени конвертують години зарплати в стислі результати. Вони купують швидкість, архітектурну далекоглядність і можливості налагодження, на які інакше пішли б сотні ручних годин.
Це змінює стару структуру стимулів. Керівники інженерних підрозділів історично жорстко домовлялися про знижки на хмарні обчислення та ставилися до закупівлі SaaS як до центру витрат, який потрібно мінімізувати. Хуанг вважає, що такий підхід є помилковим для AI. Бюджет на токени має масштабуватися разом із талантом. Якщо ви наймаєте дорогі мізки, а потім позбавляєте їх найдорожчих моделей, ви замикаєте їх у ручних робочих процесах. Вони стають високооплачуваними друкарками. Мета полягає в тому, що Хуанг називає щільністю інтелекту: максимальна застосована когніція на людино-годину, навіть якщо рахунок за хмарні послуги спочатку виглядає тривожним. Якщо інженер не споживає достатньо токенів, щоб виправдати свою високу винагороду, він, ймовірно, не перекладає важку когнітивну роботу на AI, обмежуючи тим самим свій потенційний вплив на організацію.
Зберігайте команду, розширюйте обчислення
Зростання операційних витрат зазвичай провокує перегляд штату. CFO бачать роздуті рахунки за API та рефлекторно запитують, кого можна скоротити. Хуанг пропонує протилежне рішення. Замість того, щоб скорочувати команду, щоб вписатися в бюджет, компанії мають оптимізувати бюджет, щоб розширити можливості команди.
The argument hinges on replacement costs and coordination overhead. A legacy software organization might staff thirty engineers to maintain a monolith, review each other’s pull requests, and slowly migrate services. A smaller team of five deeply augmented engineers, each burning through enterprise-grade token quotas, could match or exceed that throughput. The savings are not found in the API line item itself. They appear in the absence of communication latency, hiring cycles, and bureaucratic drag.
This strategy only works if you hire engineers who can direct massive token flows with intent. There is a material difference between a developer who pastes a stack trace into a chatbot and one who orchestrates multi-agent pipelines, maintains rich context libraries, and rigorously validates hallucinated outputs. The latter profile is harder to find. That is precisely why Huang ties the metric to salary. High compensation should correlate with high orchestration skill. You do not pay someone half a million dollars to prompt a model once a week. You pay them to manage an ecosystem of automated reasoning that builds complex systems at unprecedented speeds.
What This Means in Practice
For engineering organizations, the token-to-salary ratio is less a rigid accounting rule and more a cultural checkpoint. Leaders should ask whether their highest-paid developers have the access, training, and mandate to consume AI aggressively. Are they running long-context analysis on legacy code, or are they still grepping through logs line by line? Are they using agentic coding tools for integration testing, or are they writing mocks by hand? Are their projects bottlenecked by human attention or by API rate limits?
If the answer points toward human bottlenecks, the fix is rarely to demand more hours. It is usually to raise the token ceiling. Let the engineer spin up more agents. Let them keep a persistent context window open for the entire service mesh. Let them iterate on architecture fifty times in an afternoon instead of twice in a week. When token consumption is viewed as a sign of high-leverage engineering rather than unnecessary cost, permission structures inside companies change.
Of course, spending alone guarantees nothing. Tokens poured into trivial queries or poorly scoped prompts are simply waste. The discipline lies in aiming heavy compute at high-value problems: cross-service design, security auditing, behavior-cloning for legacy migrations, and generating synthetic training data. The engineers who master that aim become multipliers. Those who do not, regardless of their compensation, look expensive in exactly the wrong way.
The Real Takeaway
Huang’s thesis is ultimately about reframing AI spend. Stop treating LLM tokens as an operational tax. Treat them as raw material that gets converted into engineering velocity. In that framing, the engineer who
