Разработка программного обеспечения всегда гналась за неверными метриками продуктивности. Менеджеры считали строки кода. Agile-команды отслеживали стори-поинты. Ни то, ни другое не позволяло достоверно оценить, думает ли разработчик ясно или просто много печатает. Генеральный директор Nvidia Дженсен Хуанг считает, что у него есть более точный инструмент измерения, и он никак не связан с клавиатурой. Во время недавнего выступления в подкасте All-In после конференции GTC 2026 Хуанг заявил, что реальным мерилом ценности современного инженера является количество потребляемых им AI-токенов относительно его зарплаты. Посыл был прямым: если вы зарабатываете полмиллиона долларов в год, но тратите на сервисы больших языковых моделей меньше половины этой суммы, вы, вероятно, не используете инструменты, которые оправдывают вашу зарплату.

Жесткое соотношение

Описанная Хуангом метрика поразительно проста. Возьмите годовое вознаграждение инженера. Сравните его с его ежегодными расходами на вызовы LLM API, запуски fine-tuning и агентский инференс. Если высококвалифицированный инженер с зарплатой 500 000 долларов в год тратит на токены ИИ менее 250 000 долларов, Хуанг видит в этом проблему. Это наводит на мысль, что разработчик либо работает в изоляции от современных помощников, либо использует ИИ как продвинутую поисковую систему, а не как полноценного напарника.

Это не лицензия на безрассудные траты. Это тест на когнитивную выносливость. Тезис Хуанга заключается в том, что элитные инженеры должны перекладывать как можно больше ментальной рутины на самые способные из доступных моделей. Сессии отладки, которые раньше растягивались на три дня, могут сжаться до нескольких часов, если модель удерживает весь контекст кодовой базы. Дебаты по проектированию систем, требовавшие долгих совещаний, могут разрешаться путем быстрого прототипирования с помощью модели рассуждения. Для Хуанга порог в 250 000 долларов — это не столько потолок бюджета, сколько его нижний предел. Это представляет собой минимальную «субсидию на интеллект», которая необходима инженеру высшего уровня для работы на полную мощность.

Разработчики, чей показатель ниже этой черты, выполняют слишком много работы самостоятельно. Они вручную отслеживают баги, пишут бойлерплейт руками и перечитывают документацию, которую хорошо составленный промпт позволил бы модели синтезировать за секунды. В эпоху, когда стоимость инференса падает, а контекстные окна расширяются, бережливость в токенах сигнализирует о недоиспользовании ресурсов, а не о дисциплине. Инженер, который не использует ИИ агрессивно для усиления своей производительности, согласно этой логике, работает неэффективно.

Токены как показатель рычага влияния

Традиционный менеджмент в разработке любит осязаемые результаты. Закрытые тикеты в Jira. Запушенные коммиты. Выпущенные фичи. Эти цифры кажутся безопасными, потому что их можно посчитать. Фреймворк Хуанга во многом отбрасывает их. Согласно его логике, Staff engineer может создавать меньше сырых коммитов, чем разработчик среднего уровня, но при этом приносить гораздо больше пользы, потому что его реальный продукт — это решения. Токены становятся реестром этих решений.

Когда инженер тратит значительные средства на инференс LLM, он покупает не просто генерацию текста. Он покупает параллелизованное мышление. Инженер с зарплатой 500 000 долларов, использующий огромные контекстные окна для решения задачи рефакторинга, по сути, запускает дюжину одновременных когнитивных потоков, проверяя граничные случаи в микросервисах и стресс-тестируя архитектурные допущения, еще не написав ни единой строки рабочего кода. Токены превращают зарплатные часы в сжатые результаты. Они покупают скорость, архитектурную прозорливость и возможности отладки, на которые иначе ушли бы сотни часов ручного труда.

Это меняет старую структуру стимулов. Руководители инженерных подразделений исторически жестко торговались за скидки на облачные вычисления и относились к закупкам SaaS как к центру затрат, которые нужно минимизировать. Хуанг предполагает, что такой подход в эпоху ИИ ошибочен. Бюджет на токены должен масштабироваться вместе с талантом. Если вы нанимаете дорогостоящие мозги, а затем лишаете их самых мощных моделей, вы загоняете их в рамки ручных рабочих процессов. Они превращаются в дорогостоящих машинисток. Цель заключается в том, что Хуанг называет «плотностью интеллекта»: максимизация примененного когнитивного ресурса на человеко-час, даже если счет за облако на первый взгляд выглядит пугающе. Если инженер потребляет недостаточно токенов, чтобы оправдать свою высокую компенсацию, он, скорее всего, не перекладывает тяжелую когнитивную работу на ИИ, тем самым ограничивая свое потенциальное влияние на организацию.

Сохраняйте команду, расширяйте вычислительные мощности

Рост операционных расходов обычно провоцирует пересмотр численности штата. Финансовые директора видят раздувающиеся счета за API и рефлекторно спрашивают, кого можно сократить. Хуанг предлагает противоположное решение. Вместо того чтобы сокращать команду под бюджет, компании должны оптимизировать бюджет, чтобы расширить возможности команды.

Аргумент строится на затратах на замещение и накладных расходах на координацию. Традиционная софтверная компания может держать тридцать инженеров для поддержки монолита, проверки pull requests друг друга и медленной миграции сервисов. Небольшая команда из пяти глубоко усиленных ИИ инженеров, каждый из которых расходует корпоративные квоты на токены, может сравниться с ними по пропускной способности или даже превзойти их. Экономия заключается не в самой статье расходов на API. Она проявляется в отсутствии задержек в коммуникации, циклов найма и бюрократической волокиты.

Эта стратегия работает только в том случае, если вы нанимаете инженеров, способных целенаправленно управлять огромными потоками токенов. Есть существенная разница между разработчиком, который вставляет stack trace в чат-бот, и тем, кто оркестрирует мультиагентные конвейеры, поддерживает богатые библиотеки контекста и строго проверяет галлюцинации моделей. Последний тип специалистов найти гораздо сложнее. Именно поэтому Хуан связывает этот показатель с зарплатой. Высокое вознаграждение должно коррелировать с высоким уровнем навыков оркестрации. Вам не платят полмиллиона долларов за то, чтобы человек раз в неделю отправлял промпт модели. Вам платят за управление экосистемой автоматизированного рассуждения, которая строит сложные системы с беспрецедентной скоростью.

Что это значит на практике

Для инженерных организаций соотношение токенов к зарплате — это не столько жесткое правило бухгалтерского учета, сколько культурный ориентир. Руководителям стоит спросить себя: имеют ли их самые высокооплачиваемые разработчики доступ, обучение и полномочия для агрессивного использования ИИ? Проводят ли они анализ устаревшего кода с использованием длинного контекста или по-прежнему ищут информацию в логах через grep, строка за строкой? Используют ли они агентные инструменты кодинга для интеграционного тестирования или пишут моки вручную? Ограничены ли их проекты человеческим вниманием или лимитами API (rate limits)?

Если ответ указывает на «узкие места», связанные с человеческим фактором, решение редко заключается в требовании работать больше часов. Обычно нужно поднять «потолок» потребления токенов. Позвольте инженеру запускать больше агентов. Позвольте им держать открытым постоянное окно контекста для всего service mesh. Позвольте им итерировать архитектуру пятьдесят раз за день вместо двух раз в неделю. Когда потребление токенов рассматривается как признак высокоэффективной инженерии, а не как ненужные расходы, структуры согласования внутри компаний меняются.

Конечно, одни лишь траты ничего не гарантируют. Токены, потраченные на тривиальные запросы или плохо сформулированные промпты, — это просто пустая трата ресурсов. Дисциплина заключается в том, чтобы направлять большие вычислительные мощности на высокоценные задачи: проектирование межсервисного взаимодействия, аудит безопасности, клонирование поведения для миграции устаревших систем и генерацию синтетических обучающих данных. Инженеры, которые освоят этот подход, станут мультипликаторами. Те же, кто этого не сделает, независимо от их вознаграждения, будут выглядеть неоправданно дорогими.

Главный вывод

Тезис Хуана, в конечном счете, заключается в переосмыслении расходов на ИИ. Перестаньте относиться к токенам LLM как к операционному налогу. Относитесь к ним как к сырью, которое преобразуется в скорость разработки (engineering velocity). В такой парадигме инженер, который