Ngành kỹ thuật phần mềm luôn theo đuổi những chỉ số năng suất sai lầm. Các nhà quản lý đếm số dòng mã. Các nhóm Agile theo dõi điểm câu chuyện (story points). Không có chỉ số nào trong số đó đo lường một cách đáng tin cậy việc liệu một lập trình viên đang tư duy rõ ràng hay chỉ đơn giản là gõ phím thật nhiều. CEO Nvidia, Jensen Huang, tin rằng ông có một thước đo tốt hơn, và nó chẳng liên quan gì đến bàn phím cả. Trong một lần xuất hiện gần đây trên podcast All-In sau GTC 2026, Huang lập luận rằng thước đo thực sự về giá trị của một kỹ sư hiện đại là họ tiêu thụ bao nhiêu token AI so với mức lương của mình. Thông điệp đưa ra rất trực diện: nếu bạn kiếm được nửa triệu đô la một năm nhưng chi tiêu cho các dịch vụ mô hình ngôn ngữ lớn chưa đến một nửa con số đó, có lẽ bạn đang thất bại trong việc sử dụng các công cụ để xứng đáng với mức lương của mình.
Một tỷ lệ khắt khe
Chỉ số mà Huang mô tả cực kỳ đơn giản. Hãy lấy mức thù lao hàng năm của một kỹ sư. So sánh nó với chi phí hàng năm cho các lệnh gọi LLM API, các đợt tinh chỉnh (fine-tuning) và suy luận agentic (agentic inference). Nếu một kỹ sư trình độ cao kiếm được 500.000 USD mỗi năm nhưng chi tiêu cho chi phí token AI chưa đến 250.000 USD, Huang thấy có vấn đề. Điều đó cho thấy lập trình viên đó hoặc đang làm việc tách biệt với sự hỗ trợ hiện đại, hoặc đang coi AI như một công cụ tìm kiếm được nâng cấp thay vì một cộng sự thực thụ.
Đây không phải là giấy phép để chi tiêu vô tội vạ. Đây là một bài kiểm tra về khả năng chịu tải của nhận thức. Tiền đề của Huang là các kỹ sư ưu tú nên chuyển giao càng nhiều công việc trí óc tẻ nhạt càng tốt cho các mô hình mạnh mẽ nhất hiện có. Các phiên gỡ lỗi (debugging) từng kéo dài ba ngày có thể được nén lại trong vài giờ khi một mô hình nắm giữ toàn bộ mã nguồn trong ngữ cảnh. Các cuộc tranh luận về thiết kế hệ thống vốn đòi hỏi những cuộc họp kéo dài có thể được giải quyết thông qua việc tạo mẫu nhanh (rapid prototyping) với một mô hình suy luận. Đối với Huang, ngưỡng 250.000 USD không hẳn là một mức trần ngân sách mà giống như một mức sàn hơn. Nó đại diện cho mức trợ cấp trí tuệ tối thiểu mà một kỹ sư hàng đầu cần để hoạt động hết công suất.
Những lập trình viên nằm dưới ngưỡng đó đang tự làm quá nhiều việc. Họ truy vết lỗi một cách thủ công, viết mã mẫu (boilerplate) bằng tay và đọc đi đọc lại các tài liệu mà một mô hình được cung cấp prompt tốt có thể tổng hợp trong vài giây. Trong kỷ nguyên mà chi phí suy luận đang giảm dần và cửa sổ ngữ cảnh (context windows) đang mở rộng, sự tiết kiệm token là dấu hiệu của việc chưa tận dụng hết tiềm năng, chứ không phải là sự kỷ luật. Theo logic này, một kỹ sư không quyết liệt sử dụng AI để tăng cường hiệu suất đầu ra của mình là một người làm việc kém hiệu quả.
Token là đại diện cho đòn bẩy
Quản lý kỹ thuật truyền thống luôn yêu thích các đầu ra hữu hình. Các ticket Jira đã đóng. Các commit đã đẩy lên. Các tính năng đã được phát hành. Những con số này mang lại cảm giác an toàn vì chúng có thể đếm được. Khung tư duy của Huang phần lớn loại bỏ chúng. Theo logic của ông, một kỹ sư cấp cao (senior staff engineer) có thể tạo ra ít commit thô hơn một nhân viên cấp trung nhưng lại tạo ra nhiều giá trị hơn nhiều, bởi vì sản phẩm thực sự của họ là các quyết định. Token trở thành sổ cái cho những quyết định đó.
Khi một kỹ sư chi tiêu mạnh tay cho suy luận LLM, họ không chỉ đơn thuần là mua việc tạo văn bản. Họ đang mua khả năng tư duy song song. Một kỹ sư trị giá 500.000 USD sử dụng các cửa sổ ngữ cảnh khổng lồ cho một vấn đề tái cấu trúc mã (refactoring) về cơ bản là đang chạy hàng chục luồng nhận thức đồng thời, kiểm tra các trường hợp biên (edge cases) trên các microservices và kiểm tra sức chịu tải của các giả định kiến trúc mà chưa cần viết một dòng mã thực tế nào. Các token chuyển đổi giờ làm việc theo lương thành các kết quả được nén lại. Chúng mua lấy tốc độ, tầm nhìn kiến trúc và khả năng gỡ lỗi mà nếu không có chúng, sẽ tiêu tốn hàng trăm giờ làm việc thủ công.
Điều này đảo ngược cấu trúc khuyến khích cũ. Các nhà lãnh đạo kỹ thuật trong lịch sử thường thương lượng gay gắt để được giảm giá điện toán đám mây và coi việc mua sắm SaaS là một trung tâm chi phí cần giảm thiểu. Huang gợi ý rằng tư duy đó là ngược đời đối với AI. Ngân sách token nên tỷ lệ thuận với tài năng. Nếu bạn thuê những bộ não đắt giá rồi lại để họ "đói" các mô hình đắt tiền nhất, bạn đang giam cầm họ trong các quy trình làm việc thủ công. Họ sẽ trở thành những người gõ phím giá cao. Mục tiêu mà Huang ám chỉ chính là mật độ trí tuệ: tối đa hóa nhận thức ứng dụng trên mỗi giờ làm việc của con người, ngay cả khi hóa đơn đám mây trông có vẻ đáng báo động lúc ban đầu. Nếu một kỹ sư không tiêu thụ đủ token để xứng đáng với mức thù lao cao của họ, họ có khả năng đang thất bại trong việc chuyển giao các công việc nặng nhọc về nhận thức cho AI, từ đó hạn chế tác động tiềm năng của họ đối với tổ chức.
Giữ vững đội ngũ, mở rộng năng lực tính toán
Chi phí vận hành tăng cao thường dẫn đến việc rà soát nhân sự. Các Giám đốc Tài chính (CFO) thấy hóa đơn API tăng vọt và theo phản xạ sẽ hỏi xem có thể cắt giảm ai. Huang đưa ra một phương thuốc ngược lại. Thay vì thu hẹp đội ngũ để phù hợp với ngân sách, các công ty nên tối ưu hóa ngân sách để trao quyền cho đội ngũ.
The argument hinges on replacement costs and coordination overhead. A legacy software organization might staff thirty engineers to maintain a monolith, review each other’s pull requests, and slowly migrate services. A smaller team of five deeply augmented engineers, each burning through enterprise-grade token quotas, could match or exceed that throughput. The savings are not found in the API line item itself. They appear in the absence of communication latency, hiring cycles, and bureaucratic drag.
This strategy only works if you hire engineers who can direct massive token flows with intent. There is a material difference between a developer who pastes a stack trace into a chatbot and one who orchestrates multi-agent pipelines, maintains rich context libraries, and rigorously validates hallucinated outputs. The latter profile is harder to find. That is precisely why Huang ties the metric to salary. High compensation should correlate with high orchestration skill. You do not pay someone half a million dollars to prompt a model once a week. You pay them to manage an ecosystem of automated reasoning that builds complex systems at unprecedented speeds.
What This Means in Practice
For engineering organizations, the token-to-salary ratio is less a rigid accounting rule and more a cultural checkpoint. Leaders should ask whether their highest-paid developers have the access, training, and mandate to consume AI aggressively. Are they running long-context analysis on legacy code, or are they still grepping through logs line by line? Are they using agentic coding tools for integration testing, or are they writing mocks by hand? Are their projects bottlenecked by human attention or by API rate limits?
If the answer points toward human bottlenecks, the fix is rarely to demand more hours. It is usually to raise the token ceiling. Let the engineer spin up more agents. Let them keep a persistent context window open for the entire service mesh. Let them iterate on architecture fifty times in an afternoon instead of twice in a week. When token consumption is viewed as a sign of high-leverage engineering rather than unnecessary cost, permission structures inside companies change.
Of course, spending alone guarantees nothing. Tokens poured into trivial queries or poorly scoped prompts are simply waste. The discipline lies in aiming heavy compute at high-value problems: cross-service design, security auditing, behavior-cloning for legacy migrations, and generating synthetic training data. The engineers who master that aim become multipliers. Those who do not, regardless of their compensation, look expensive in exactly the wrong way.
The Real Takeaway
Huang’s thesis is ultimately about reframing AI spend. Stop treating LLM tokens as an operational tax. Treat them as raw material that gets converted into engineering velocity. In that framing, the engineer who
