소프트웨어 엔지니어링은 항상 잘못된 생산성 지표를 쫓아왔습니다. 관리자들은 코드 라인 수를 셌고, 애자일 팀은 스토리 포인트를 추적했습니다. 하지만 그 중 어느 것도 개발자가 명확하게 사고하고 있는지, 아니면 단순히 타이핑을 많이 하고 있는지를 신뢰성 있게 측정하지 못했습니다. Nvidia의 CEO 젠슨 황(Jensen Huang)은 더 나은 척도가 있다고 생각하며, 이는 키보드와는 아무런 상관이 없습니다. GTC 2026 이후 All-In 팟캐스트에 출연한 황은 현대 엔지니어의 가치를 측정하는 진정한 기준은 연봉 대비 얼마나 많은 AI 토큰을 소비하느냐라고 주장했습니다. 메시지는 명확했습니다. 만약 당신이 연간 50만 달러를 벌면서 LLM 서비스에 그 절반도 쓰지 않는다면, 당신은 자신의 급여를 정당화할 도구를 제대로 활용하지 못하고 있을 가능성이 높다는 것입니다.
냉혹한 비율
황이 설명한 지표는 놀라울 정도로 단순합니다. 엔지니어의 연봉을 가져와서, LLM API 호출, 파인튜닝 실행, 에이전트 기반 추론에 들어가는 연간 비용과 비교해 보십시오. 연봉 50만 달러를 받는 숙련된 엔지니어가 AI 토큰 비용으로 25만 달러 미만을 사용한다면, 황은 이를 문제로 봅니다. 이는 개발자가 현대적인 보조 도구로부터 고립되어 작업하고 있거나, AI를 진정한 협업자가 아닌 단순한 검색 엔진 정도로 취급하고 있음을 시사합니다.
이것이 무분별한 지출을 허용하는 면죄부는 아닙니다. 이는 '인지적 부하 처리 능력(load-bearing cognition)'에 대한 테스트입니다. 황의 전제는 엘리트 엔지니어라면 가능한 가장 유능한 모델에 최대한 많은 정신적 단순 반복 작업을 넘겨야 한다는 것입니다. 모델이 전체 코드베이스를 컨텍스트로 보유하고 있다면, 과거에 사흘씩 걸리던 디버깅 세션은 몇 시간으로 압축될 수 있습니다. 긴 회의가 필요했던 시스템 설계 논의도 추론 모델을 활용한 신속한 프로토타이핑을 통해 해결할 수 있습니다. 황에게 25만 달러라는 임계값은 예산의 상한선이라기보다 하한선에 가깝습니다. 이는 최상위 엔지니어가 풀 가동되기 위해 필요한 최소한의 '지능 보조금'을 의미합니다.
그 기준선 아래에 머무는 개발자들은 너무 많은 일을 직접 하고 있는 것입니다. 그들은 수동으로 버그를 추적하고, 보일러플레이트 코드를 직접 작성하며, 적절한 프롬프트를 입력한 모델이라면 몇 초 만에 요약했을 문서를 다시 읽습니다. 추론 비용이 낮아지고 컨텍스트 윈도우가 확장되는 시대에, 토큰을 아끼는 것은 절약이 아니라 활용 미숙을 의미합니다. 이 논리에 따르면, 자신의 결과물을 증폭시키기 위해 AI를 공격적으로 활용하지 못하는 엔지니어는 성과가 저조한 것입니다.
레버리지의 대리 지표로서의 토큰
전통적인 엔지니어링 관리 방식은 눈에 보이는 결과물을 선호합니다. 완료된 Jira 티켓, 푸시된 커밋, 출시된 기능들 말입니다. 이러한 수치들은 셀 수 있기 때문에 안전하게 느껴집니다. 하지만 황의 프레임워크는 이러한 수치들을 대부분 폐기합니다. 그의 논리에 따르면, 시니어 스태프 엔지니어는 주니어보다 원시 커밋 수는 적을 수 있지만 훨씬 더 많은 가치를 창출할 수 있습니다. 그들의 진짜 결과물은 '의사결정'이기 때문입니다. 토큰은 바로 그 의사결정을 기록하는 장부가 됩니다.
엔지니어가 LLM 추론에 많은 비용을 지출할 때, 그들은 단순히 텍스트 생성을 사는 것이 아닙니다. 그들은 '병렬화된 사고'를 사는 것입니다. 리팩토링 문제에 방대한 컨텍스트 윈도우를 투입하는 50만 달러짜리 엔지니어는 본질적으로 수십 개의 인지적 스레드를 동시에 실행하며, 마이크로서비스 전반의 엣지 케이스를 점검하고, 실제 프로덕션 코드를 단 한 줄도 쓰기 전에 아키텍처 가설을 스트레스 테스트하고 있는 것입니다. 토큰은 급여로 지불된 시간을 압축된 결과물로 전환합니다. 토큰은 수백 시간의 수동 작업을 대신할 속도, 아키텍처적 통찰력, 그리고 디버깅 능력을 구매하는 수단입니다.
이는 기존의 인센티브 구조를 뒤집습니다. 엔지니어링 리더들은 역사적으로 클라우드 컴퓨팅 비용 할인을 위해 치열하게 협상해 왔으며, SaaS 조달을 최소화해야 할 비용 센터로 취급해 왔습니다. 황은 AI 시대에는 이러한 사고방식이 거꾸로 되었다고 제안합니다. 토큰 예산은 인재의 수준에 맞춰 확장되어야 합니다. 비싼 인재를 채용해 놓고 가장 비싼 모델을 사용하지 못하게 한다면, 그들을 수동적인 워크플로우에 가두는 꼴이 됩니다. 그들은 고액 연봉을 받는 타이피스트로 전락하게 됩니다. 황이 암시하는 목표는 바로 '지능 밀도(intelligence density)'입니다. 설령 클라우드 청구서가 처음 보기에는 놀라울지라도, 인간의 시간당 적용되는 인지 능력을 극대화하는 것입니다. 만약 엔지니어가 높은 보수를 정당화할 만큼 충분한 토큰을 소비하지 않고 있다면, 그들은 인지적 중노동을 AI에 넘기는 데 실패하고 있는 것이며, 결과적으로 조직에 미칠 잠재적 영향력을 스스로 제한하고 있는 것입니다.
팀은 유지하고, 컴퓨팅은 확장하라
운영 비용이 상승하면 보통 인력 감축 검토가 뒤따릅니다. CFO들은 급증하는 API 비용을 보고 반사적으로 누구를 해고할 수 있을지 묻습니다. 황은 이와 정반대의 처방을 내놓습니다. 예산에 맞추기 위해 팀 규모를 줄이는 대신, 팀의 역량을 강화하기 위해 예산을 최적화해야 한다는 것입니다.
이 논쟁의 핵심은 교체 비용과 조정 오버헤드에 있습니다. 레거시 소프트웨어 조직은 모놀리스를 유지 관리하고, 서로의 풀 리퀘스트(pull request)를 검토하며, 서비스를 천천히 마이그레이션하기 위해 30명의 엔지니어를 배치할 수도 있습니다. 반면, 엔터프라이즈급 토큰 할당량을 아낌없이 사용하는, AI로 고도로 강화된 5명의 소규모 엔지니어 팀이 그 처리량에 필적하거나 이를 능가할 수 있습니다. 절감 효과는 API 비용 항목 자체에서 나타나는 것이 아닙니다. 커뮤니케이션 지연, 채용 주기, 그리고 관료적 비효율성이 사라지는 데서 나타납니다.
이 전략은 방대한 토큰 흐름을 의도적으로 제어할 수 있는 엔지니어를 채용할 때만 유효합니다. 스택 트레이스(stack trace)를 챗봇에 붙여넣기만 하는 개발자와, 멀티 에이전트 파이프라인을 오케스트레이션하고, 풍부한 컨텍스트 라이브러리를 유지하며, 환각(hallucination)된 출력을 엄격하게 검증하는 개발자 사이에는 실질적인 차이가 있습니다. 후자의 프로필은 찾기가 더 어렵습니다. 바로 그렇기 때문에 황(Huang)은 이 지표를 급여와 연결 짓는 것입니다. 높은 보상은 높은 오케스트레이션 능력과 상관관계가 있어야 합니다. 일주일에 한 번 모델에 프롬프트를 입력하는 대가로 50만 달러를 지불하는 것이 아닙니다. 전례 없는 속도로 복잡한 시스템을 구축하는 자동화된 추론 생태계를 관리하는 대가로 지불하는 것입니다.
실무적 의미
엔지니어링 조직에 있어 토큰 대비 급여 비율은 엄격한 회계 규칙이라기보다 문화적 점검 지표에 가깝습니다. 리더들은 가장 높은 급여를 받는 개발자들이 AI를 공격적으로 사용할 수 있는 권한, 교육, 그리고 권한을 부여받았는지 자문해야 합니다. 그들이 레거시 코드에 대해 롱 컨텍스트(long-context) 분석을 수행하고 있습니까, 아니면 여전히 로그를 한 줄씩 grep으로 검색하고 있습니까? 통합 테스트를 위해 에이전트 기반 코딩 도구(agentic coding tools)를 사용하고 있습니까, 아니면 모크(mock)를 직접 작성하고 있습니까? 프로젝트의 병목 현상이 인간의 주의력 때문입니까, 아니면 API 호출 제한(rate limits) 때문입니까?
만약 답이 인간의 병목 현상을 가리킨다면, 해결책은 대개 근무 시간을 늘리는 것이 아닙니다. 보통은 토큰 한도를 높이는 것입니다. 엔지니어가 더 많은 에이전트를 구동할 수 있게 하십시오. 전체 서비스 메쉬(service mesh)에 대해 지속적인 컨텍스트 창을 열어두게 하십시오. 일주일에 두 번이 아니라 오후 한때에 아키텍처를 50번씩 반복 수정할 수 있게 하십시오. 토큰 소비가 불필요한 비용이 아니라 고레버리지(high-leverage) 엔지니어링의 신호로 인식될 때, 기업 내부의 승인 구조가 변화합니다.
물론 지출만으로는 아무것도 보장되지 않습니다. 사소한 질문이나 범위가 불분명한 프롬프트에 쏟아붓는 토큰은 그저 낭비일 뿐입니다. 핵심은 막대한 컴퓨팅 자원을 가치 높은 문제에 집중시키는 절제력에 있습니다. 즉, 서비스 간 설계, 보안 감사, 레거시 마이그레이션을 위한 행동 복제(behavior-cloning), 그리고 합성 학습 데이터 생성 등이 그 예입니다. 이러한 집중력을 마스터한 엔지니어는 승수 효과(multiplier)를 만들어냅니다. 그렇지 못한 엔지니어는 보수 수준과 상관없이 잘못된 방식으로 비용만 많이 드는 인력으로 보이게 됩니다.
핵심 요약
황의 논지는 궁극적으로 AI 지출에 대한 프레임을 재설정하는 것입니다. LLM 토큰을 운영상의 세금처럼 취급하는 것을 멈추십시오. 대신 이를 엔지니어링 속도(velocity)로 전환되는 원자재로 취급하십시오. 이러한 관점에서, 엔지니어가
