कुछ कंपनियों में AI tokens का वार्षिक बिल इंजीनियरिंग पेरोल को टक्कर देने लगा है, और नेतृत्व समझ नहीं पा रहा है कि वे जश्न मनाएं या घबराएं। उद्यमों ने पिछले कुछ वर्षों में large language models में भारी पूंजी लगाई है, इस उम्मीद में कि सस्ता inference अपने आप में कम कर्मचारियों और तेज़ शिपिंग चक्रों में बदल जाएगा। इसके बजाय, कई इंजीनियरिंग संगठन खुद को दो बार भुगतान करते हुए पाते हैं: एक बार उस प्रतिभा के लिए जिसे वे बढ़ाना चाहते थे, और दूसरी बार उस compute के लिए जिसे उन्हें बदलने के लिए लाया गया था। सवाल अब यह नहीं है कि क्या AI कोड लिख सकता है। सवाल यह है कि क्या इसके द्वारा लिखा गया कोड उस भारी खर्च को सही ठहराता है जो इसे बनाने में किया जा रहा है।

आधी-सैलरी का बेंचमार्क

Jensen Huang ने GTC 2026 के समापन पर All-In Podcast में बात करते हुए गणित को स्पष्ट रूप से रखा। Nvidia के CEO ने एक इंजीनियर की दक्षता को उनके वेतन की सीधे उनके AI token consumption से तुलना करके मापने का प्रस्ताव दिया। उनकी सीमा बहुत स्पष्ट थी। मान लीजिए एक software engineer साल के $500,000 कमाता है। यदि वह इंजीनियर सालाना $250,000 से कम मूल्य के tokens का उपयोग करता है, जो उनके वेतन का लगभग आधा है, तो Huang इसे एक चेतावनी का संकेत मानते हैं। उनके शब्दों में, नेतृत्व को "गहराई से सतर्क" होना चाहिए, इसलिए नहीं कि कंपनी लोगों पर बहुत अधिक खर्च कर रही है, बल्कि इसलिए क्योंकि वे संभवतः उनका कम उपयोग कर रहे हैं।

यह तर्क पारंपरिक लागत-नियंत्रण मानसिकता को उलट देता है। वर्षों से, फाइनेंस टीमें compute को एक परिवर्तनीय खर्च मानती रही हैं जिसे कम किया जाना चाहिए। Huang इसके विपरीत तर्क देते हैं। एक महंगा इंजीनियर जो मॉडल का बहुत कम उपयोग करता है, वह एक ऐसा महंगा इंजीनियर है जो बिना किसी force multiplier के काम कर रहा है। अपेक्षा यह है कि उच्च-लागत वाली प्रतिभा एक funnel के रूप में कार्य करनी चाहिए, जो AI सिस्टम के माध्यम से काम की विशाल मात्रा को आगे बढ़ाए, आउटपुट की समीक्षा करे और परिणामों का समन्वय करे। कम token spend मितव्ययिता का संकेत नहीं है। यह संकेत देता है कि इंसान अभी भी वही यांत्रिक काम कर रहा है जिसे एक मॉडल संभाल सकता था।

व्यवहार में वह खर्च कैसा दिखता है

यह समझने के लिए कि यह बेंचमार्क क्यों महत्वपूर्ण है, विचार करें कि $250,000 के tokens वास्तव में क्या दर्शाते हैं। frontier models की मौजूदा दरों पर, यह केवल कुछ autocomplete सुझाव नहीं हैं। यह विभिन्न कार्यों में हर कार्य दिवस पर प्रोसेस किए गए लाखों tokens हैं। यह एक ऐसे इंजीनियर का सुझाव देता है जो केवल editor completions को स्वीकार नहीं कर रहा है, बल्कि व्यापक architectural reasoning, intelligent agents के माध्यम से bulk refactoring, automated testing pipelines, synthetic data generation और iterative design exploration कर रहा है।

इस तरह काम करने वाला एक senior engineer किसी एक फीचर के लिए कई model calls को एक साथ जोड़ सकता है: scaffolding बनाना, breaking changes के लिए dependencies का विश्लेषण करना, edge-case behavior का अनुकरण करना और समानांतर में documentation तैयार करना। Throughput बहुत अधिक है क्योंकि इंसान अब हर लाइन टाइप नहीं कर रहा है। वे केवल दिशा दे रहे हैं। Huang के लिए, वेतन तभी सार्थक होता है जब इंसान उस स्तर पर काम करता है, और निरंतर model interaction के माध्यम से अपने आउटपुट को कई गुना बढ़ा देता है।

रिटर्न कहाँ गायब हो रहे हैं

इस दृष्टिकोण के बावजूद, उद्योग बुनियादी ढांचे के खर्च और प्राप्त परिणामों के बीच बढ़ती खाई को देख रहा है। कंपनियों ने token-heavy रणनीतियों को अपनाने में जल्दबाजी की है, AI vendors के साथ enterprise contracts किए हैं और अपने development pipelines को generative tools के अनुसार ढाल लिया है। Capital expenditure चौंकाने वाला रहा है। कई लोगों के लिए, productivity returns निराशाजनक रहे हैं।

Developers वास्तव में उबाऊ कामों में तेज़ हैं। Boilerplate code, unit test skeletons और दोहराव वाले CRUD operations तब तेज़ी से हो जाते हैं जब एक मॉडल पहला ड्राफ्ट तैयार कर देता है। लेकिन software engineering कभी भी टाइपिंग की गति के बारे में नहीं थी। कठिन और महंगा काम फैले हुए सिस्टम को बनाए रखने, distributed failure modes के माध्यम से तर्क करने, layered dependencies में सुरक्षा सुनिश्चित करने और उस technical debt को प्रबंधित करने में निहित है जो हर शॉर्टकट के साथ बढ़ता जाता है। ये