कई लोगों का कहना है कि AI सॉफ्टवेयर डेवलपमेंट को बहुत सस्ता बना देगा। वे कल्पना करते हैं कि मॉडल इंजीनियरों की जगह ले लेंगे और मिनटों में काम पूरा कर देंगे। यह कहानी लुभावनी तो है, लेकिन यह पूरी तरह सच नहीं है। सॉफ्टवेयर बनाने के अर्थशास्त्र (economics) बदले हैं, खत्म नहीं हुए हैं। जब पहला कोडिंग असिस्टेंट आया, तब तकनीकी ऋण (technical debt) गायब नहीं हुआ। हमने बस इसे फाइनेंस करने का एक नया तरीका ढूंढ लिया है।

पुराना बिल: कर्मचारियों की संख्या (Head Count)

दशकों से, तकनीकी ऋण ने एक परिचित 'डूम लूप' (doom loop) बनाया है। एक कोडबेस कमजोर होने लगता था। जो फीचर्स बनने में कभी दिन लगते थे, उनमें हफ्तों लगने लगे। डेडलाइन खिसकती गई, इसलिए नेतृत्व ने और अधिक नियुक्तियां (requisitions) खोल दीं। बड़ी टीमों ने चीजों को और धीमा कर दिया। तालमेल का बोझ (coordination overhead) बढ़ गया, स्टैंड-अप्स की संख्या बढ़ गई, और कॉनवे का नियम (Conway’s Law) लागू हो गया: सॉफ्टवेयर उन लोगों के बीच के गलत संचार का प्रतिबिंब बनने लगा जो इसे बना रहे थे। अधिक बग्स निकल जाते थे। प्रत्येक पैच जटिलता की नई परतें जोड़ देता था। कंपनियां इस सड़न के लिए उसी मुद्रा में भुगतान करती थीं जिसे वे जानती थीं: मानव वेतन। लागत स्पष्ट थी। यह हर तिमाही बजट समीक्षा में साफ दिखाई देती थी।

नया बिल: टोकन और कॉन्टेक्स्ट (Tokens and Context)

जनरेटिव एआई (Generative AI) ने इस चक्र को तोड़ा नहीं है। इसने केवल एक वैकल्पिक भुगतान योजना पेश की है। घर्षण (friction) को दूर करने के लिए पांच इंजीनियरों को काम पर रखने के बजाय, एक कंपनी अब अधिक कंप्यूट (compute) के लिए क्रेडिट कार्ड स्वाइप करती है। लक्षण अलग दिखते हैं, लेकिन अंतर्निहित बीमारी वही है।

जब कोई मॉडल विफल होने लगता है—जैसे आंतरिक APIs का भ्रम पैदा करना (hallucinating), महत्वपूर्ण एज केसेस (edge cases) को छोड़ देना, या गलत कारणों से पास होने वाले टेस्ट जेनरेट करना—तो प्रतिक्रिया शायद ही कभी रिफैक्टर (refactor) करने की होती है। प्रतिक्रिया इन्फरेंस (inference) पर पैसा खर्च करने की होती है। टीमें कॉन्टेक्स्ट-विंडो अपग्रेड खरीदती हैं, मल्टी-एजेंट रिट्राई लूप्स को जोड़ती हैं, वर्कलोड को बड़े फ्रंटियर मॉडल्स (frontier models) पर ले जाती हैं, या तब तक 'रीजेनरेट' बटन दबाती रहती हैं जब तक कि diff स्वीकार्य न दिखने लगे। ये रणनीतियां एक या दो स्प्रिंट के लिए स्पष्ट गति बनाए रखती हैं। जीरा (Jira) बोर्ड हरा रहता है। इस बीच, वास्तविक आर्किटेक्चर अछूता रहता है: वही उलझी हुई डिपेंडेंसीज़, वही परिवर्तनीय ग्लोबल स्टेट, वही मोनोलिथ (monolith) जिसे वर्तमान टीम में से कोई भी पूरी तरह से नहीं समझता।

गंदा कोड टोकन क्यों खर्च करता है

लार्ज लैंग्वेज मॉडल्स (LLMs) साफ एब्स्ट्रैक्शन (clean abstractions) के आधार पर सबसे बेहतर तर्क देते हैं। हालांकि, अधिकांश एंटरप्राइज रिपॉजिटरी पुरातात्विक स्थलों की तरह हैं। उनमें सर्कुलर पैकेज डिपेंडेंसीज़, इनिशियलाइजेशन स्क्रिप्ट्स में दबे हुए छिपे हुए साइड इफेक्ट्स, और डेटाबेस ट्रिगर्स, मिडलवेयर लेयर्स और फ्रंट-एंड कंपोनेंट्स में फैले हुए बिजनेस लॉजिक होते हैं। उस वातावरण में, मॉडल अपनी ऊर्जा नया लॉजिक लिखने में खर्च नहीं करता। वह समझने (comprehension) में टोकन जलाता है।

128,000-टोकन वाले कॉन्टेक्स्ट विंडो का एक बड़ा हिस्सा केवल सिस्टम के स्वरूप को मेमोरी में बनाए रखने में खर्च हो सकता है। शेष हिस्सा वास्तविक समस्या-समाधान के लिए बचता है। यह एक स्ट्रक्चरल इंजीनियर से नया फ्लोर डिजाइन करने के लिए कहने जैसा है, जबकि उसे हर गणना से पहले मौजूदा इमारत के ब्लूप्रिंट को याददाश्त से फिर से बनाने के लिए मजबूर किया जा रहा हो। परिणाम सतही समाधान होते हैं। मॉडल उस गंदगी को दर्शाता है जो वह देखता है क्योंकि उसके पास पहले कमरे की सफाई करने का अधिकार या आर्किटेक्चरल कॉन्टेक्स्ट नहीं होता।

तेज़ आउटपुट, धीमी शिपिंग

कच्ची जनरेशन स्पीड का मतलब तेज़ शिपिंग स्पीड नहीं है। यदि आपके आर्किटेक्चर में मॉड्यूलरिटी की कमी है, तो प्रत्येक AI-जेनरेटेड बदलाव के लिए गहन मानव समीक्षा और रिग्रेशन टेस्टिंग की आवश्यकता होती है। एक मॉडल दोपहर में दस पुल रिक्वेस्ट (pull requests) तैयार कर सकता है, लेकिन उन पुल रिक्वेस्ट को अभी भी इंटीग्रेशन एनवायरनमेंट, सुरक्षा स्कैनर, अनुपालन चेकलिस्ट और प्रोडक्शन कैनरीज (production canaries) से गुजरना पड़ता है। स्पष्ट मॉड्यूल सीमाओं के बिना, AI मशीन की गति से बग्स लाता है। यह एक साझा यूटिलिटी को संशोधित कर सकता है, सूक्ष्म रूप से गलत धारणाओं के साथ तीन दूरस्थ कॉल साइट्स को अपडेट कर सकता है, और ऐसी रेस कंडीशंस (race conditions) पैदा कर सकता है जिन्हें इंसान केवल रात के 3 बजे कॉल आने पर ही पकड़ पाते हैं। बाधा (bottleneck) कीबोर्ड से हटकर वैलिडेशन पाइपलाइन पर चली जाती है, और उस पाइपलाइन को बदलाव के वॉल्यूम में दस गुना वृद्धि को संभालने के लिए डिज़ाइन नहीं किया गया था।

छिपी हुई सीमा

AI-पूर्व युग में, मुख्य सीमा आपका हायरिंग बजट था। उसे कम से कम स्प्रेडशीट पर पढ़ना आसान था। अब बाधा उन मदों (line items) के भीतर दबी हुई है जिन्हें अधिकांश फाइनेंस टीमें मुश्किल से ही ट्रैक करती हैं: इन्फरेंस लागत, एम्बेडिंग स्टोरेज, कॉन्टेक्स्ट-विंडो विस्तार, और ऑटोमेटेड-टेस्टिंग ग्रिडलॉक जो CI रनर्स का दम घोंट देता है। उत्पादकता डैशबोर्ड हरे रंग में चमकते रहते हैं जबकि प्रत्येक नए फीचर की वास्तविक लागत चुपचाप बढ़ती जाती है।

यहाँ असली विलेन आर्किटेक्चरल एंट्रॉपी (Architectural entropy) है। LLMs कोड उत्पादन को बहुत खूबसूरती से स्केल करते हैं, लेकिन वे जटिलता को कम नहीं करते हैं। वे माइक्रोसर्विसेज को सुलझाते नहीं हैं, डेड कोड को खत्म नहीं करते, या इनहेरिटेंस पदानुक्रमों (inheritance hierarchies) को सरल नहीं बनाते। एक बार जब कोई सिस्टम उस सीमा को पार कर जाता है जहाँ इंसानों के लिए उसके बारे में तर्क करना कठिन हो जाता है, तो AI को भी संघर्ष करना पड़ता है। उस मोड़ (inflection point) पर, लागत ऊपर की ओर बढ़ने लगती है, चाहे आप