एक अकेले शोधकर्ता ने एक महीने तक अपने LLM-संचालित रिसर्च एजेंट द्वारा उपयोग किए गए हर टोकन का लॉग रखा और बिल में 31% की कटौती की। खर्च $945 से घटकर $651 रह गया, जबकि सफलता दर 91% से बढ़कर 93% हो गई—यह एक ऐसा परिणाम है जिसे कोई भी लागत-संवेदनशील (cost-sensitive) AI वर्कफ़्लो चलाने वाला व्यक्ति नोटिस करेगा।
टोकन-स्तर का डेटा क्यों महत्वपूर्ण था
अधिकांश LLM उपयोगकर्ता केवल अंतिम इनवॉइस देखते हैं—एक एकमुश्त राशि जो प्रत्येक सब-टास्क (sub-task) की लागत को छिपा देती है। शोधकर्ता के एजेंट ने तीन मुख्य कार्य किए: SEC फाइलिंग खोजना, रिपोर्ट तैयार करना और रिसर्च सिंथेसिस (research syntheses) को जोड़ना। विस्तृत (granular) डेटा के बिना, वह यह नहीं बता सका कि जून में भुगतान किए गए $312 सही ढंग से खर्च हुए थे या नहीं।
छिपे हुए रिसाव (leakage) को उजागर करने के लिए, उसने एक PostgreSQL लॉगिंग लेयर जोड़ी जिसने मॉडल का नाम, टोकन काउंट, टास्क टाइप और प्रति-कॉल लागत को कैप्चर किया। 30 दिनों के बाद, डेटा ने एक स्पष्ट तस्वीर पेश की:
- SEC फाइलिंग सर्च – कुल खर्च का 41%
- रिपोर्ट ड्राफ्टिंग – 28%
- रिसर्च सिंथेसिस – 17%
- क्वालिटी चेक – 9%
- विविध (Miscellaneous) – 5%
आंकड़ों से पता चला कि सबसे महंगा चरण मॉडल स्वयं नहीं था, बल्कि यह था कि एजेंट कैसे कच्चे (raw) सर्च परिणामों को प्रॉम्प्ट्स में डाल रहा था।
तीन बदलाव जिन्होंने बचत की
1. प्रॉम्प्ट देने से पहले सारांशित (Summarize) करें
मूल रूप से, एजेंट प्रत्येक प्रॉम्प्ट में 20 कच्चे सर्च परिणाम डाल देता था, जिससे इनपुट में टोकन की संख्या बहुत बढ़ जाती थी। उसने पहले एक सस्ता समराइज़र (summarizer) डाला, जिससे इनपुट में भारी कमी आई। प्रति सर्च टास्क लागत $0.84 से घटकर $0.19 हो गई – यानी 77% की कमी।
2. सरल चेक को सस्ते मॉडल पर भेजें
क्वालिटी चेक एक हाई-एंड मॉडल पर चल रहे थे जिसकी लागत प्रति चेक $0.09 थी। उसने अधिकांश पास/फेल चेक के लिए कम कीमत वाले मॉडल का उपयोग किया, जिससे प्रति-चेक कीमत घटकर $0.01 हो गई। सस्ता मॉडल 89% बार सही उत्तर देता था; किसी भी विफलता (failure) को मूल मॉडल पर भेज दिया जाता था (escalate), जिससे सटीकता बनी रही और लागत में 87% की कमी आई।
3. जब आत्मविश्वास (confidence) अधिक हो तो चेक छोड़ दें
उसने एक नियम जोड़ा कि जब भी टास्क की ऐतिहासिक सफलता दर (historical success rate) अधिक हो और आउटपुट की लंबाई अपेक्षित सीमा के भीतर हो, तो क्वालिटी-चेक स्टेप को बायपास कर दिया जाए। इससे लगभग 60% उन चेक को खत्म कर दिया गया जो वैसे भी चलते रहते।
परिणाम (The payoff)
इन तीन बदलावों के लागू होने के बाद, मासिक लेजर (ledger) कुछ इस तरह दिखता है:
- कुल खर्च: $945 → $651 (31% की कटौती)
- प्रति टास्क SEC सर्च लागत: $0.84 → $0.19 (77% की कटौती)
- प्रति टास्क क्वालिटी-चेक लागत: $0.09 → $0.01 (87% की कटौती)
- कुल सफलता दर: 91% → 93%
उच्च सफलता दर यह संकेत देती है कि छोटे प्रॉम्प्ट्स ने शोर (noise) को कम किया और मॉडल को मुख्य प्रश्न पर ध्यान केंद्रित करने में मदद की।
सावधानियां और प्रति-तर्क (Caveats and counter-points)
यह दृष्टिकोण दो धारणाओं पर टिका है। पहला, सस्ते समराइज़र को डाउनस्ट्रीम रीजनिंग (downstream reasoning) के लिए पर्याप्त जानकारी बनाए रखनी चाहिए; यदि यह महत्वपूर्ण विवरणों को हटा देता है, तो आउटपुट की गुणवत्ता प्रभावित हो सकती है। दूसरा, क्वालिटी चेक के लिए उपयोग किया जाने वाला कम लागत वाला मॉडल परफेक्ट नहीं है; इसकी 89% सटीकता का मतलब है कि त्रुटियों का एक छोटा हिस्सा अभी भी अंतिम उत्पाद तक पहुँच जाता है, हालांकि एस्केलेशन पाथ (escalation path) उनमें से अधिकांश को पकड़ लेता है। सख्त अनुपालन (compliance) आवश्यकताओं वाले उपयोगकर्ताओं को कड़े थ्रेशोल्ड या अतिरिक्त सत्यापन चरणों की आवश्यकता हो सकती है।
LLM प्रैक्टिशनर्स के लिए इसका क्या अर्थ है
- विस्तृत (Granular) डैशबोर्ड जीतते हैं। हाई-लेवल खर्च रिपोर्ट टोकन की बर्बादी को छिपा देती हैं। प्रति टास्क उपयोग को रिकॉर्ड करने से उन अक्षमताओं का पता चलता है जो अन्यथा छिपी रहतीं।
- फ्रंटियर मॉडल (Frontier models) हमेशा आवश्यक नहीं होते। एक सस्ता मॉडल समग्र गुणवत्ता से समझौता किए बिना डेटा को कंप्रेस कर सकता है या सरल बाइनरी निर्णय ले सकता है।
एक LLM एजेंट की छिपी हुई लागत अक्सर वह अनमापा गया (unmeasured) काम है जो वह करता है। टोकन फ्लो को इंस्ट्रूमेंट (instrument) करके और लक्षित अनुकूलन (targeted optimizations) लागू करके, शोधकर्ता ने $945 के मासिक बिल को प्रदर्शन में सुधार करते हुए $651 के कम खर्च वाले ऑपरेशन में बदल दिया। AI वर्कलोड का बजट बनाने वाले किसी भी व्यक्ति के लिए सबक स्पष्ट है: हर टोकन को मापें, फिर डेटा को तय करने दें कि कहाँ कटौती करनी है।
