हमने अपने दस-एजेंट वाले AI fleet पर $100 की क्रेडिट सीमा निर्धारित की और उसी दिन throttle सक्रिय हो गया, जिससे तब तक हर नया कार्य रुक गया जब तक हमने सीमा (ceiling) नहीं बढ़ा दी। यह घटना दर्शाती है कि बजट उल्लंघन होने पर control loop तुरंत सक्रिय हो गया।
AI fleets के लिए क्रेडिट सीमा क्यों महत्वपूर्ण है
एक ही सर्वर पर दस autonomous agents चलाने से API calls की एक निरंतर धारा उत्पन्न होती है, जिसमें से प्रत्येक का बिल उनके द्वारा उपयोग किए गए tokens के आधार पर लिया जाता है। पारंपरिक logs यह रिकॉर्ड करते हैं कि agents ने क्या किया—queries, responses, timestamps—लेकिन वे यह नहीं बताते कि उन कार्यों की लागत कितनी थी। जब एक fleet का विस्तार होता है, तो वह अदृश्य बिल तेजी से बढ़ सकता है, जिससे किसी के ध्यान देने से पहले ही बजट खत्म हो सकता है।
Logs को एक ledger में बदलना
हमारा पहला कदम logs को केवल plain text के रूप में देखना बंद करना और उन्हें एक financial ledger की तरह मानना था। अब प्रत्येक agent cycle—task → taking → done—तीन journal entries उत्पन्न करता है:
- Money – अनुरोध के token count से प्राप्त एक अनुमानित USD मूल्य।
- Promises – खुले हुए कार्य जो एक मौजूदा देनदारी (liability) का प्रतिनिधित्व करते हैं, यानी वह काम जिसका बिल पूरा होने के बाद लिया जाएगा।
- Labour – वे वास्तविक कार्य इकाइयाँ (work units) जो agent ने निष्पादित कीं।
Log file में “error” खोजने (grepping) के बजाय, अब हम एक वास्तविक वित्तीय क्वेरी चला सकते हैं: “ऐसे सभी promises दिखाएं जिनका कुल money $100 से अधिक है।” यह ledger छिपी हुई लागत को दृश्यमान और खोजने योग्य बनाता है।
The closed-loop control system
क्रेडिट-लिमिट मैकेनिज्म एक चार-चरणीय लूप का पालन करता है जो निरंतर चलता रहता है:
- Measure – प्रत्येक agent turn एक spend log में एक लाइन जोड़ता है, जिसमें token usage और उससे प्राप्त डॉलर राशि दर्ज की जाती है।
- Price – सिस्टम वर्तमान दर का उपयोग करके token counts को USD में परिवर्तित करता है।
- Alert – एक monitor rolling budget पर नज़र रखता है। इसकी स्थिति none (कोई चेतावनी नहीं) से warn (सीमा के करीब) और फिर cap (सीमा तक पहुँच जाना) में बदलती है।
- Throttle – जब cap सक्रिय होता है, तो gate वर्तमान स्थिति को पढ़ता है और किसी भी नए कार्य के dispatch को रोक देता है।
बजट विंडो एक rolling five-hour अवधि है, जिसका अर्थ है कि सिस्टम हमेशा पिछले पांच घंटों के खर्च को देखता है, न कि किसी निश्चित कैलेंडर ब्लॉक को। यह लूप को गतिविधियों के अचानक बढ़ने (bursts of activity) के प्रति संवेदनशील बनाए रखता है और किसी एक स्पाइक (spike) को fleet को अनिश्चित काल के लिए लॉक होने से रोकता है।
एक dashboard जो केवल खर्च प्रदर्शित करता है, वह केवल एक कहानी बताता है; लेकिन वह throttle जो उस संख्या को पढ़ता है और dispatch को रोकता है, वह वास्तविक नियंत्रण है।
Resilience by design
एक spend-control सिस्टम जो 'single point of failure' बन जाए, तो वह प्रतिकूल होगा। हमने तीन सुरक्षा उपाय (safeguards) बनाए हैं:
- Fails open – यदि बजट टूल क्रैश हो जाता है, तो agents चलते रहते हैं। खर्च की जाँच नहीं हो पाएगी, लेकिन fleet चालू रहेगी।
- Manual bypass – ऑपरेटर एक priority channel के माध्यम से throttle को override कर सकते हैं, जिससे सीमा समाप्त होने पर भी महत्वपूर्ण कार्य आगे बढ़ सकें।
- Auto-resume – जैसे-जैसे rolling window आगे बढ़ती है, पुराना खर्च गणना से बाहर हो जाता है। एक बार जब कुल राशि सीमा से नीचे गिर जाती है, तो gate बिना किसी मानवीय हस्तक्षेप के स्वचालित रूप से फिर से खुल जाता है।
परीक्षण: $100 की सीमा बनाम $156 का मौजूदा खर्च
हमने $100 की सीमा के साथ सिस्टम लॉन्च किया, जबकि fleet की हालिया गतिविधियों में पहले ही $156 का खर्च हो चुका था। throttle तुरंत सक्रिय हो गया और सभी नए कार्यों को रोक दिया। जब हमने सीमा (ceiling) बढ़ाकर $200 कर दी, तो gate फिर से खुल गया और बिना किसी अतिरिक्त मैन्युअल कदम के काम फिर से शुरू हो गया।
प्रयोग ने दो बातों की पुष्टि की:
- Control loop वास्तविक समय (real time) में प्रतिक्रिया करता है; उल्लंघन का पता चलने और उसे लागू करने के बीच कोई देरी (lag) नहीं होती है।
- ऑपरेटर चलते-फिरते (on the fly) सीमाओं को समायोजित कर सकते हैं, जिससे कम प्राथमिकता वाले कार्यों के लिए अनावश्यक downtime से बचा जा सके।
निष्कर्ष (Takeaway): Agent logs को एक financial ledger के रूप में मानना और dispatch pipeline में एक rolling-budget throttle को जोड़ना, आपको अधिक खर्च (overspend) के विरुद्ध एक तत्काल और लागू करने योग्य सुरक्षा प्रदान करता है। यह एक सस्ता और लचीला नियंत्रण है जो आज काम करता है; बाद में अधिक परिष्कृत (sophisticated) नीतियां जोड़ी जा सकती हैं, लेकिन बुनियादी लूप किसी भी AI-agent fleet के लिए रक्षा की पहली पंक्ति होनी चाहिए।
