इंटरनेट ने यह तय कर लिया है कि यह एजेंट का वर्ष है। LangGraph, CrewAI, और AutoGen हर इंजीनियरिंग रोडमैप पर दिखने वाले नाम हैं। टीमें ऑर्केस्ट्रेशन लेयर्स का स्ट्रेस-टेस्ट कर रही हैं, स्टेट मशीन्स बनाम रोल-प्ले पर बहस कर रही हैं, और यह सोच रही हैं कि कौन सी लाइब्रेरी अंततः लार्ज लैंग्वेज मॉडल्स को स्वायत्त (autonomous) बना देगी।

यहाँ एक कड़वा सच है: उनमें से अधिकांश तुलनाएँ समय से पहले की हैं। फ्रेमवर्क कठिन हिस्सा नहीं हैं। कठिन हिस्सा यह है कि हमने अपनी परिभाषाएँ देना बंद कर दिया है। लोग अब हर चीज़ को एजेंट कह रहे हैं। एक टूल कॉल एजेंट नहीं है। एक चैटबॉट एजेंट नहीं है। यह ढीली परिभाषा सीधे खराब इंजीनियरिंग, ज़रूरत से ज़्यादा जटिल सिस्टम और ऐसे प्रोडक्शन आउटेज की ओर ले जाती है जिन्हें एक साधारण स्क्रिप्ट से टाला जा सकता था।

कोई फ्रेमवर्क चुनने से पहले, उस चीज़ को परिभाषित करें जिसे आप वास्तव में बना रहे हैं।

एजेंट वास्तव में क्या है

एक एजेंट को उस मॉडल से परिभाषित नहीं किया जाता जिस पर वह चलता है या उसके द्वारा किए गए API कॉल्स की संख्या से। एक एजेंट को उसके व्यवहार से परिभाषित किया जाता है। उसका एक स्पष्ट उद्देश्य होना चाहिए। उसे यह तय करना चाहिए कि अगला कदम क्या होगा, बिना किसी इंसान द्वारा पहले से रास्ता तय किए। उसे विफलता (failure) को संभालना चाहिए जब वह कदम विफल हो जाए। और उसे पता होना चाहिए कि कब रुकना है।

एक ऐसे सपोर्ट सिस्टम के बारे में सोचें जो आने वाले ईमेल को पढ़ता है, उसे रिफंड अनुरोध के रूप में वर्गीकृत करता है, ऑर्डर नंबर निकालता है, शिपिंग डेटाबेस से जानकारी लेता है, रिटर्न पॉलिसी की समय सीमा की जाँच करता है, जवाब का ड्राफ्ट तैयार करता है, और टिकट को 'resolved' मार्क करता है। यदि डेटाबेस टाइम आउट हो जाता है, तो यह प्रतीक्षा करता है और पुन: प्रयास (retry) करता है। यदि पॉलिसी की समय सीमा अस्पष्ट है, तो यह किसी इंसान को सूचित करता है। जब जवाब भेज दिया जाता है, तो यह रुक जाता है। यह एक एजेंट है। एक सिंगल LLM कॉल के चारों ओर बना रैपर जो JSON लौटाता है, वह एजेंट नहीं है, चाहे मार्केटिंग टीम उस पर कितने भी "agent" स्टिकर क्यों न लगा दे।

यह अंतर महत्वपूर्ण है क्योंकि जटिलता की एक कीमत होती है। जिस सिस्टम को स्वायत्तता (autonomy) की आवश्यकता नहीं है, उसे इसकी कीमत नहीं चुकानी चाहिए।

प्रोडक्शन AI का वास्तविक स्वरूप

वर्तमान में प्रोडक्शन में चल रहे अधिकांश AI सिस्टम सीमित (narrow) हैं। वे एक काम अच्छी तरह से करते हैं। वे सपोर्ट टिकटों को कतारों (queues) में वर्गीकृत करते हैं। वे स्कैन किए गए दस्तावेज़ों से समाप्ति तिथियां निकालते हैं। वे ग्राहकों के प्रश्नों को मौजूदा नॉलेज बेस लेखों से मिलाते हैं। वे सामान्य तर्क इंजन (general reasoning engines) नहीं हैं, और ऐसा होने का ढोंग करना सबसे खराब प्रकार की ओवर-इंजीनियरिंग की ओर ले जाता है।

यह मॉडल रिलीज़ के प्रति एक विनाशकारी जुनून की ओर भी ले जाता है। टीमें नए फाउंडेशन मॉडल के पीछे इस तरह भागती हैं जैसे कि वह खराब आर्किटेक्चर की भरपाई कर देगा। ऐसा नहीं होगा। बिना एरर हैंडलिंग वाले एक कमज़ोर लूप के भीतर चलने वाला एक अधिक सक्षम मॉडल केवल अधिक आत्मविश्वास और अधिक रचनात्मक मतिभ्रम (hallucinations) के साथ विफल होगा। बेंचमार्क का पीछा करना बंद करें। स्ट्रक्चर का पीछा करना शुरू करें।

फ्रेमवर्क प्रोडक्ट नहीं है

LangGraph आपको स्पष्ट स्टेट मशीन्स और साइकिल्स देता है। CrewAI रोल-आधारित ऑर्केस्ट्रेशन पर केंद्रित है जहाँ एजेंट व्यक्तित्व (personas) अपनाते हैं। AutoGen संवादात्मक एजेंटों पर केंद्रित है जो समस्याओं को हल करने के लिए एक-दूसरे से बात करते हैं। ये सभी सक्षम उपकरण हैं। वे कंट्रोल फ्लो के लिए मौलिक रूप से अलग दृष्टिकोण भी हैं।

लेकिन आप जो फ्रेमवर्क चुनते हैं, वह उससे कम महत्वपूर्ण है जो पैटर्न आप उसके भीतर लागू करते हैं। मैंने टीमों को केवल Python और Redis का उपयोग करके मज़बूत ऑटोमेशन शिप करते देखा है क्योंकि उन्होंने सीमाओं का सम्मान किया। मैंने अन्य टीमों को फैंसी ऑर्केस्ट्रेशन के बोझ तले दबते देखा है क्योंकि उन्होंने फ्रेमवर्क को डिज़ाइन के विकल्प के रूप में माना।

यदि आपके हैंडऑफ अस्पष्ट हैं, आपके टूल्स कमज़ोर हैं, और आपका रिट्राय लॉजिक मौजूद नहीं है, तो आपके requirements.txt पर लगा लोगो आपको नहीं बचा पाएगा।

तीन चीज़ें जो वास्तव में आपके समय के लायक हैं

यदि आप एजेंटिक सिस्टम बना रहे हैं, तो अपना पूरा प्रयास इन तीन क्षेत्रों में लगाएं।

टूल डिज़ाइन। हर फंक्शन जिसे आपका एजेंट कॉल कर सकता है, वह एक इंटरफ़ेस में लिपटी हुई एक लायबिलिटी (liability) है। उन्हें मजबूती से डिज़ाइन करें। इनपुट को आक्रामक रूप से वैलिडेट करें। ऐसे एरर लौटाएं जो वास्तव में पढ़ने योग्य हों, न कि 500 डंप। एक अच्छा टूल वह है जिसके बारे में एजेंट कुछ गलत होने पर तर्क (reason) कर सके।

फेलियर हैंडलिंग। मान लें कि हर LLM