एजेंटिक रिट्रीवल (Agentic retrieval) को पारंपरिक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) पाइपलाइनों के बाद अगले चरण के रूप में प्रचारित किया जा रहा है, जो ऐसे प्रोडक्शन AI सिस्टम का वादा करता है जो मतिभ्रम (hallucination) करना बंद कर देंगे और जानकारी कैसे प्राप्त की जाए, इस बारे में "सोचना" शुरू कर देंगे। समर्थकों का कहना है कि यह दृष्टिकोण पूरे कॉर्पस को मॉडल के कॉन्टेक्स्ट विंडो में डालने की तुलना में, बड़े दस्तावेज़ संग्रहों पर किसी क्वेरी का उत्तर देने की लागत को 82 गुना तक कम कर सकता है, जो जेनरेटिव AI को स्केल करने वाले किसी भी व्यवसाय के लिए एक महत्वपूर्ण बचत है।
पुराना RAG पाइपलाइन क्यों कमतर है
क्लासिक RAG वर्कफ़्लो एक निश्चित क्रम का पालन करता है: दस्तावेज़ों को चंक्स (chunks) में विभाजित करना, प्रत्येक चंक को एक डेंस वेक्टर स्पेस में एम्बेड करना, और फिर उपयोगकर्ता की क्वेरी के लिए टॉप-स्कोरिंग वेक्टर्स को निकालना। डेमो में यह तरीका व्यवस्थित दिखता है—मॉडल को कुछ "प्रासंगिक" अंश मिलते हैं और वह आत्मविश्वास के साथ उत्तर देता है। हालाँकि, प्रोडक्शन में, यह आत्मविश्वास अक्सर गलत होता है।
तीन प्रणालीगत खामियां इस समस्या को जन्म देती हैं:
- वेक्टर समानता ≠ प्रासंगिकता। दो अंश गणितीय रूप से करीब हो सकते हैं जबकि वे विपरीत तथ्यों को व्यक्त कर रहे हों, जिससे मॉडल गलत दावे का हवाला दे सकता है।
- विखंडन (Fragmentation) तथ्यों को तोड़ देता है। फिक्स्ड चंकिंग नियमित रूप से एक ही कथन को दो हिस्सों में काट देती है। यदि मॉडल को केवल एक आधा हिस्सा मिलता है, तो वह छूटे हुए हिस्से को पुनर्गठित नहीं कर सकता।
- अव्यवस्थित क्वेरीज़। वास्तविक दुनिया के प्रश्न अधिकांश एम्बेडिंग मॉडल के ट्रेनिंग डेटा से अलग होते हैं, इसलिए सिमिलरिटी सर्च असंबंधित चंक्स वापस कर देता है।
जब पाइपलाइन गलत कॉन्टेक्स्ट वापस करती है, तो डाउनस्ट्रीम लैंग्वेज मॉडल फिर भी उत्तर देता है, जो अक्सर उच्च निश्चितता के साथ होता है, और सिस्टम कोई त्रुटि (error) नहीं दिखाता है। इसका परिणाम "साइलेंट हैलुसिनेशन" (silent hallucination) होता है—एक ऐसी मौन विफलता जिसे लाइव सर्विस में पहचानना कठिन होता है।
हाइब्रिड रिट्रीवल: एक क्रमिक सुधार
एक सामान्य प्रतिक्रिया डेंस वेक्टर्स के ऊपर कीवर्ड सर्च की एक परत जोड़ना है, जिससे एक हाइब्रिड रिट्रीवर बनता है जो उन सटीक शब्दों को पकड़ सकता है जिन्हें एम्बेडिंग मिस कर देती है। एक रीरैंकर (reranker) जोड़ना—एक दूसरा मॉडल जो सीखे गए प्रासंगिकता स्कोर के आधार पर प्राप्त सूची को पुनर्व्यवस्थित करता है—सटीकता को और सुधारता है।
हाइब्रिड रिट्रीवल अभी भी एक स्थिर स्क्रिप्ट का पालन करता है: प्रत्येक क्वेरी कठिनाई या अनिश्चितता की परवाह किए बिना चरणों की एक ही श्रृंखला को ट्रिगर करती है। पाइपलाइन यह निर्णय नहीं ले सकती कि क्या उसे अधिक डेटा की आवश्यकता है, एक जटिल प्रश्न को उप-प्रश्नों में कैसे तोड़ा जाए, या कब प्राप्त किया गया अंश अपर्याप्त है।
एजेंटिक रिट्रीवल खोज को एक निर्णय प्रक्रिया के रूप में देखता है
एजेंटिक रिट्रीवल इस समस्या को एक स्वायत्त "एजेंट" द्वारा लिए गए निर्णयों की एक श्रृंखला के रूप में पुनर्गठित करता है, जो एक मानव शोधकर्ता की नकल करता है। एजेंट यह कर सकता है:
- क्वेरी को फिर से लिखना। यह खोजने से पहले बोलचाल की या अस्पष्ट शब्दावली को सामान्य बनाता है, जिससे रिट्रीवल मॉडल द्वारा इरादे (intent) को समझने की संभावना बढ़ जाती है।
- पूछना कि क्या रिट्रीवल की आवश्यकता है। सीधे सवालों के लिए एजेंट सीधे उत्तर देता है, जिससे टोकन बचते हैं और अनावश्यक शोर (noise) से बचा जा सकता है।
- मल्टी-स्टेप सर्च की योजना बनाना। जटिल प्रश्नों को छोटे उप-प्रश्नों में विभाजित किया जाता है, जिनमें से प्रत्येक को स्वतंत्र रूप से खोजा जाता है, और फिर पुनर्संयोजित किया जाता है।
- स्वयं सुधार करना (Self-correct)। यदि प्रारंभिक परिणाम कमजोर दिखता है—जैसे कम कॉन्फिडेंस स्कोर या विरोधाभासी साक्ष्य—तो एजेंट अलग फॉर्मूलेशन के साथ क्वेरी फिर से जारी करता है या खोज के दायरे को बढ़ाता है।
लागत संबंधी तर्क: लॉन्ग कॉन्टेक्स्ट बनाम रिट्रीवल
कुछ टिप्पणीकारों का तर्क है कि लगातार बढ़ते कॉन्टेक्स्ट विंडो रिट्रीवल को अप्रचलित बना रहे हैं। इसका प्रतिवाद व्यावहारिक है: एक मॉडल के कॉन्टेक्स्ट में एक विशाल कॉर्पस डालना, केंद्रित रिट्रीवल की तुलना में कई गुना अधिक महंगा है। अनुमानों के अनुसार, बड़े डेटासेट के लिए रिट्रीवल 8 से 82 गुना सस्ता है, जबकि सटीक उत्तरों के लिए आवश्यक कॉन्टेक्स्टुअल ग्राउंडिंग भी प्रदान करता है। लॉन्ग कॉन्टेक्स्ट विंडो दस्तावेजों के एक छोटे, क्यूरेटेड सेट पर सूक्ष्म तर्क (nuanced reasoning) के लिए उपयोगी बनी रहती हैं, लेकिन वे स्केलेबल सर्च की जगह नहीं ले सकतीं।
पारदर्शिता और सत्यापन
एक प्रोडक्शन-ग्रेड AI असिस्टेंट को अपने स्रोतों को प्रदर्शित करना चाहिए। एजेंटिक रिट्रीवल प्रत्येक दावे के साथ एक साइटेशन (citation) जोड़ सकता है, जिससे एक मानव समीक्षक तथ्य-जांच के मार्ग को सत्यापित कर सकता है। यह "अपना काम दिखाएं" (show-your-work) दृष्टिकोण विश्वास पैदा करता है और उन कमजोर रिट्रीवल पथों को सामने लाता है जिनसे एजेंट भविष्य की बातचीत में बचने के लिए सीख सकता है।
आगे क्या देखने की आवश्यकता है
- टूलिंग (Tooling)।
- मूल्यांकन मानक (Evaluation standards)।
- एंटरप्राइज पायलट (Enterprise pilots)।
निष्कर्ष
एजेंटिक रिट्रीवल उन स्थिर, त्रुटि-प्रवण RAG पाइपलाइनों से आगे बढ़ता है जो कई डेमो में हावी हैं। AI सिस्टम को यह तय करने देने से कि कब और कैसे खोज करनी है, यह टोकन के उपयोग को कम करता है, लागत में भारी कटौती करता है, और—महत्वपूर्ण रूप से—प्रत्येक उत्तर के लिए सत्यापन योग्य स्रोत प्रदान करता है।
