एजेंटिक रिट्रिव्हल (Agentic retrieval) हे पारंपारिक रिट्रिव्हल-ऑगमेंटेड जनरेशन (RAG) पाइपलाइननंतरचे पुढचे पाऊल म्हणून सादर केले जात आहे. हे असे प्रॉडक्शन AI सिस्टम्सचे आश्वासन देते जी भ्रम निर्माण करणे (hallucinating) थांबवतील आणि माहिती कशी मिळवायची याबद्दल "विचार" करण्यास सुरुवात करतील. समर्थकांच्या मते, संपूर्ण कॉर्पस मॉडेलच्या कॉन्टेक्स्ट विंडोमध्ये फीड करण्याच्या तुलनेत, ही पद्धत मोठ्या दस्तऐवज संग्रहावरील क्वेरीचे उत्तर देण्याचा खर्च ८२ पटींपर्यंत कमी करू शकते; जे जनरेटिव्ह AI स्केल करणाऱ्या कोणत्याही व्यवसायासाठी महत्त्वाचे आहे.

जुनी RAG पाइपलाइन अपुरी का पडते

क्लासिक RAG वर्कफ्लो हा एक निश्चित क्रम असतो: दस्तऐवजांचे तुकड्यांमध्ये (chunks) विभाजन करणे, प्रत्येक तुकड्याला डेंस वेक्टर स्पेसमध्ये एम्बेड करणे आणि नंतर वापरकर्त्याच्या क्वेरीसाठी सर्वोच्च स्कोअर असलेले व्हेक्टर्स बाहेर काढणे. डेमोमध्ये ही पद्धत सुव्यवस्थित दिसते—मॉडेलला काही "सुसंगत" परिच्छेद मिळतात आणि ते आत्मविश्वासाने उत्तर देते. मात्र, प्रॉडक्शनमध्ये, हा आत्मविश्वास अनेकदा चुकीचा असतो.

तीन प्रणालीगत त्रुटी या समस्येला कारणीभूत ठरतात:

  • वेक्टर साम्य ≠ सुसंगतता (relevance). दोन परिच्छेद गणितीयदृष्ट्या जवळ असू शकतात, परंतु ते परस्परविरोधी तथ्ये व्यक्त करू शकतात, ज्यामुळे मॉडेल चुकीचा दावा सांगू शकते.
  • विखंडनामुळे तथ्ये विस्कळीत होतात. फिक्स्ड चंकिंगमुळे (Fixed chunking) अनेकदा एकच विधान दोन भागात विभागले जाते. जर मॉडेलला फक्त एकच भाग मिळाला, तर ते गहाळ झालेला भाग पुन्हा तयार करू शकत नाही.
  • विस्कळीत क्वेरीज (Messy queries). वास्तविक जगातील प्रश्न बहुतेक एम्बेडिंग मॉडेल्सच्या ट्रेनिंग डेटापेक्षा वेगळे असतात, त्यामुळे साम्य शोधताना (similarity search) असंबद्ध तुकडे मिळतात.

जेव्हा पाइपलाइन चुकीचा कॉन्टेक्स्ट परत करते, तेव्हा डाउनस्ट्रीम लँग्वेज मॉडेल तरीही उत्तर तयार करते, तेही अनेकदा उच्च खात्रीसह, आणि सिस्टम कोणतीही त्रुटी दर्शवत नाही. याचा परिणाम 'सायलेंट हॅलुसिनेशन' (silent hallucination) म्हणून होतो—ही एक अशी शांत त्रुटी आहे जी थेट सेवेमध्ये (live service) शोधणे कठीण असते.

हायब्रिड रिट्रिव्हल: एक टप्प्याटप्प्याने केलेले सुधारण

यावर एक सामान्य उपाय म्हणजे डेंस व्हेक्टर्सवर कीवर्ड सर्चचा थर लावणे, ज्यामुळे एक हायब्रिड रिट्रिव्हर तयार होतो जो एम्बेडिंग्जनी चुकवलेले अचूक शब्द शोधू शकतो. यामध्ये 'रीरँकर' (reranker) जोडणे—एक दुसरे मॉडेल जे शिकलेल्या सुसंगतता स्कोअरवर आधारित शोधलेल्या यादीचा क्रम पुन्हा लावते—यामुळे अचूकता अधिक सुधारते.

हायब्रिड रिट्रिव्हल अजूनही एका स्थिर स्क्रिप्टचे पालन करते: प्रत्येक क्वेरीमुळे कठीणता किंवा अनिश्चितता काहीही असो, तेच पायऱ्यांचे अनुक्रम कार्यान्वित होतात. पाइपलाइनला हे ठरवता येत नाही की तिला अधिक डेटाची गरज आहे का, जटिल प्रश्नाचे उप-प्रश्नांमध्ये कसे विभाजन करायचे, किंवा शोधलेला तुकडा अपुरा आहे का.

एजेंटिक रिट्रिव्हल शोध प्रक्रियेला निर्णय प्रक्रियेच्या स्वरूपात पाहते

एजेंटिक रिट्रिव्हल या समस्येला एका स्वायत्त "एजंट"द्वारे घेतलेल्या निर्णयांच्या मालिकेच्या स्वरूपात पुन्हा मांडते, जो एका मानवी संशोधकाची नक्कल करतो. हा एजंट खालील गोष्टी करू शकतो:

  • क्वेरी पुन्हा लिहिणे. शोधण्यापूर्वी तो बोलीभाषेतील किंवा संदिग्ध शब्द सामान्य (normalize) करतो, ज्यामुळे रिट्रिव्हल मॉडेल्सना हेतू समजण्याची शक्यता वाढते.
  • रिट्रिव्हलची गरज आहे का ते विचारणे. सरळ प्रश्नांसाठी एजंट थेट उत्तर देतो, ज्यामुळे टोकन्सची बचत होते आणि अनावश्यक गोंधळ टाळता येतो.
  • बहु-स्तरीय शोध नियोजन करणे. जटिल प्रश्नांचे लहान उप-प्रश्नांमध्ये विभाजन केले जाते, प्रत्येक प्रश्नाचा स्वतंत्रपणे शोध घेतला जातो आणि नंतर ते पुन्हा एकत्र केले जातात.
  • स्वतःमध्ये सुधारणा करणे (Self-correct). जर सुरुवातीचा निकाल कमकुवत वाटला—उदा. कमी कॉन्फिडन्स स्कोअर किंवा परस्परविरोधी पुरावे—तर एजंट वेगळ्या सूत्राने क्वेरी पुन्हा देतो किंवा शोध व्याप्ती वाढवतो.

खर्चाचे तर्क: लाँग कॉन्टेक्स्ट विरुद्ध रिट्रिव्हल

काही टीकाकारांचे म्हणणे आहे की अधिकाधिक मोठे कॉन्टेक्स्ट विंडोज रिट्रिव्हलला कालबाह्य बनवत आहेत. याला प्रत्युत्तर व्यावहारिक आहे: मॉडेलच्या कॉन्टेक्स्टमध्ये प्रचंड कॉर्पस फीड करण्याचा खर्च केंद्रित रिट्रिव्हलपेक्षा कित्येक पटीने जास्त असतो. अंदाजानुसार, मोठ्या डेटासेटसाठी रिट्रिव्हल ८ ते ८२ पट स्वस्त पडते, आणि तरीही अचूक उत्तरांसाठी आवश्यक असलेला कॉन्टेक्स्टल ग्राउंडिंग प्रदान करते. लहान आणि निवडक दस्तऐवजांच्या संचावर सूक्ष्म तर्कासाठी लाँग कॉन्टेक्स्ट विंडोज उपयुक्त राहतील, परंतु ते स्केलेबल सर्चची जागा घेऊ शकत नाहीत.

पारदर्शकता आणि पडताळणी

प्रॉडक्शन-ग्रेड AI असिस्टंटने त्याचे स्रोत स्पष्ट करणे आवश्यक आहे. एजेंटिक रिट्रिव्हल प्रत्येक दाव्याला एक संदर्भ (citation) जोडू शकते, ज्यामुळे मानवी पुनर्विलोकनकर्ता तथ्य-तपासणीचा मार्ग पडताळू शकतो. हा "तुमचे काम दाखवा" (show-your-work) असा दृष्टिकोन विश्वास निर्माण करतो आणि कमकुवत रिट्रिव्हल मार्ग समोर आणतो, जे एजंट भविष्यातील संवादांमध्ये टाळण्यास शिकू शकतो.

पुढे काय पाहावे

  • टूलिंग (Tooling).
  • मूल्यांकन मानके (Evaluation standards).
  • एंटरप्राइझ पायलट (Enterprise pilots).

सारांश (Bottom line)

एजेंटिक रिट्रिव्हल हे अनेक डेमोमध्ये वर्चस्व गाजवणाऱ्या स्थिर आणि त्रुटीपूर्ण RAG पाइपलाइनच्या पलीकडे जाते. AI सिस्टमला कधी आणि कसे शोधायचे हे ठरवू दिल्याने, ते टोकनचा वापर कमी करते, खर्च लक्षणीयरीत्या घटवते आणि—सर्वात महत्त्वाचे म्हणजे—प्रत्येक उत्तरासाठी पडताळण्यायोग्य स्रोत प्रदान करते.