एका स्वायत्त (autonomous) AI एजंटने सुमारे वीस मिनिटांत पूर्ण Retrieval-Augmented Generation (RAG) स्टॅक तयार केला आणि मानवी कोडची एकही ओळ न लिहिता ड्राफ्ट पुल रिक्वेस्ट (pull request) उघडली.

“loop” का महत्त्वाचा आहे

RAG स्टॅक तयार करणे म्हणजे सहसा एक सर्च इंजिन, एम्बेडिंग मॉडेल, लँग्वेज मॉडेल आणि ग्लू कोड (glue code) एकत्र जोडणे असा होतो. डेव्हलपर्स Helm charts मध्ये बदल करणे, ऑथेंटिकेशनमधील (auth) त्रुटी सुधारणे आणि मॉडेलच्या नावातील विसंगती शोधण्यात तासनतास वाया घालवतात. या चाचणीमध्ये, स्वायत्त एजंटने पाच-टप्प्यांच्या 'loop' चे अनुसरण केले, जे कोणताही कोड लिहिण्यापूर्वी मानवी-एजंट यांच्यातील संमती अनिवार्य करते.

टप्पा काय घडते
प्रस्ताव (Proposal) एजंट प्रॉम्प्ट वाचतो आणि एक ठोस योजना तयार करतो, परंतु अद्याप कोड तयार करत नाही.
संमती (Agreement) वापरकर्ता योजनेचे पुनरावलोकन करतो, तिला मंजुरी देतो किंवा बदल सुचवतो.
अंमलबजावणी (Implementation) एजंट एका नवीन ब्रँचवर (branch) हे फीचर तयार करतो.
ड्राफ्ट गेट (Draft Gate) एजंट स्वतःचे लिंटिंग (linting) आणि टेस्ट सूट चालवतो आणि आढळलेल्या त्रुटी सुधारतो.
ड्राफ्ट PR (Draft PR) कोड पुश केला जातो आणि अंतिम मानवी पुनरावलोकनासाठी पुल रिक्वेस्ट उघडली जाते.

बहुतेक AI-आधारित कोडिंग टूल्स थेट अंमलबजावणीकडे वळतात, ज्यामुळे अनेकदा चुकीचा कोड तयार होतो. संमतीचा एक स्पष्ट टप्पा समाविष्ट केल्यामुळे, हा 'loop' आंधळेपणाने होणारी अंमलबजावणी थांबवतो आणि कोणताही 'commit' करण्यापूर्वी वापरकर्त्याला प्रकल्प नियंत्रित करण्याची संधी देतो.

तयार झालेला स्टॅक

वीस मिनिटांत एजंटने प्रोडक्शन-रेडी (production-ready) RAG पाइपलाइन तयार केली:

  • OpenSearch 3.7 हायब्रिड सर्चसाठी (vector + keyword) कॉन्फिगर केले आहे.
  • Local Ollama LLM जे रिट्रिव्हल-ऑगमेंटेड प्रतिसादांसाठी जनरेटिव्ह इंजिन म्हणून काम करते.
  • FastMCP server जो लँग्वेज मॉडेलला चार कस्टम टूल्स उपलब्ध करून देतो.
  • Skaffold आणि Helm स्क्रिप्ट्स ज्या कंटेनर बिल्ड्स, Kubernetes manifests आणि सर्व्हिस डिप्लॉयमेंट स्वयंचलित करतात.

या पाइपलाइनमध्ये तीस लेख (articles) समाविष्ट करण्यात आले होते, ज्यामुळे एंड-टू-एंड रिट्रिव्हल आणि जनरेशनची त्वरित चाचणी करणे शक्य झाले. प्रत्येक घटक कॉन्फिगर करण्यासाठी एका डेव्हलपरला सामान्यतः पूर्ण दिवस लागतो; ही गती थक्क करणारी आहे.

त्रुटी ज्यांनी जवळजवळ सर्व काही बिघडवले होते

एजंटच्या आत्मविश्वासाची परीक्षा पाच वेगवेगळ्या अपयशांनी घेतली, ज्यांमुळे सामान्यतः मानवी हाताने होणारे डिप्लॉयमेंट थांबले असते:

  1. OpenSearch क्रेडेंशियल त्रुटी – एजंटने चुकीची सिक्रेट की (secret key) दिली, ज्यामुळे क्लस्टरने कनेक्शन्स नाकारले.
  2. URL मध्ये Regex टायपो – एका चुकीच्या अक्षरामुळे वैध एंडपॉइंटचे रूपांतर डेड लिंकमध्ये झाले, ज्यामुळे डेटा लोडरमध्ये बिघाड झाला.
  3. मॉडेलच्या नावातील विसंगती – कनेक्टरला वेगळ्या Ollama मॉडेल आयडेंटिफायरची अपेक्षा होती, ज्यामुळे "model not found" त्रुटी आल्या.
  4. JVM मेमरी मर्यादा – बल्क इंडेक्सिंगमुळे Java heap संपली, ज्यामुळे 'out-of-memory' क्रॅश झाले.
  5. मॉडेल चंक्सचे चुकून झालेले विलोपन – एका क्लीनअप स्क्रिप्टने आवश्यक फाइल्स चुकीच्या पद्धतीने डुप्लिकेट म्हणून ओळखल्या आणि त्या काढून टाकल्या, ज्यामुळे संपूर्ण पाइपलाइन धोक्यात आली.

जेव्हा एजंट अडकला, तेव्हा “loop-police” मध्ये शिरले

loop-police नावाचा एक साथीदार वॉचडॉग (watchdog) या 'loop' च्या आरोग्यावर लक्ष ठेवतो. जेव्हा डिलीशन बग दरम्यान एजंट एका न थांबणाऱ्या चक्रात (non-terminating cycle) अडकला, तेव्हा loop-police ने तो अडथळा ओळखला, सध्याची ब्रँच रद्द केली आणि पुन्हा 'Agreement' टप्प्यावर जाण्यास भाग पाडले. त्यानंतर एजंटने आपली चूक मान्य केली, खराब झालेली स्थिती (corrupted state) साफ केली आणि शून्यापासून पाइपलाइन पुन्हा तयार केली. सुरुवातीच्या प्लॅन मंजुरीव्यतिरिक्त मानवी हस्तक्षेपाशिवाय हे 'self-healing' चक्र पूर्ण झाले.

डेव्हलपर्ससाठी याचा अर्थ काय

  • नियंत्रण न गमावता वेग. हा 'loop' इंजिनिअर्सना त्यांचा उद्देश स्पष्ट करण्यास आणि त्यानंतर अंमलबजावणी एका स्वायत्त प्रणालीकडे सोपवण्यास मदत करतो, जी तरीही मानवी-मंजूर ब्लूप्रिंटचे पालन करते.
  • अंतर्निहित सुरक्षा जाळी (safety nets). स्वयंचलित लिंटिंग, टेस्टिंग आणि अनियंत्रित 'loop' थांबवू शकणारा वॉचडॉग यामुळे शांतपणे होणाऱ्या त्रुटींचा (silent failures) धोका कमी होतो.
  • प्रवेशासाठी कमी अडथळे. ज्या टीम्सकडे Helm, Kubernetes किंवा वेक्टर-सर्चचे सखोल ज्ञान नाही, त्या साध्या भाषेत आपली गरज सांगून एक कार्यात्मक स्टॅक तयार करू शकतात.

हा दृष्टिकोन कोणताही रामबाण उपाय (silver bullet) नाही. अवास्तव अपेक्षा किंवा सुरक्षा चिंता ओळखण्यासाठी 'Agreement' टप्प्यासाठी अजूनही एका अनुभवी पुनरावलोकनकर्त्याची (reviewer) गरज असते. हा 'loop' डोमेन तज्ज्ञता (domain expertise) बदलत नाही; तो केवळ वारंवार कराव्या लागणाऱ्या तांत्रिक कामांना (plumbing work) एका पुनरावृत्ती करण्यायोग्य पॅटर्नमध्ये गुंडाळतो.