एंटरप्राइज AI प्रोजेक्ट्स का एक खास पैटर्न होता है। एक टीम एक प्रोटोटाइप बनाती है। डेमो प्रभावशाली दिखता है। फिर, तीन महीने बाद, सिस्टम टूटने लगता है। जवाब भटकने लगते हैं। लागत बढ़ने लगती है। एक अनुपालन अधिकारी (compliance officer) पूछता है कि एक विशिष्ट उत्तर कहाँ से आया, और कमरे में कोई भी इसका जवाब नहीं दे पाता।

यह पतन शायद ही कभी खराब कोड से शुरू होता है। यह एक एकल आर्किटेक्चरल चुनाव से शुरू होता है जिसे लोकप्रियता की प्रतियोगिता की तरह माना जाता है: Retrieval-Augmented Generation बनाम fine-tuning।

RAG और fine-tuning एक ही उत्पाद के दो संस्करण नहीं हैं। वे मौलिक रूप से अलग उपकरण हैं। एक यह नियंत्रित करता है कि मॉडल क्या देख सकता है। दूसरा यह नियंत्रित करता है कि मॉडल कैसे व्यवहार करता है। काम के लिए गलत विकल्प चुनना प्रोटोटाइप में नहीं दिखेगा। यह बाद में दिखाई देता है, जब व्यवसाय इसके ऊपर चल रहा होता है।

डेमो का जाल

जनरेटिव AI फीचर को लॉन्च करने का दबाव बहुत अधिक होता है। टीमें अक्सर किसी विधि को इसलिए चुनती हैं क्योंकि उन्होंने इसे किसी अच्छे ट्यूटोरियल में देखा होता है या किसी वेंडर के स्लाइड डेक ने इसे आसान बना दिया होता है। इंफ्रास्ट्रक्चर संबंधी निर्णय लेने का यह एक बहुत ही खराब तरीका है।

एक fine-tuned मॉडल नियंत्रित डेमो में जादुई लग सकता है। यह आपकी कंपनी की आवाज़ में बात करता है और आपके उत्पादों के नाम पहचानता है। एक RAG पाइपलाइन भी जादुई लग सकती है। यह उस दस्तावेज़ के बारे में सवालों के जवाब देता है जिस पर इसे कभी प्रशिक्षित नहीं किया गया था। लेकिन डेमो परिचालन वास्तविकता (operational reality) को छिपा देता है। यदि आपका मूल्य निर्धारण डेटा (pricing data) साप्ताहिक रूप से बदलता है और आपने पिछली तिमाही के आंकड़ों पर fine-tuning की है, तो मॉडल आत्मविश्वास के साथ पुराने आंकड़े बताएगा। यदि आपकी सपोर्ट टीम को हर उत्तर को किसी विशिष्ट पॉलिसी PDF से जोड़ने की आवश्यकता है, तो एक fine-tuned मॉडल आपको कोई फुटनोट नहीं देता है। यह आपको केवल टेक्स्ट देता है।

RAG का वास्तव में क्या अर्थ है

RAG का अर्थ Retrieval-Augmented Generation है, लेकिन यह नाम इसे जितना है उससे कहीं अधिक जटिल बनाता है। इसके मूल में, RAG एक ही प्रश्न का उत्तर देता है: मॉडल को अभी किस चीज़ को खोजने की आवश्यकता है?

एक कस्टमर सर्विस एजेंट की कल्पना करें जिसे टिकट का जवाब देने से पहले कंपनी विकी (wiki) खोजने की अनुमति है। RAG बिल्कुल वही करता है, लेकिन स्वचालित रूप से। जब कोई उपयोगकर्ता प्रश्न पूछता है, तो सिस्टम प्रासंगिक टेक्स्ट के टुकड़ों (chunks) के लिए वेक्टर डेटाबेस या डॉक्यूमेंट स्टोर में खोज करता है। फिर यह उन टुकड़ों को मूल प्रश्न के साथ संदर्भ (context) के रूप में लैंग्वेज मॉडल को सौंप देता है। मॉडल प्राप्त साक्ष्यों के आधार पर उत्तर तैयार करता है।

यह दृष्टिकोण तब चमकता है जब आपका नॉलेज बेस मॉडल के बाहर होता है। प्रोडक्ट डॉक्यूमेंटेशन, कानूनी फाइलिंग, मेडिकल रिसर्च और इन्वेंट्री स्प्रेडशीट—ये सभी बदलते रहते हैं। RAG बिना किसी वेट (weight) को फिर से प्रशिक्षित किए मॉडल को अपडेट रखता है। यह एक प्राकृतिक ऑडिट ट्रेल भी बनाता है। क्योंकि आप जानते हैं कि कौन से दस्तावेज़ प्राप्त किए गए थे, आप एक ऑडिटर या रेगुलेटर को ठीक से दिखा सकते हैं कि उत्तर कहाँ से आया था।

Fine-Tuning का वास्तव में क्या अर्थ है

Fine-tuning एक अलग प्रश्न का उत्तर देता है: मॉडल को कैसा व्यवहार करना चाहिए?

मॉडल को बाहरी पढ़ने की सामग्री देने के बजाय, आप उसे उदाहरणों के माध्यम से सिखाते हैं। आप उन आउटपुट के सैकड़ों या हजारों उदाहरण एकत्र करते हैं जिन्हें आप चाहते हैं, और उस डेटा पर बेस मॉडल को प्रशिक्षित करना जारी रखते हैं। यह प्रक्रिया वास्तव में मॉडल के आंतरिक मापदंडों (parameters) को समायोजित करती है। यह वेट्स (weights) को बदल देती है।

इसका परिणाम एक ऐसा मॉडल होता है जिसने पैटर्न को आत्मसात (internalize) कर लिया है।