एंटरप्राइझ AI प्रकल्पांमध्ये एक ठराविक नमुना दिसून येतो. एक टीम प्रोटोटाइप तयार करते. डेमो खूप प्रभावी वाटतो. त्यानंतर, तीन महिन्यांनी, सिस्टीम कोसळू लागते. उत्तरे भरकटू लागतात. खर्च वाढतो. एखादा कंप्लायन्स ऑफिसर विचारतो की एखादे विशिष्ट उत्तर कुठून आले, आणि खोलीत बसलेली कोणीही व्यक्ती ते सांगू शकत नाही.

हा कोलमडण्याचा प्रकार क्वचितच खराब कोडमुळे सुरू होतो. याची सुरुवात एका अशा आर्किटेक्चरल निवडीमुळे होते, ज्याकडे लोकप्रियतेच्या स्पर्धेप्रमाणे पाहिले जाते: Retrieval-Augmented Generation विरुद्ध fine-tuning.

RAG आणि fine-tuning हे एकाच उत्पादनाचे दोन प्रकार नाहीत. ते मूलभूतपणे भिन्न साधने आहेत. एक मॉडेल काय पाहू शकते यावर नियंत्रण ठेवते, तर दुसरे मॉडेल कसे वागते यावर नियंत्रण ठेवते. कामासाठी चुकीची निवड केल्यास त्याचा परिणाम प्रोटोटाइपमध्ये दिसून येत नाही. तो नंतर दिसून येतो, जेव्हा व्यवसाय त्यावर आधारित चालत असतो.

डेमोचा सापळा

जनरेटिव्ह AI फीचर लवकरात लवकर लाँच करण्याचा दबाव खूप जास्त असतो. टीम्स अनेकदा एखादी पद्धत केवळ एखाद्या चांगल्या ट्युटोरियलमध्ये पाहिली आहे म्हणून किंवा एखाद्या व्हेंडरच्या स्लाईड डेकमुळे ती सोपी वाटते म्हणून निवडतात. इन्फ्रास्ट्रक्चरचे निर्णय घेण्याची ही अत्यंत चुकीची पद्धत आहे.

नियंत्रित डेमोमध्ये fine-tuned मॉडेल एखाद्या जादूसारखे वाटू शकते. ते तुमच्या कंपनीच्या शैलीत बोलते आणि तुमच्या उत्पादनांची नावे ओळखते. RAG पाइपलाइन देखील जादूसारखी वाटू शकते. ज्या डॉक्युमेंटवर त्याला कधीही ट्रेनिंग दिलेले नाही, त्याबद्दलही ते प्रश्नांची उत्तरे देते. परंतु, डेमोमधील गोष्टी ऑपरेशनल वास्तव लपवून ठेवतात. जर तुमचा किंमतीचा डेटा (pricing data) दर आठवड्याला बदलत असेल आणि तुम्ही गेल्या तिमाहीच्या आकड्यांवर fine-tuning केले असेल, तर मॉडेल आत्मविश्वासाने जुने आकडे सांगेल. जर तुमच्या सपोर्ट टीमला प्रत्येक उत्तराचा संदर्भ एखाद्या विशिष्ट पॉलिसी PDF मध्ये शोधायचा असेल, तर fine-tuned मॉडेल तुम्हाला कोणतेही फूटनोट्स (footnotes) देत नाही. ते फक्त तुम्हाला मजकूर देते.

RAG चा नेमका अर्थ काय?

RAG म्हणजे Retrieval-Augmented Generation, परंतु या नावामुळे ते प्रत्यक्षापेक्षा अधिक क्लिष्ट वाटते. मूळतः, RAG एका प्रश्नाचे उत्तर देते: मॉडेलला आत्ता नेमकी कोणती माहिती शोधण्याची गरज आहे?

एका कस्टमर सर्व्हिस एजंटची कल्पना करा, ज्याला तिकीट सोडवण्यापूर्वी कंपनीची विकी (wiki) शोधण्याची परवानगी आहे. RAG अगदी तेच करते, पण स्वयंचलितपणे. जेव्हा एखादा वापरकर्ता प्रश्न विचारतो, तेव्हा सिस्टीम संबंधित मजकूर शोधण्यासाठी वेक्टर डेटाबेस (vector database) किंवा डॉक्युमेंट स्टोअरमध्ये शोध घेते. त्यानंतर ती सिस्टीम मूळ प्रश्नासोबत ते मजकूर संच (chunks) संदर्भासाठी (context) लँग्वेज मॉडेलकडे सोपवते. मॉडेल मिळालेल्या पुराव्यांच्या आधारे उत्तर तयार करते.

जेव्हा तुमचा नॉलेज बेस मॉडेलच्या बाहेर असतो, तेव्हा ही पद्धत अत्यंत प्रभावी ठरते. प्रॉडक्ट डॉक्युमेंटेशन, कायदेशीर कागदपत्रे, वैद्यकीय संशोधन आणि इन्व्हेंटरी स्प्रेडशीट्स हे सर्व सतत बदलत असतात. RAG मॉडेलचे कोणतेही वेट्स (weights) पुन्हा ट्रेन न करता मॉडेलला अद्ययावत ठेवते. हे एक नैसर्गिक ऑडिट ट्रेल (audit trail) देखील तयार करते. कारण कोणते डॉक्युमेंट्स शोधले गेले होते हे तुम्हाला माहित असते, त्यामुळे तुम्ही ऑडिटर किंवा रेग्युलेटरला एखादे उत्तर नेमके कुठून आले आहे हे अचूकपणे दाखवू शकता.

Fine-Tuning चा नेमका अर्थ काय?

Fine-tuning एका वेगळ्या प्रश्नाचे उत्तर देते: मॉडेलने कसे वागावे?

मॉडेलला बाह्य वाचन साहित्य देण्याऐवजी, तुम्ही त्याला उदाहरणांद्वारे शिकवता. तुम्हाला हवे असलेल्या आउटपुट्सची शेकडो किंवा हजारो उदाहरणे तुम्ही गोळा करता आणि त्या डेटावर बेस मॉडेलला ट्रेनिंग देणे सुरू ठेवता. ही प्रक्रिया प्रत्यक्षात मॉडेलचे अंतर्गत पॅरामीटर्स (parameters) समायोजित करते. हे वेट्स (weights) बदलते.

याचा परिणाम म्हणजे असे मॉडेल जे पॅटर्न अंतर्गतरित्या आत्मसात (internalized) करते.