എൻ്റർപ്രൈസ് AI പ്രോജക്റ്റുകൾക്ക് ഒരു പ്രത്യേക രീതിയുണ്ട്. ഒരു ടീം ഒരു പ്രോട്ടോടൈപ്പ് നിർമ്മിക്കുന്നു. ഡെമോ കാണാൻ വളരെ മികച്ചതായിരിക്കും. എന്നാൽ മൂന്ന് മാസത്തിന് ശേഷം, സിസ്റ്റം തകരാൻ തുടങ്ങുന്നു. മറുപടികൾ മാറുന്നു (drift). ചിലവുകൾ വർദ്ധിക്കുന്നു. ഒരു പ്രത്യേക ഉത്തരം എവിടെ നിന്ന് വന്നു എന്ന് ഒരു കംപ്ലയൻസ് ഓഫീസർ ചോദിക്കുമ്പോൾ, ആ മുറിയിലുള്ള ആർക്കും അത് പറയാൻ കഴിയില്ല.
ഈ തകർച്ച അപൂർവ്വമായിട്ടേ മോശം കോഡ് കാരണം സംഭവിക്കാറുള്ളൂ. മറിച്ച്, ഒരു ജനപ്രീതി മത്സരത്തെപ്പോലെ കാണപ്പെടുന്ന ഒരു ആർക്കിടെക്ചറൽ തിരഞ്ഞെടുപ്പിലൂടെയാണ് ഇത് തുടങ്ങുന്നത്: Retrieval-Augmented Generation (RAG) വേഴ്സസ് ഫൈൻ-ട്യൂണിംഗ് (fine-tuning).
RAG-ഉം ഫൈൻ-ട്യൂണിംഗും ഒരേ ഉൽപ്പന്നത്തിന്റെ രണ്ട് പതിപ്പുകളല്ല. അവ അടിസ്ഥാനപരമായി വ്യത്യസ്തമായ ഉപകരണങ്ങളാണ്. ഒന്ന് ഒരു മോഡലിന് എന്ത് കാണാൻ കഴിയുമെന്നും മറ്റൊന്ന് ഒരു മോഡൽ എങ്ങനെ പെരുമാറണമെന്നും നിയന്ത്രിക്കുന്നു. ജോലിക്കായി തെറ്റായ ഒന്ന് തിരഞ്ഞെടുക്കുന്നത് ഒരു പ്രോട്ടോടൈപ്പിൽ കാണാൻ കഴിയില്ല. എന്നാൽ ബിസിനസ്സ് അത് ഉപയോഗിച്ച് പ്രവർത്തിച്ചു തുടങ്ങുമ്പോൾ അത് പ്രകടമാകും.
ഡെമോ കെണി
ഒരു ജനറേറ്റീവ് AI ഫീച്ചർ വേഗത്തിൽ പുറത്തിറക്കാനുള്ള സമ്മർദ്ദം വളരെ കൂടുതലാണ്. ഒരു നല്ല ട്യൂട്ടോറിയലിൽ കണ്ടതുകൊണ്ടോ അല്ലെങ്കിൽ ഒരു വെണ്ടർ സ്ലൈഡ് ഡെക്കിൽ അത് എളുപ്പമാണെന്ന് തോന്നിയതുകൊണ്ടോ ടീമുകൾ പലപ്പോഴും ഒരു രീതി തിരഞ്ഞെടുക്കുന്നു. ഇൻഫ്രാസ്ട്രക്ചർ തീരുമാനങ്ങൾ എടുക്കാൻ ഇത് വളരെ മോശമായ രീതിയാണ്.
നിയന്ത്രിതമായ ഒരു ഡെമോയിൽ ഒരു ഫൈൻ-ട്യൂൺ ചെയ്ത മോഡൽ അത്ഭുതകരമായി തോന്നാം. അത് നിങ്ങളുടെ കമ്പനിയുടെ ശൈലിയിൽ സംസാരിക്കുകയും നിങ്ങളുടെ ഉൽപ്പന്നങ്ങളുടെ പേരുകൾ തിരിച്ചറിയുകയും ചെയ്യുന്നു. ഒരു RAG പൈപ്പ്ലൈനും അത്ഭുതകരമായി തോന്നാം. താൻ ഒരിക്കലും പരിശീലനം (train) നേടാത്ത ഒരു ഡോക്യുമെന്റിനെക്കുറിച്ച് പോലും അത് ചോദ്യങ്ങൾക്ക് ഉത്തരം നൽകുന്നു. എന്നാൽ ഡെമോ പ്രവർത്തനപരമായ യാഥാർത്ഥ്യങ്ങളെ മറച്ചുവെക്കുന്നു. നിങ്ങളുടെ വിലവിവരങ്ങൾ (pricing data) എല്ലാ ആഴ്ചയും മാറിക്കൊണ്ടിരിക്കുകയും നിങ്ങൾ കഴിഞ്ഞ പാദത്തിലെ കണക്കുകൾ ഉപയോഗിച്ച് ഫൈൻ-ട്യൂൺ ചെയ്തിരിക്കുകയും ചെയ്യുന്നുവെങ്കിൽ, മോഡൽ ആത്മവിശ്വാസത്തോടെ പഴയ കണക്കുകൾ തന്നെ പറയും. നിങ്ങളുടെ സപ്പോർട്ട് ടീമിന് ഓരോ ഉത്തരവും ഒരു പ്രത്യേക പോളിസി PDF-ലേക്ക് ട്രാസ്സ് ചെയ്യേണ്ടതുണ്ടെങ്കിൽ, ഒരു ഫൈൻ-ട്യൂൺ ചെയ്ത മോഡൽ നിങ്ങൾക്ക് ഫുട്നോട്ടുകൾ നൽകില്ല. അത് വെറും ടെക്സ്റ്റ് മാത്രമേ നൽകൂ.
RAG എന്നാൽ യഥാർത്ഥത്തിൽ എന്താണ്
RAG എന്നാൽ Retrieval-Augmented Generation എന്നാണ് അർത്ഥം, എന്നാൽ ഈ പേര് അത് യഥാർത്ഥത്തിലുള്ളതിനേക്കാൾ സങ്കീർണ്ണമാണെന്ന് തോന്നിപ്പിക്കുന്നു. അതിന്റെ കാതൽ ഒരു ചോദ്യത്തിന് ഉത്തരം നൽകുന്നു എന്നതാണ്: മോഡൽ ഇപ്പോൾ എന്തിനെക്കുറിച്ചാണ് തിരയേണ്ടത്?
ഒരു ടിക്കറ്റിന് മറുപടി നൽകുന്നതിന് മുമ്പ് കമ്പനി വിക്കി (wiki) തിരയാൻ അനുവാദമുള്ള ഒരു കസ്റ്റമർ സർവീസ് ഏജന്റിനെ സങ്കൽപ്പിക്കുക. RAG കൃത്യമായി അത് തന്നെയാണ് ചെയ്യുന്നത്, പക്ഷേ സ്വയമേവ (automatically). ഒരു ഉപയോക്താവ് ചോദ്യം ചോദിക്കുമ്പോൾ, സിസ്റ്റം പ്രസക്തമായ ടെക്സ്റ്റ് ഭാഗങ്ങൾക്കായി ഒരു വെക്റ്റർ ഡാറ്റാബേസോ അല്ലെങ്കിൽ ഡോക്യുമെന്റ് സ്റ്റോറോ തിരയുന്നു. തുടർന്ന് ആ ഭാഗങ്ങൾ യഥാർത്ഥ ചോദ്യത്തോടൊപ്പം ഒരു കോൺടെക്സ്റ്റ് (context) ആയി ലാംഗ്വേജ് മോഡലിന് നൽകുന്നു. ലഭ്യമായ തെളിവുകളുടെ അടിസ്ഥാനത്തിൽ മോഡൽ ഒരു ഉത്തരം തയ്യാറാക്കുന്നു.
നിങ്ങളുടെ നോളജ് ബേസ് (knowledge base) മോഡലിന് പുറത്താണെങ്കിൽ ഈ രീതി മികച്ചതാണ്. ഉൽപ്പന്ന ഡോക്യുമെന്റേഷൻ, നിയമപരമായ രേഖകൾ, മെഡിക്കൽ റിസർച്ച്, ഇൻവെന്ററി സ്പ്രെഡ്ഷീറ്റുകൾ എന്നിവയെല്ലാം മാറിക്കൊണ്ടിരിക്കും. ഒരു വെയ്റ്റ് (weight) പോലും വീണ്ടും പരിശീലിപ്പിക്കാതെ തന്നെ RAG മോഡലിനെ അപ്ഡേറ്റഡ് ആയി നിലനിർത്തുന്നു. ഇത് ഒരു സ്വാഭാവിക ഓഡിറ്റ് ട്രെയ്ലും (audit trail) സൃഷ്ടിക്കുന്നു. ഏതെല്ലാം രേഖകളാണ് തിരഞ്ഞെടുത്തതെന്ന് നിങ്ങൾക്ക് അറിയാവുന്നത് കൊണ്ട്, ഒരു ഉത്തരം എവിടെ നിന്ന് വന്നു എന്ന് ഓഡിറ്റർക്കോ റെഗുലേറ്റർക്കോ കൃത്യമായി കാണിച്ചു കൊടുക്കാൻ നിങ്ങൾക്ക് കഴിയും.
ഫൈൻ-ട്യൂണിംഗ് എന്നാൽ യഥാർത്ഥത്തിൽ എന്താണ്
ഫൈൻ-ട്യൂണിംഗ് മറ്റൊരു ചോദ്യത്തിനാണ് ഉത്തരം നൽകുന്നത്: മോഡൽ എങ്ങനെ പെരുമാറണം?
മോഡലിന് പുറത്തുനിന്നുള്ള വായനാ സാമഗ്രികൾ നൽകുന്നതിന് പകരം, നിങ്ങൾ ഉദാഹരണങ്ങളിലൂടെ അതിനെ പഠിപ്പിക്കുന്നു. നിങ്ങൾക്ക് ആവശ്യമുള്ള ഔട്ട്പുട്ടുകളുടെ നൂറുകണക്കിന് അല്ലെങ്കിൽ ആയിരക്കണക്കിന് ഉദാഹരണങ്ങൾ നിങ്ങൾ ശേഖരിക്കുകയും ആ ഡാറ്റ ഉപയോഗിച്ച് ബേസ് മോഡലിനെ തുടർന്ന് പരിശീലിപ്പിക്കുകയും ചെയ്യുന്നു. ഈ പ്രക്രിയ യഥാർത്ഥത്തിൽ മോഡലിന്റെ ആന്തരിക പാരാമീറ്ററുകളെ (internal parameters) ക്രമീകരിക്കുന്നു. ഇത് വെയ്റ്റുകൾ (weights) മാറ്റുന്നു.
ഇതിന്റെ ഫലമായി പാറ്റേണുകൾ ഉൾക്കൊണ്ട (internalized) ഒരു മോഡൽ ലഭിക്കുന്നു.
