Fine-tuning மற்றும் RAG குறித்து ஒவ்வொருவருக்கும் ஒரு கருத்து உண்டு. எந்தவொரு AI மன்றத்தையும் (forum) பார்த்தால், ஆர்க்கிடெக்சர் வரைபடங்கள் மற்றும் பெஞ்ச்மார்க் (benchmark) கூற்றுகளுடன் கூடிய விவாதங்களைக் காணலாம். அந்த கருத்துகளை எழுதுபவர்களில் பெரும்பாலானவர்கள், தங்கள் சொந்தத் தரவுகளில் ஒரு மாடலுக்குப் பயிற்சி அளித்திருக்க மாட்டார்கள் அல்லது தயாரிப்பு நிலையில் (production) ஒரு RAG குழாய்முறை (pipeline) அமைதியாகத் தோல்வியடைவதைப் பார்த்திருக்க மாட்டார்கள்.

நான் பல மாதங்கள் சோதனைகளைச் செய்தேன். சரியாகச் சொன்னால் பன்னிரண்டு சோதனைகள். நான் LLM-களை Fine-tune செய்தேன். Embedders-களை Fine-tune செய்தேன். ஆறு வெவ்வேறு RAG கட்டமைப்புகளை (configurations) உருவாக்கினேன். நிதி முன்னறிவிப்பு (financial prediction) என்பதே எனது ஆய்வுத் துறை; குறிப்பாக, குழப்பமான வரலாற்றுத் தரவுகளிலிருந்து (messy historical data) இரைச்சல் மிகுந்த சந்தை முடிவுகளைக் கணிக்க முயன்றேன். நான் உண்மையான பதில்களைத் தேடினேன் என்பதால், பிளாக் போஸ்ட் (blog post) கூற்றுகளைத் தவிர்த்து, கடுமையான புள்ளிவிவரத் தரங்களைக் கடைப்பிடித்தேன்.

பெரும்பாலான சோதனைகள் தோல்வியடைந்தன. அந்தத் தோல்விகள் ஏதேனும் ஒரு அதிர்ஷ்டவசமான வெற்றியை விடப் பல மடங்கு பயனுள்ளதாக அமைந்தன.

சிக்னல் (Signal) பற்றிய கசப்பான உண்மை

நுணுக்கமான விஷயங்களுக்குள் செல்வதற்கு முன், அனைத்தையும் இணைக்கும் பாடம் இதோ: Fine-tuning மற்றும் RAG ஆகியவை ஒரு மாடல் எதை அறிய வேண்டும் அல்லது எதைப் பார்க்க வேண்டும் என்பதை மாற்றும் கருவிகள் மட்டுமே. அவை வெறும் காற்றிலிருந்து சிக்னலை உருவாக்கும் மந்திரக்கோல்கள் அல்ல. உங்கள் அடிப்படைத் தரவில் உண்மையான, பயன்படுத்தக்கூடிய ஒரு வடிவம் (pattern) இல்லையென்றால், இந்த நுட்பங்கள் அதை உருவாக்காது. அவை வெறும் இரைச்சலைச் (noise) சுற்றி ஒரு நம்பகமான கதையை உருவாக்க மட்டுமே உங்களுக்கு உதவும்.

நிதி முன்னறிவிப்பில், இந்தத் தவறு மிகவும் ஆபத்தானது. சந்தைகள் இயல்பாகவே இரைச்சல் மிகுந்தவை (noisy). நீங்கள் ஒரு சக்திவாய்ந்த LLM-ஐ வரலாற்று விலைத் தரவுகளுடன் இணைத்து, Retrieval அல்லது Fine-tuning முறைகளைச் சேர்க்கும்போது, உங்களுக்குத் தானாகவே ஒரு சாதகமான வாய்ப்பு (edge) கிடைத்துவிடாது. நீங்கள் ஒரு நாணயத்தைச் சுழற்றித் தீர்மானிப்பதையே (coin flips) மிகவும் நுணுக்கமாக விளக்கும் ஒரு வழியைப் பெறுகிறீர்கள் அவ்வளவுதான். சிக்னல் இல்லையென்றால், மாடல் உங்களுக்குப் பொய் சொல்வதில் மிகவும் திறமையானதாக மாறிவிடும். அதை முதலில் நீங்கள் சரிபார்க்க வேண்டும்.

பெரிய மாடல்கள் கற்றுக் கொள்வதற்குப் பதிலாக நினைவில் கொள்ளும்போது

எனது முதல் பெரிய தவறு, அளவிடை (scale) அனைத்தையும் சரிசெய்துவிடும் என்று நினைத்ததுதான். சரியாக 777 பயிற்சி உதாரணங்களைக் கொண்டு, 14 பில்லியன் அளவுருக்கள் (parameters) கொண்ட ஒரு மாடலை 7 பில்லியன் அளவுருக்கள் கொண்ட மாடலுடன் ஒப்பிட்டுச் சோதித்தேன். பெரிய மாடல் குறிப்பிடத்தக்க அளவில் சிறந்த eval_loss-ஐப் பெற்றது. அதன் perplexity குறைந்தது. காகிதத்தில் பார்த்தால், அது கற்றுக் கொள்வது போலத் தெரிந்தது.

பிறகு நான் அதன் வெற்றி விகிதத்தைப் (win rate) பார்த்தேன்—அதாவது மாடல் சரியாகக் கணிக்கும் உண்மையான விகிதம். 14B மாடல் 7B மாடலை விடக் குறிப்பிடத்தக்க அளவில் மோசமாகச் செயல்பட்டது. அது பயிற்சியின் போது இருந்த இரைச்சலை (training noise) அப்படியே நினைவில் வைத்துக்கொண்டது (memorized). 3,000-க்கும் குறைவான உதாரணங்களைக் கொண்டு, பெரிய மாடலுக்குத் தரவில் உள்ள தொடர்பற்ற மற்றும் சீரற்ற மாற்றங்களின் மீது அதிகப்படியான பொருத்தம் (overfit) கொள்ளும் திறன் இருந்தது. அது அடிப்படையில் இரைச்சலுக்கான ஒரு தேடல் அட்டவணையை (lookup table) உருவாக்கியது.

7B மாடல், அதன் குறைந்த அளவினால், பரந்த வடிவங்களைக் (broader patterns) கற்க வேண்டிய கட்டாயத்திற்குத் தள்ளப்பட்டது. அது ஒவ்வொரு சிறிய மாற்றத்தையும் நினைவில் கொள்ளும் வசதி அதற்கு இல்லை. நீங்கள் சிறிய தரவுத்தொகுப்புகளுடன் (datasets) பணிபுரியும் போது, சிறிய மாடல்களுடன் தொடங்குங்கள். அளவிடை (Scale) இலவசமானது அல்ல. தரவு குறைவாக இருக்கும்போது அது உங்களுக்குத் தீங்கு விளைவிக்கும்.

Loss Curve-ஐ நம்பாதீர்கள்

நான் loss curves-களைப் பார்ப்பதை நிறுத்திவிட்டேன். ஒரு மாடல் அதன் token-level cross-entropy-ஐ மேம்படுத்திக்கொண்டே இருக்கும் அதே வேளையில், நீங்கள் கவலைப்படும் உண்மையான வணிக முடிவுகளில் மோசமடையக்கூடும். ஏனெனில், மொழி மாதிரியாக்க இழப்பு (language modeling loss) அடுத்த டோக்கனைத் துல்லியமாகக் கணிப்பதற்கே வெகுமதி அளிக்கிறது. பல துறைகளில், குறிப்பாக நிதித் துறையில், சரியான முடிவும் மற்றும் அதிக நிகழ்தகவு கொண்ட அடுத்த டோக்கனும் ஒன்றல்ல.

பயிற்சியின் போது இருந்த உரைநடையை (prose) அழகாகப் பிரதிபலிக்கும் மாடல்களை நான் பார்த்தேன், ஆனால் அவை ஒவ்வொரு முறையும் தவறான திசையில் முடிவெடுத்தன. Loss குறைந்தது. அதனுடன் சேர்ந்து லாபமும் (bankroll) குறைந்தது. உங்கள் நிஜ உலகப் பணியின் அடிப்படையில் உங்கள் மதிப்பீட்டு அளவீட்டைத் (evaluation metric) தேர்ந்தெடுங்கள். நீங்கள் ஆவணங்களை வரிசைப்படுத்துகிறீர்கள் என்றால், வரிசைப்படுத்தும் தரத்தை அளவிடுங்கள். நீங்கள் முடிவுகளைக் கணிக்கிறீர்கள் என்றால், முடிவெடுக்கும் துல்லியத்தை அளவிடுங்கள். eval_loss உங்கள் மாடலைத் தேர்ந்தெடுக்க அனுமதிக்காதீர்கள்.

அந்நியச் சொற்களுக்கு (Foreign Vocabulary) மட்டுமே Fine-Tuning சிறப்பாகச் செயல்படும்

நான் இரண்டு வெவ்வேறு வகையான உரைகளில் embedder fine-tuning சோதனைகளைச் செய்தேன். முதலாவது வழக்கமான நிதிச் செய்திகள் மற்றும் பொதுப் பதிவுகளைப் பயன்படுத்தியது. Fine-tune செய்யப்பட்ட embedder மற்றும் சந்தையில் கிடைக்கும் (off-the-shelf) பதிப்பு இரண்டும் ஒரே மாதிரியாகச் செயல்பட்டன. அடிப்படை மாடலுக்கு ஏற்கனவே இந்த மொழி தெரியும். நான் தெரிந்த சூழலிலேயே பயிற்சி அளித்தேன்.

இரண்டாவது தரவுத்தொகுப்பு தனிப்பட்ட கலைச்சொற்கள் (jargon), உள் குறியீட்டுப் பெயர்கள் (internal codenames) மற்றும் இணையத்தில் காணப்படாத துறை சார்ந்த சுருக்கக் குறியீடுகளால் நிறைந்தது. இங்கே, fine-tuning மீட்டெடுப்புத் துல்லியத்தை (retrieval accuracy) 79 சதவீதம் மேம்படுத்தியது. அடிப்படை மாடலுக்கு இந்தச் சொற்களின் அர்த்தம் தெரியவில்லை. Fine-tuning அதற்கு அந்த உள்ளூர் மொழியைக் கற்றுக் கொடுத்தது.

இது இந்த முழுப் பயிற்சியையும் எனக்குப் புதிய கோணத்தில் காட்டியது. Fine-tuning என்பது ஒரு மாடலை பொதுவான அர்த்தத்தில் புத்திசாலியாக மாற்றுவதைப் பற்றியது அல்ல. அது அதற்கு ஒரு புதிய சொற்களஞ்சியம், ஒரு புதிய வடிவம் அல்லது ஒரு குறிப்பிட்ட பாணியைக் (house style) கற்பிப்பதைப் பற்றியது. உங்கள் தரவு இணையத்தைப் போலவே இருந்தால், fine-tune செய்வதைத் தவிர்க்கவும். உங்கள் தரவு அடிப்படை மாடல் பார்த்திராத ஒரு மொழியில் பேசினால், fine-tuning அவசியமாகிறது.

RAG உங்களுக்குத்

கணிப்புப் பணிகளுக்காக (prediction tasks) நான் எட்டு தனித்தனி RAG கட்டமைப்புகளைச் சோதித்தேன். ஒட்டுமொத்தமாகப் பார்க்கும்போது, retrieval முறையைச் சேர்த்தது மாதிரியின் (model) முடிவுகளில் சுமார் 30 சதவீத மாற்றத்தை ஏற்படுத்தியது. இது தாக்கத்தை ஏற்படுத்தியதாகத் தோன்றலாம். ஆனால் அவ்வாறு இல்லை. அந்த மாற்றங்கள் வெறும் இரைச்சல் (noise) மட்டுமே. ஒட்டுமொத்தத் துல்லியம் (accuracy) மேம்படவில்லை. மாறியது என்றால் மாதிரியின் தன்னம்பிக்கை (confidence) மட்டுமே. RAG முறையானது அந்த அமைப்பை அதிக உறுதியுடன் பேசுவது போலவும், அதிக ஆதாரங்களைக் குறிப்பிடுவது போலவும், நீண்ட விளக்கங்களை அளிப்பது போலவும் மாற்றியது. ஆனால், அது அதே அளவு தவறாகவே இருந்தது.

இந்த அதீத தன்னம்பிக்கை ஒரு தயாரிப்பு அபாயமாகும் (product risk). ஒரு பயனர் மேற்கோள்களைப் (citations) பார்த்து, மாதிரி தனது வேலையைச் சரியாகச் செய்துவிட்டதாகக் கருதுவார். ஆனால் உண்மையில், அது பார்ப்பதற்குத் தகுந்ததாகத் தோன்றும் ஒரு யூகத்தை மட்டுமே செய்து கொண்டிருந்தது.

ஒரு RAG மாறுபாட்டை (variant) backtesting செய்தபோதுதான் மிகவும் கசப்பான பாடம் கிடைத்தது. அது 11 சதவீத ஆண்டு லாபத்தைக் காட்டியது. மேலோட்டமாகப் பார்க்கும்போது, அது ஒரு வெற்றிகரமான உத்தியாகத் தோன்றுகிறது. ஆனால் அதன் AUC (ROC வளைவின் கீழ் உள்ள பரப்பளவு மற்றும் வகைப்பாட்டுத் திறனின் அளவீடு) 0.486 ஆக இருந்தது. இது ஒரு நாணயத்தைச் சுண்டும்போது கிடைக்கும் 0.500 என்ற வாய்ப்பை விடக் குறைவானது. அந்த லாபம் ஒரு குறிப்பிட்ட சந்தை காலத்தின் தற்செயலான நிகழ்வே (fluke) தவிர, மீண்டும் பெறக்கூடிய ஒரு திறமையல்ல. P&L-ஐ மட்டும் ஒரு அளவீடாகப் பயன்படுத்துவது ஆபத்தானது. சந்தைகள் எப்போதும் அதிர்ஷ்டமான காலங்களைக் கொடுக்கும். தற்செயலான நிகழ்வுகளிலிருந்து உண்மையானத் திறமையை வேறுபடுத்திப் பார்க்க உங்களுக்குப் புள்ளிவிவரத் திறன் அளவீடுகள் (statistical skill metrics) தேவை.

ஒவ்வொரு கருவியும் உண்மையில் என்ன செய்கிறது என்பதைத் தெரிந்து கொள்ளுங்கள்

அப்படியானால் இது நம்மை எங்கே கொண்டு செல்கிறது? மாதிரி புதிய சொற்கள், குறிப்பிட்ட வடிவங்கள் அல்லது ஒரு தனித்துவமான பாணியைக் கற்க வேண்டியிருக்கும் போது fine-tuning முறையைப் பயன்படுத்தவும். மாதிரி உண்மைகள், குறியீட்டு களஞ்சியங்கள் (code repositories) அல்லது அதன் எடைகளுக்கு (weights) வெளியே இருக்கும் நிறுவன நினைவாற்றல் (institutional memory) ஆகியவற்றைப் பெற வேண்டியிருக்கும் போது RAG முறையைப் பயன்படுத்தவும். எந்தத் தகவலும் இல்லாத தரவுகளில் ஒரு சிக்னலைக் (signal) கண்டறிய இந்த இரண்டு கருவிகளையும் பயன்படுத்த வேண்டாம். அடிப்படைத் தரவுப் படிவம் (pattern) அங்கு இல்லையென்றால், retrieval மற்றும் fine-tuning முறைகள் வெறும் இரைச்சலை (noise) இன்னும் நேர்த்தியாகக் காட்ட மட்டுமே உதவும்.

உண்மையானத் தடை

fine-tuning மற்றும் RAG ஆகியவற்றிற்கான உள்கட்டமைப்பை (infrastructure) அமைப்பது முன்னெப்போதையும் விட இப்போது எளிதாகிவிட்டது. நீங்கள் ஒரு மதிய நேரத்திலேயே ஒரு పైப்லைனை (pipeline) உருவாக்கிவிடலாம். தொழில்நுட்பம் இனித் தடையல்ல. மதிப்பீடு (Evaluation) தான் தடையாகும். பெரும்பாலான குழுக்கள் கடினமான புள்ளிவிவரப் பணிகளைத் தவிர்த்துவிட்டு, வெறும் பகட்டு அளவீடுகளைக் (vanity metrics) கொண்டாடுகிறார்கள். அவர்கள் புத்திசாலித்தனமாகத் தோன்றும் ஆனால் அமைதியாகத் தோல்வியடையும் அமைப்புகளை (systems) வெளியிடுகிறார்கள்.

பணத்தைச் செலவழிக்கும் முன் நேர்மையான சோதனைகளைச் செய்யுங்கள். உங்கள் அளவீடுகளைக் கேள்வி கேளுங்கள். overfitting இருக்கிறதா என்று சரிபார்க்கவும். மாதிரி உண்மையில் மேம்பட்டுள்ளதா என்பதை உறுதிப்படுத்திக் கொள்ளுங்கள்,