ஒரு டெவலப்பரின் RAG முன்மாதிரி (prototype), 0.50-க்கும் குறைவான கோசைன் ஒற்றுமை (cosine similarity) கொண்ட எந்தவொரு வினாவிற்கும் பதிலளிக்க மறுத்துவிட்டது. எம்பெடிங் மாடல் (embedding model) மாற்றப்படும் வரை அது மிகச்சரியாகச் செயல்பட்டது. ஆனால் மாடல் மாற்றப்பட்ட பிறகு, அந்தப் பாதுகாப்பு வரம்பு (guard) தவறான பதில்களைக் கூட அமைதியாக உள்ளே அனுமதித்தது. ஒரு குறிப்பிட்ட மதிப்பிற்குப் பதிலாக (hard-coded) ஒரு வரம்பை நிர்ணயிப்பது, மாடல்களுக்கு இடையே தோல்வியடையக்கூடும் என்பதை இந்தச் சம்பவம் நிரூபிக்கிறது. இது பாதுகாப்புச் சரிபார்ப்புகளுக்கு எம்பெடிங் ஒற்றுமையையே நம்பியிருக்கும் எந்தவொரு அமைப்பிற்கும் ஒரு பெரிய ஆபத்தாகும்.
ஏன் அந்த வரம்பு முக்கியமானது
Retrieval-augmented generation (RAG) குழாய்கள் (pipelines) பெரும்பாலும் ஒரு ஒற்றுமைப் பாதுகாப்பைப் (similarity guard) பயன்படுத்துகின்றன: ஒரு வினாவிற்கும் அதன் நெருக்கமான ஆவணத்திற்கும் இடையிலான கோசைன் ஒற்றுமை முன்கூட்டியே நிர்ணயிக்கப்பட்ட எண்ணை விடக் குறைவாக இருந்தால், அமைப்பு பதிலளிப்பதைத் தடுத்துவிடும். மீட்டெடுக்கப்பட்ட சூழல் (context) பலவீனமாக இருக்கும்போது, மாடல் மாயத்தோற்றங்களை (hallucinating) உருவாக்குவதைத் தடுக்க இந்தத் தடுப்பு உதவுகிறது. ஆரம்ப அமைப்பில், 0.50 என்ற வரம்பு அமைப்பைச் சரியாக வைத்திருந்தது—பதிலளிக்க முடியாத வினாவிற்குத் தகுந்த குறைந்த மதிப்பெண்களும், பதிலளிக்கக்கூடிய வினாவிற்குத் தகுந்த அதிக மதிப்பெண்களும் கிடைத்தன.
எம்பெடிங் பேக்எண்ட் (embedding backend) மாறியபோது, அதே 0.50 வரம்பு அந்த இரண்டு குழுக்களையும் பிரிக்கவில்லை. எந்தவிதமான பிழையும் அல்லது தெளிவான எச்சரிக்கையும் இன்றி, அந்தப் pipeline நம்பிக்கையான ஆனால் தவறான பதில்களைத் தரத் தொடங்கியது. இந்தத் தோல்வி வழக்கமான தரவரிசை அளவீடுகளில் (ranking metrics) சிக்காமல் இருந்தது; ஒரு மனிதன் அந்த மாற்றத்தைக் கவனித்த பின்னரே அது தெரியவந்தது.
வடிவியல் என்பது உலகளாவியது அல்ல
ஒவ்வொரு எம்பெடிங் மாடலும் மொழியை அதன் சொந்த வடிவியலைக் (geometry) கொண்ட ஒரு உயர்-பரிமாண வெளிக்குள் (high-dimensional space) வரைபடமாக்குகிறது. எனவே, கோசைன் ஒற்றுமை மதிப்புகள் ஒரு மாடலில் இருந்து மற்றொரு மாடலுக்கு மாறுபடும். 0.50 என்ற மதிப்பெண் ஒரு மாடலுக்குத் தெளிவான இடைவெளியின் விளிம்பாக இருக்கலாம், ஆனால் மற்றொரு மாடலுக்கு அது மிக நெருக்கமான ஒன்றாகவும் இருக்கலாம்.
- Voyage-3 – 0.50 என்ற கோடு, குறைந்த மதிப்பெண் கொண்ட பதிலளிக்க முடியாத வினாவிற்கும், அதிக மதிப்பெண் கொண்ட பதிலளிக்கக்கூடிய வினாவிற்கும் இடையில் அமைகிறது. பாதுகாப்பு வரம்பு திட்டமிட்டபடி செயல்படுகிறது.
- BGE-Small – பல பதிலளிக்க முடியாத வினவுகள் 0.50-க்கு மேல் மதிப்பெண் பெறுகின்றன, எனவே பாதுகாப்பு வரம்பு செயல்படுவதில்லை. வரம்பை 0.70 ஆக உயர்த்துவது பாதுகாப்பை மீட்டெடுக்கிறது.
- Hashing-64 – பதிலளிக்கக்கூடிய மற்றும் பதிலளிக்க முடியாத வினவுகளின் மதிப்பெண்கள் மிக நெருக்கமாகப் பின்னிப் பிணைந்துள்ளன; எனவே எந்தவொரு ஒற்றைத் threshold-ஆலும் அவற்றை பிரிக்க முடியாது; இந்த மாடல் ஒரு ஒற்றுமைப் பாதுகாப்பை ஆதரிக்கத் தகுதியற்றது.
இந்த நிகழ்வுகள் ஒரு பரந்த உண்மையை விளக்குகின்றன: ஒரு வரம்பு (threshold) என்பது ஒரு குறிப்பிட்ட மாடல்-தரவு ஜோடிக்கானது, அது உலகளாவிய விதி அல்ல.
ஒரு நிலையான மதிப்பைப் பயன்படுத்துவதன் மறைமுகச் செலவு
ஒற்றுமை வரம்புகள் பல பணிகளில் பயன்படுத்தப்படுகின்றன:
- semantic caching
- duplicate detection
- document relevance checks
- entity matching
ஒரு நிலையான மதிப்பைப் பயன்படுத்துவது என்பது அனைத்து எம்பெடிங் மாடல்களும் ஒரே மாதிரியான மதிப்பெண் விநியோகத்தைப் (score distribution) பகிர்ந்து கொள்கின்றன என்று கருதுவதாகும்—இது ஒரு ஆபத்தான அனுமானம். இந்த அனுமானம் தோல்வியடையும் போது, அமைப்புகள் அமைதியாகத் தவறான ஆனால் நம்பிக்கையான வெளியீடுகளைத் தருகின்றன, இது பயனரின் நம்பிக்கையைச் சிதைப்பதோடு, தவறான தரவுகளைக் கொண்டு அடுத்தகட்ட முடிவுகளை எடுக்கத் தூண்டுகிறது.
மாடல் வாரியாகப் பாதுகாப்பைக் சரிசெய்தல்
இதற்கான தீர்வு எளிமையானது: ஒரு நிலையான மதிப்பினை (hard-coded constant) ஒருபோதும் பயன்படுத்தாதீர்கள். ஒவ்வொரு புதிய எம்பெடிங் மாடலுக்கும் சரிசெய்யப்பட வேண்டிய ஒரு ஹைப்பர்-பாராமீட்டராக (hyper-parameter) இந்த வரம்பைக் கருதுங்கள்.
- பதிலளிக்கக்கூடிய மற்றும் பதிலளிக்க முடியாத வினவுகள் ஆகிய இரண்டையும் உள்ளடக்கிய ஒரு சிறிய, லேபிளிடப்பட்ட சரிபார்ப்புத் தொகுப்பை (validation set) உருவாக்குங்கள்.
- இலக்கு மாடலைப் (target model) பயன்படுத்தி ஒவ்வொரு வினா-ஆவண ஜோடிக்கும் கோசைன் ஒற்றுமைகளைக் கணக்கிடுங்கள்.
- இரண்டு விநியோகங்களையும் (distributions) வரைபடமாக வரையுங்கள் அல்லது தவறான நம்பிக்கையூட்டும் விகிதத்தைக் (false-confident rate) கணக்கிடுங்கள்—அதாவது பதிலளிக்க முடியாத வினவுகளில் எத்தனை வினவுகள் நிர்ணயிக்கப்பட்ட வரம்பைத் தாண்டுகின்றன என்பதன் விகிதம்.
- தவறான நம்பிக்கையூட்டும் விகிதத்தை ஏற்றுக்கொள்ளக்கூடிய ஆபத்து நிலைக்குக் கீழே வைத்திருக்கும் மிகச்சிறிய ஒற்றுமை மதிப்பைத் தேர்ந்தெடுங்கள்.
இலக்கு அதிகப்படியான நம்பிக்கையைத் தடுப்பதே என்பதால், mean reciprocal rank (MRR) போன்ற வழக்கமான தரவரிசை அளவீடுகள் போதுமானவை அல்ல. தவறான நம்பிக்கையூட்டும் விகிதம் (false-confident rate) நேரடியாகப் பாதுகாப்பின் தோல்வி முறையை அளவிடுகிறது.
எதிர்முனை: “சில மாடல்கள் நேரடியாகச் செயல்படுகின்றன”
உதாரணத்தில் உள்ள Voyage-3 போன்ற சில மாடல்கள் தற்செயலாக 0.50 வரம்புடன் ஒத்துப்போகின்றன என்பது உண்மைதான். ஆனால் அது எதிர்கால நிலைத்தன்மையை உறுதிப்படுத்தாது. மாடல் புதுப்பிப்புகள், ஃபைன்-டியூனிங் அல்லது அடிப்படைத் தரவுத் தொகுப்பில் (corpus) ஏற்படும் மாற்றங்கள் ஒற்றுமை விநியோகத்தை மாற்றி, மீண்டும் பாதுகாப்பைச் செயலிழக்கச் செய்யலாம். ஒரு அதிர்ஷ்டமான பொருத்தத்தை மட்டும் நம்பியிருப்பது அலட்சியத்திற்கு வழிவகுக்கும்.
அடுத்து கவனிக்க வேண்டியவை
-
-
-
முக்கியக் கருத்து
ஒற்றுமை வரம்பு என்பது ஒரு உலகளாவிய பாதுகாப்பு சுவிட்ச் அல்ல; அது நீங்கள் எம்பெடிங் பேக்எண்ட் அல்லது தரவை மாற்றும் ஒவ்வொரு முறையும் சரிசெய்யப்பட வேண்டிய மாடல் சார்ந்த பாதுகாப்பு வரம்பு ஆகும். இந்த உண்மையை அலட்சியப்படுத்துவது RAG அமைப்புகளை அமைதியான மாயத்தோற்றத்திற்கு (silent hallucination) உள்ளாக்கும், இது அந்தப் பாதுகாப்பின் நோக்கத்தையே சிதைக்கும். முறையான மாடல் வாரியான சரிசெய்தல் மற்றும் தவறான நம்பிக்கையூட்டும் விகிதத்தைத் தொடர்ச்சியாகக் கண்காணிப்பதே முன்னேறுவதற்கான ஒரே நம்பகமான வழியாகும்.
