Retrieval-Augmented Generation (RAG) தொழில்நுட்பத்தை ஒரு டெமோவிலிருந்து (demo) நேரடிப் பயன்பாட்டிற்கு (production service) மாற்றும் குழுக்கள், ஒரு பயனுள்ள உதவியாளருக்கும் தேவையற்ற தகவல்களைத் தரும் ஒரு கருவிக்கும் இடையிலான வேறுபாட்டைத் தீர்மானிக்கும் சில முக்கியமான முடிவுகளை எடுக்க வேண்டியிருக்கும். ஐந்து வடிவமைப்புத் தேர்வுகள்—chunking, embedding model, vector store, hybrid search மற்றும் evaluation—பயனர்கள் அனுபவிக்கும் துல்லியம் (precision), மீளப்பெறுதல் (recall) மற்றும் தாமத நேரம் (latency) ஆகியவற்றைக் கட்டுப்படுத்துகின்றன.

முன்மாதிரியிலிருந்து (prototype) நேரடிப் பயன்பாட்டிற்கு மாறுவது ஏன் முக்கியம்

பெரும்பாலான பயிற்சிகள் (tutorials) ஒரு RAG পাইப்லைனைச் சில வரிகளில் இயக்கிவிடுகின்றன, ஆனால் நேரடிப் பயன்பாட்டிற்குத் தேவையான பொறியியல் நுணுக்கங்களை (engineering rigor) வழங்குவதில்லை.

1. Chunking strategy – முதல் தரக் கட்டுப்பாடு

Chunk அளவு மிக முக்கியமானது. பெரிய chunk-கள் தேவையற்ற உரைகளால் முக்கியத் தகவலை மறைத்துவிடும்; சிறிய chunk-கள் மாடலுக்குத் தேவையான சூழலை (context) நீக்கிவிடும். நிலையான அளவுப் பிரிப்பு (Fixed-size splitting) மூலத்தின் இயற்கையான கட்டமைப்பைப் புறக்கணிக்கிறது.

நடைமுறை விதி

  • தர்க்கரீதியான எல்லைகளில் பிரிக்கவும் (logical boundaries): ஆவணங்களில் உள்ள தலைப்புகள் (headers), கட்டுரைகளில் உள்ள பத்திப் பிரிவுகள் (paragraph breaks), குறியீட்டில் உள்ள செயல்முறை வரையறைகள் (function definitions).
  • துல்லியமான மீட்டெடுப்பிற்கு (retrieval) chunk-களைச் சிறியதாக வைத்திருக்கவும், ஆனால் LLM-ன் உருவாக்கத்திற்கு (generation) பெரிய 'parent section'-ஐத் தக்கவைக்கவும். இந்த “parent-child” முறை, மீட்டெடுப்பாளர் (retriever) ஒரு துல்லியமான பகுதியை வெளிக்கொண்டு வரவும், அதே சமயம் உருவாக்கும் கருவி (generator) உண்மையான தகவல்களைத் தருவதற்குத் தேவையான சூழலைப் பெறவும் உதவுகிறது.

2. Embedding models – ஒற்றுமை எவ்வாறு தீர்மானிக்கப்படுகிறது

Embedding model உரையை வெக்டர்களாக (vectors) மாற்றுகிறது, அதைச் ஒற்றுமைத் தேடல் இயந்திரம் (similarity search engine) ஒப்பிடுகிறது. OpenAI-ன் text-embedding-3-large போன்ற ஒரு வலுவான பொது நோக்கத்திற்கான மாடல் (general-purpose model) பெரும்பாலான துறைகளுக்கு ஒரு சிறந்த அடிப்படையை வழங்குகிறது. உங்கள் தரவுத்தொகுப்பு (corpus) சட்டம், மருத்துவப் பதிவுகள் அல்லது தொழில்நுட்ப விவரக்குறிப்புகள் போன்ற மிகவும் சிறப்பு வாய்ந்த துறையைச் சார்ந்ததாக இருந்தால், ஒரு குறிப்பிட்ட துறை சார்ந்த மாடலை (domain-specific model) சோதித்துப் பார்க்கவும்; ஆனால் உங்கள் சொந்தத் தரவில் அது குறிப்பிடத்தக்க முன்னேற்றத்தைத் தருகிறதா என்பதை அளவிட்ட பின்னரே அவ்வாறு செய்யவும்.

எப்போது மாற்ற வேண்டும்

  • உங்கள் பயன்பாட்டிற்குத் தேவையான முக்கியத் தரவரிசை மதிப்பெண்களில் (relevance scores) அளவிடக்கூடிய முன்னேற்றம் (உதாரணமாக, அதிக context precision) தெரிந்தால் மட்டுமே மாற்றவும்.

3. Vector database – சேமிப்பகத்தை விரிவாக்குதல்

உங்கள் தற்போதைய உள்கட்டமைப்பு மற்றும் எதிர்பார்க்கப்படும் வெக்டர்களின் எண்ணிக்கைக்குப் பொருந்தும் ஒரு vector store-ஐத் தேர்ந்தெடுக்கவும்.

  • pgvector PostgreSQL-க்குள் இயங்குகிறது மற்றும் சுமார் ஒரு மில்லியன் வெக்டர்களை எளிதாகக் கையாளும். ஏற்கனவே ஒரு உறவுநிலைத் தரவுத்தளத்தை (relational database) பயன்படுத்தி வரும் குழுக்களுக்கு இது ஒரு குறைந்த பராமரிப்புத் தீர்வாக அமையும்.
  • Qdrant 1 M–100 M வரம்பில் சிறப்பாகச் செயல்படுகிறது, பெரிய தரவுத்தொகுப்புகளுக்கு அதிகத் திறன் (throughput) மற்றும் குறைந்த தாமத நேரத்தை (latency) வழங்குகிறது.
  • Pinecone ஒரு முழுமையான மேலாண்மை செய்யப்பட்ட கிளவுட் சேவையை (fully managed cloud service) வழங்குகிறது, இது நீங்களாகவே ஹோஸ்ட் செய்வதற்கான செயல்பாட்டுச் சுமையைக் குறைக்கிறது.

4. Hybrid search மற்றும் reranking – பொருண்மை மற்றும் துல்லியத்திற்கு இடையிலான சமநிலை

தூய வெக்டர் தேடல் (Pure vector search) பொருண்மை ஒற்றுமையில் (semantic similarity) சிறந்து விளங்கினாலும், பயனர்கள் எதிர்பார்க்கும் துல்லியமான முக்கியச் சொல் பொருத்தங்களை (exact keyword matches) தவறவிடலாம். Hybrid search, வெக்டர் குறியீட்டின் (vector index) மேல் ஒரு பாரம்பரிய BM25 முக்கியச் சொல் குறியீட்டை (keyword index) அடுக்கி, பின்னர் இரண்டு முடிவுகளையும் இணைக்கிறது. Reciprocal Rank Fusion (RRF) என்பது ஒவ்வொரு முடிவிற்கும் அதன் தரவரிசையின் அடிப்படையில் மதிப்பெண் வழங்கி அவற்றை இணைக்கிறது, இது ஏதேனும் ஒரு பட்டியலில் உயர் இடத்தில் இருக்கும் உருப்படிகளுக்கு முன்னுரிமை அளிக்கிறது.

Reranking ஒரு இறுதித் துல்லிய வடிகட்டியாகச் (precision filter) செயல்படுகிறது. Hybrid retrieval-க்குப் பிறகு, முதல் N (பொதுவாக 50) முடிவுகளை ஒரு cross-encoder-க்கு அனுப்பவும்—இது ஒரு வினாவையும் ஆவணத்தையும் இணைத்து மதிப்பெண் வழங்கும் மாடல் ஆகும். Cross-encoder-ன் மதிப்பெண்கள் அசல் ஒற்றுமை எண்களுக்குப் பதிலாகப் பயன்படுத்தப்படுகின்றன, இது LLM-க்கு அனுப்புவதற்கு முன் மிகவும் பொருத்தமான chunk-ஐத் தேர்ந்தெடுக்க உதவுகிறது. இந்த கூடுதல் படிநிலை, குறிப்பாக நீண்ட அல்லது குழப்பமான தரவுத்தொகுப்புகளுக்கு, பதிலின் தரத்தில் குறிப்பிடத்தக்க முன்னேற்றத்தைத் தரும்.

5. Evaluation மற்றும் abstention – முக்கியமானவற்றை அளவிடுதல்

நீங்கள் அளவிடாத ஒரு அமைப்பை மேம்படுத்த முடியாது. RAGAS கட்டமைப்பானது ஒரு RAG পাইப்லைனின் ஆரோக்கியத்தைக் கண்டறிய நான்கு அளவீடுகளைப் (metrics) பரிந்துரைக்கிறது:

  • Context Precision – மீட்டெடுக்கப்பட்ட chunk-களில் உண்மையில் பதில் உள்ள விகிதம்.
  • Context Recall – மீட்டெடுக்கப்பட்ட அனைத்துத் தொடர்புடைய chunk-களின் பங்கு.
  • Faithfulness – உருவாக்கப்பட்ட பதில் மீட்டெடுக்கப்பட்ட சூழலுக்குள் (context) எவ்வளவு துல்லியமாக இருக்கிறது மற்றும் கற்பனையான தகவல்களைத் (hallucinations) தவிர்க்கிறதா என்பது.
  • Answer Relevance – இறுதிப் பதில் அசல் வினாவிற்கு எவ்வளவு சிறப்பாகப் பதிலளிக்கிறது என்பது.

நேரடிப் பயன்பாட்டுப் போக்குவரத்தைப் பிரதிபலிக்கும் ஒரு சோதனைத் தொகுப்பின் (test set) மூலம் இந்த அளவீடுகளைத் தொடர்ந்து கண்காணிக்கவும்.

அடிக்கடி கவனிக்கப்படாமல் போகும் ஒரு இறுதிப் பாதுகாப்பு நடவடிக்கை abstention (பதில் சொல்ல மறுத்தல்) ஆகும். குறைந்த நம்பிக்கையுடன் (low confidence) மாடல் பதிலளிக்கக் கட்டாயப்படுத்துவதற்குப் பதிலாக, faithfulness அல்லது relevance மதிப்பெண்ணில் ஒரு வரம்பை (threshold) நிர்ணயிக்கவும்; அந்த வரம்பிற்கு கீழ் இருந்தால் “எனக்குத் தெரியாது” என்ற பதிலை வழங்கச் செய்யவும். ஒரு பயனர், நம்பிக்கையுடன் தவறான பதிலைப் பெறுவதை விட, தெளிவான நிச்சயமற்ற தன்மையையே விரும்புவார். மேலும், இது பிந்தைய ஆதரவுச் செலவுகளையும் (support costs) குறைக்கிறது.

இந்த ஐந்து பகுதிகளையும் ஒருமுறை அமைத்துவிட்டு மறந்துவிட வேண்டிய அமைப்புகளாகப் பார்க்காமல், ஒவ்வொரு முறையும் முடிவெடுக்க வேண்டிய முக்கியத் தருணங்களாகக் கருதினால், RAG-ஐ ஒரு பகட்டான டெமோவிலிருந்து நம்பகமான நேரடிப் பயன்பாட்டுச் சேவையாக மாற்ற முடியும். இதன் பலன்: விரைவாகப் பதிலளிக்கும், தலைப்பிலிருந்து விலகாத மற்றும் எப்போது அமைதியாக இருக்க வேண்டும் என்பதைத் தெரிந்த ஒரு சிறந்த அமைப்பு.