ચાર મહિના સુધી Retrieval-Augmented Generation (RAG) પાઇપલાઇનને Jupyter notebook માંથી લાઈવ સર્વિસમાં લાવ્યા પછી, લેખકે પાંચ એવા નક્કર નિર્ણયો દર્શાવ્યા છે જેણે એક ડેમોને એવા સિસ્ટમમાં બદલી નાખ્યો જેના પર વપરાશકર્તાઓ ખરેખર ભરોસો કરી શકે છે. આ તફાવત આંકડાઓમાં દેખાય છે: ટેક્સ્ટને વિભાજિત કરવાની પદ્ધતિમાં એક સામાન્ય ફેરફારથી retrieval hit rate 61% થી વધીને 83% થયો, અને 200 વાસ્તવિક ક્વેરીઝના એક મધ્યમ ઇવેલ્યુએશન સેટથી હવે ગ્રાહકો સુધી પહોંચતા પહેલા મોટાભાગના રિગ્રેસન્સ (regressions) પકડી શકાય છે.
Why it matters
RAG ડેમો પ્રભાવશાળી લાગે છે – તેઓ સેકન્ડોમાં એક ફકરો શોધી કાઢે છે અને સચોટ જવાબ આપે છે. પ્રોડક્શનમાં, સમાન અભિગમ ઘણીવાર જૂના તથ્યો, ચૂકી ગયેલા એરર કોડ્સ અથવા તૂટેલા વાક્યો આપે છે, જેનાથી વપરાશકર્તાનો વિશ્વાસ ઘટે છે. અવરોધ ભાગ્યે જ લેંગ્વેજ મોડલ હોય છે; તે સામગ્રી કેવી રીતે ઇન્જેસ્ટ (ingest), ઇન્ડેક્સ અને સર્વ કરવામાં આવે છે તેના પર આધારિત છે. પાઇપલાઇનને યોગ્ય રીતે સેટ કરવી એ મૂલ્ય ઉમેરતા ઉત્પાદન અને જવાબદારી બની જતા ઉત્પાદન વચ્ચેનો તફાવત હોઈ શકે છે.
1. Stop using fixed-size chunks
ઘણા પ્રોટોટાઇપ્સ દરેક દસ્તાવેજને 512-ટોકન બ્લોક્સમાં કાપી નાખે છે. તે ટૂંકા લખાણ માટે કામ કરે છે પરંતુ ટેકનિકલ મેન્યુઅલ્સ, સપોર્ટ થ્રેડ્સ અને કોડ સ્નિપેટ્સને બગાડી નાખે છે. વાક્યો વિભાજિત થઈ જાય છે, હેડિંગ્સ ગાયબ થઈ જાય છે, અને રિટ્રીવલ એન્જિન વપરાશકર્તા જે અપેક્ષા રાખે છે તે સંદર્ભ (context) સાથે મેળવી શકતું નથી.
સ્ટ્રક્ચર-અવેર ચંકિંગ (structure-aware chunking) પર સ્વિચ કરો—અર્થપૂર્ણ એકમોને જાળવી રાખવા માટે હેડિંગ્સ, વાતચીતની સીમાઓ અથવા કોડ ફેન્સ (code fences) પર વિભાજિત કરો. લેખકની સિસ્ટમમાં, આ એક ફેરફારથી જ સંબંધિત ફકરો શોધતી ક્વેરીઝનો હિસ્સો 61% થી વધીને 83% થયો. આ સુધારો ડેટા-ફોર્મેટના ફેરફારથી આવે છે; મૂળભૂત મોડલ સમાન રહે છે.
2. Use hybrid search
શુદ્ધ વેક્ટર સર્ચ (embedding-based similarity) સમાન અર્થ ધરાવતા ફકરાઓ શોધવામાં ઉત્તમ છે, પરંતુ તે એરર કોડ્સ, વર્ઝન નંબર અથવા પ્રોપ્રાઇટરી ટર્મિનોલોજી જેવા ચોક્કસ આઇડેન્ટિફાયર્સ પર અટકી જાય છે. “ERR-XXXX” જેવો એરર કોડ શોધતા વપરાશકર્તાને કદાચ અર્થપૂર્ણ રીતે સમાન ફકરો મળી શકે છે જેમાં કોડ જ ન હોય.
હાઇબ્રિડ સર્ચ (hybrid search) એક ડેન્સ વેક્ટર ઇન્ડેક્સને પરંપરાગત BM25 ઇન્ડેક્સ (term-frequency આધારિત) સાથે જોડે છે. બંને સ્કોર્સને વજન (weighting) આપીને, સિસ્ટમ એવી વસ્તુઓ રિટ્રીવ કરે છે જે અર્થપૂર્ણ રીતે નજીક હોય અને જેમાં વપરાશકર્તાએ ટાઇપ કરેલા ચોક્કસ શબ્દો પણ હોય. પ્રોડક્શન માટે, હાઇબ્રિડ સર્ચ એ એક પાયાની જરૂરિયાત છે, માત્ર વધારાની સુવિધા નથી.
3. Handle stale data
જૂની થઈ ગયેલી પ્રાઇસિંગ ટેબલ્સ, પોલિસી દસ્તાવેજો અથવા ફર્મવેર રિલીઝ નોટ્સ ઝડપથી વિશ્વસનીયતા ખ
એક સારી રીતે ટ્યુન કરેલી પાઇપલાઇન હેલ્યુસિનેશન ઘટાડે છે, જવાબની સુસંગતતામાં સુધારો કરે છે, અને ઓવર-પ્રોવિઝન કરેલા મોડલ્સનો ખર્ચ ઘટાડે છે. તેનો ફાયદો એ છે કે વપરાશકર્તાનો સંતોષ વધે છે અને સપોર્ટ ઓવરહેડ ઘટે છે. આ પગલાઓની અવગણના કરવાથી એક અસ્થિર સેવા મળે છે જે બ્રાન્ડના વિશ્વાસને નુકસાન પહોંચાડે છે અને ખર્ચાળ સમસ્યાઓ ઉકેલવા માટે મજબૂર કરે છે.
આગળ શું જોવું
જેમ જેમ ઓપન-સોર્સ એમ્બેડિંગ્સ અને વેક્ટર ડેટાબેઝ પરિપક્વ થશે, તેમ તેમ “dense” અને “sparse” રીટ્રીવલ વચ્ચેનો તફાવત ઓછો થતો જશે, પરંતુ સેમેન્ટિક અને એક્ઝેક્ટ મેચિંગને જોડવાનો સિદ્ધાંત યથાવત રહેશે.
મુખ્ય વાત: RAG સિસ્ટમમાં લેંગ્વેજ મોડલ ભાગ્યે જ મુખ્ય અવરોધ હોય છે. સાચું કામ એ છે કે તમે મૂળ સામગ્રીને કેવી રીતે સ્લાઈસ, ઇન્ડેક્સ અને સર્ફેસ કરો છો. આ નિર્ણયો સાચા લેવાથી એક આકર્ષક ડેમો એક વિશ્વસનીય પ્રોડક્ટમાં બદલાઈ જાય છે.
