Fine-tuning વિરુદ્ધ RAG વિશે દરેક વ્યક્તિનું પોતાનું મંતવ્ય હોય છે. કોઈપણ AI ફોરમ પર સ્ક્રોલ કરો અને તમને આર્કિટેક્ચર ડાયાગ્રામ અને બેન્ચમાર્ક દાવાઓથી ભરેલી ગરમ ચર્ચાઓ જોવા મળશે. જે લોકો આ કોમેન્ટ્સ લખી રહ્યા છે, તેમાંના મોટાભાગના લોકોએ ક્યારેય તેમના પોતાના ડેટા પર મોડેલને ટ્રેન કર્યું નથી અથવા પ્રોડક્શનમાં RAG પાઇપલાઇનને નિષ્ફળ જતી જોઈ નથી.

મેં મહિનાઓ સુધી પ્રયોગો કર્યા. ચોક્કસ કહીએ તો બાર પ્રયોગો. મેં LLMs ને fine-tune કર્યા. મેં embedders ને fine-tune કર્યા. મેં છ અલગ-અલગ RAG કોન્ફિગરેશન બનાવ્યા. આ ક્ષેત્ર નાણાકીય આગાહી (financial prediction) હતું, ખાસ કરીને અસ્તવ્યસ્ત ઐતિહાસિક ડેટામાંથી અસ્પષ્ટ માર્કેટ પરિણામોનું અનુમાન લગાવવાનો પ્રયાસ હતો. મેં મારી જાતને કડક આંકડાકીય ધોરણો સાથે બાંધી રાખી હતી કારણ કે મારે બ્લોગ પોસ્ટના દાવાઓ નહીં, પણ વાસ્તવિક જવાબો જોઈતા હતા.

મોટાભાગના પ્રયોગો નિષ્ફળ ગયા. તે નિષ્ફળતાઓ કોઈપણ નસીબદાર સફળતા કરતા વધુ ઉપયોગી સાબિત થઈ.

સિગ્નલ વિશેનો કડવો સત્ય

વિગતોમાં ઉતરતા પહેલા, અહીં એ પાઠ છે જે બધું એકસાથે જોડે છે. Fine-tuning અને RAG એ મોડેલ શું જાણે છે અથવા તે શું જુએ છે તે બદલવા માટેના સાધનો છે. તેઓ શૂન્યમાંથી સિગ્નલ બનાવવાની જાદુઈ લાકડીઓ નથી. જો તમારા મૂળ ડેટામાં કોઈ વાસ્તવિક, ઉપયોગી પેટર્ન ન હોય, તો આ ટેકનિકો તેને બનાવશે નહીં. તેઓ ફક્ત તમને રેન્ડમ નોઈઝ (random noise) ની આસપાસ વધુ પ્રભાવશાળી વાર્તા બનાવવામાં મદદ કરશે.

નાણાકીય આગાહીમાં, આ જાળ ખાસ કરીને જોખમી છે. બજારો કુદરતી રીતે જ અસ્પષ્ટ (noisy) હોય છે. જ્યારે તમે ઐતિહાસિક ભાવના ડેટા સાથે શક્તિશાળી LLM ને જોડો છો અને તેમાં retrieval અથવા fine-tuning ઉમેરો છો, ત્યારે તમને આપમેળે કોઈ વધારાનો ફાયદો (edge) મળતો નથી. તમને સિક્કા ઉછાળવાના પરિણામોને તર્કબદ્ધ રીતે રજૂ કરવાની વધુ સ્પષ્ટ રીત મળે છે. જો સિગ્નલ ત્યાં ન હોય, તો મોડેલ તમને જૂઠું કહેવામાં ખૂબ જ કુશળ બની જાય છે. તમારે પહેલા તે તપાસવાની જરૂર છે.

જ્યારે મોટું મોડેલ શીખવાને બદલે યાદ રાખવા લાગે

મારી પહેલી મોટી ભૂલ એ હતી કે મેં ધાર્યું હતું કે સ્કેલ (scale) બધું ઠીક કરી દેશે. મેં બરાબર 777 ટ્રેનિંગ ઉદાહરણો પર 14 બિલિયન પેરામીટર ધરાવતા મોડેલની સરખામણી 7 બિલિયન પેરામીટર ધરાવતા મોડેલ સાથે કરી. મોટા મોડેલે નોંધપાત્ર રીતે વધુ સારો eval_loss મેળવ્યો. તેની perplexity ઘટી ગઈ. કાગળ પર, તે શીખી રહ્યું હતું.

પછી મેં win rate જોયો, જે મોડેલ દ્વારા સાચી આગાહી કરવાની વાસ્તવિક દર હતો. 14B મોડેલે 7B મોડેલ કરતા નોંધપાત્ર રીતે ખરાબ પ્રદર્શન કર્યું. તેણે ટ્રેનિંગ નોઈઝને યાદ રાખી લીધો હતો. 3,000 થી ઓછા ઉદાહરણો સાથે, મોટા મોડેલમાં ડેટામાં રહેલા ખોટા સંબંધો (spurious correlations) અને રેન્ડમ વધઘટ પર overfit થવા માટે પૂરતી ક્ષમતા હતી. તેણે અનિવાર્યપણે નોઈઝનું લુકઅપ ટેબલ બનાવી લીધું હતું.

7B મોડેલ, તેની નાની ક્ષમતાને કારણે, વ્યાપક પેટર્ન શીખવા માટે મજબૂર હતું. તે દરેક નાની વિગતને યાદ રાખી શકતું નહોતું. જો તમે નાના ડેટાસેટ સાથે કામ કરી રહ્યા હોવ, તો નાના મોડેલોથી શરૂઆત કરો. સ્કેલ મફત નથી હોતું. જ્યારે ડેટા ઓછો હોય ત્યારે તે તમને સક્રિય રીતે નુકસાન પહોંચાડી શકે છે.

લોસ કર્વ (Loss Curve) પર વિશ્વાસ ન કરો

મેં લોસ કર્વને સતત જોવાનું બંધ કરવાનું શીખી લીધું. એક મોડેલ તેના token-level cross-entropy માં સુધારો કરી શકે છે, પરંતુ તમે જે વાસ્તવિક બિઝનેસ નિર્ણયની ચિંતા કરો છો તેમાં વધુ ખરાબ બની શકે છે. આવું એટલા માટે થાય છે કારણ કે language modeling loss આગલા ટોકનની સચોટ આગાહી કરવા માટે વળતર આપે છે. ઘણા ક્ષેત્રોમાં, ખાસ કરીને ફાઇનાન્સમાં, સાચો નિર્ણય અને સૌથી સંભવિત આગલો ટોકન એક સમાન નથી હોતા.

મેં એવા મોડેલ્સ જોયા જે ટ્રેનિંગ પ્રોઝ (prose) ને સુંદર રીતે ફરીથી રજૂ કરતા હતા પરંતુ દર વખતે ખોટો દિશાત્મક નિર્ણય (directional bet) લેતા હતા. લોસ ઘટતો ગયો. તેની સાથે બેંકરોલ પણ ઘટતું ગયું. તમારા વાસ્તવિક કાર્યના આધારે તમારું evaluation metric પસંદ કરો. જો તમે દસ્તાવેજોનું રેન્કિંગ કરી રહ્યા હોવ, તો રેન્કિંગની ગુણવત્તા માપો. જો તમે પરિણામોની આગાહી કરી રહ્યા હોવ, તો નિર્ણયની ચોકસાઈ માપો. ક્યારેય eval_loss ને તમારા વતી મોડેલ પસંદ કરવા ન દો.

Fine-Tuning માત્ર વિદેશી શબ્દભંડોળ પર જ ચમકે છે

મેં બે અલગ-અલગ ટેક્સ્ટ પ્રકારો પર embedder fine-tuning ટ્રાયલ્સ ચલાવી હતી. પ્રથમમાં પ્રમાણભૂત નાણાકીય સમાચાર અને પબ્લિક ફાઇલિંગનો ઉપયોગ કરવામાં આવ્યો હતો. Fine-tuned એમ્બેડર અને ઓફ-ધ-શેલ્ફ (off-the-shelf) વર્ઝન બંનેનું પ્રદર્શન સમાન હતું. બેઝ મોડેલ પહેલેથી જ આ ભાષા જાણતું હતું. હું પરિચિત ક્ષેત્રમાં ટ્યુનિંગ કરી રહ્યો હતો.

બીજો ડેટાસેટ ખાનગી જાર્ગન (jargon), આંતરિક કોડનેમ્સ અને ડોમેન-સ્પેસિફિક શોર્ટહેન્ડથી ભરેલો હતો જે ક્યારેય ઓપન ઇન્ટરનેટ પર દેખાતો નહોતો. અહીં, fine-tuning એ retrieval accuracy માં 79 ટકાનો સુધારો કર્યો. બેઝ મોડેલને ખરેખર ખબર જ નહોતી કે આ શબ્દોનો અર્થ શું છે. Fine-tuning એ તેને સ્થાનિક શબ્દભંડોળ શીખવ્યું.

આનાથી મારા માટે આખો અભ્યાસ બદલાઈ ગયો. Fine-tuning એ મોડેલને સામાન્ય રીતે સ્માર્ટ બનાવવા વિશે નથી. તે તેને નવું શબ્દભંડોળ, નવું ફોર્મેટ અથવા હાઉસ સ્ટાઇલ શીખવવા વિશે છે. જો તમારો ડેટા ઇન્ટરનેટ જેવો દેખાતો હોય, તો fine-tune કરવાનું છોડી દો. જો તમારો ડેટા એવી ભાષા બોલતો હોય જે બેઝ મોડેલે ક્યારેય જોઈ નથી, તો fine-tuning અનિવાર્ય બની જાય છે.

RAG તમને નિશ્ચિતતા આપે છે, સત્ય નહીં

I tested eight separate RAG configurations for prediction tasks. Across the board, adding retrieval changed roughly 30 percent of the model's decisions. That sounds impactful. It was not. Those changes were pure noise. The overall accuracy did not improve. What did change was the model's confidence. RAG made the system sound more certain, cite more sources, and produce longer justifications. All while being just as wrong.

This overconfidence is a product risk. A user sees citations and assumes the model has done its homework. In reality, it was doing sophisticated-looking guesswork.

The most painful lesson came from backtesting one RAG variant. It showed an 11 percent annual profit. On the surface, that looks like a winning strategy. But its AUC, the area under the ROC curve and a measure of classification skill, was 0.486. That is worse than a coin flip, which sits at 0.500. The profit was a fluke of the specific market period, not a repeatable edge. Using P&L alone as a metric is dangerous. Markets hand out lucky streaks all the time. You need statistical skill metrics to separate flukes from competence.

Know What Each Tool Actually Does

So where does this leave us? Use fine-tuning when the model needs to learn new words, specific formats, or a distinctive style. Use RAG when the model needs access to facts, code repositories, or institutional memory that lives outside its weights. Do not use either tool to discover signal in data that has none. If the underlying pattern is not there, retrieval and fine-tuning will only help you dress up the noise in a sharper suit.

The Real Bottleneck

The infrastructure for fine-tuning and RAG has never been easier to set up. You can spin up a pipeline in an afternoon. The technique is no longer the bottleneck. Evaluation is. Most teams skip the hard statistical work and celebrate vanity metrics instead. They ship systems that sound smart but fail silently.

Run honest tests before you spend money. Question your metrics. Check for overfitting. Make sure the model is actually better,