Tutti hanno un'opinione sul fine-tuning rispetto al RAG. Sfoglia qualsiasi forum di IA e troverai discussioni accese piene di diagrammi di architettura e affermazioni basate su benchmark. La maggior parte delle persone che scrivono quei commenti non ha mai addestrato un modello sui propri dati né ha mai visto una pipeline RAG fallire silenziosamente in produzione.
Ho trascorso mesi a condurre esperimenti. Dodici, per l'esattezza. Ho effettuato il fine-tuning di LLM. Ho effettuato il fine-tuning di embedder. Ho costruito sei diverse configurazioni RAG. Il dominio era la previsione finanziaria, nello specifico cercavo di prevedere esiti di mercato rumorosi partendo da dati storici disordinati. Mi sono imposto standard statistici rigorosi perché volevo risposte reali, non le solite affermazioni da blog post.
La maggior parte degli esperimenti è fallita. Quei fallimenti si sono rivelati molto più utili di qualsiasi successo fortuito.
La dura verità sul segnale
Prima di entrare nel vivo, ecco la lezione che lega tutto insieme. Il fine-tuning e il RAG sono strumenti per cambiare ciò che un modello sa o ciò che vede. Non sono bacchette magiche che fabbricano segnali dal nulla. Se i tuoi dati sottostanti non contengono un pattern reale e sfruttabile, queste tecniche non ne creeranno uno. Ti aiuteranno solo a costruire una storia più convincente attorno al rumore casuale.
Nella previsione finanziaria, questa trappola è particolarmente pericolosa. I mercati sono rumorosi per natura. Quando colleghi un potente LLM ai dati storici dei prezzi e aggiungi retrieval o fine-tuning, non ottieni automaticamente un vantaggio competitivo. Ottieni solo un modo più articolato per razionalizzare dei lanci di moneta. Se il segnale non c'è, il modello diventerà bravissimo a mentirti. Devi verificare questo aspetto per primo.
Quando la dimensione porta a memorizzare invece di imparare
Il mio primo grande errore è stato presumere che la scala avrebbe risolto tutto. Ho testato un modello da 14 miliardi di parametri contro uno da 7 miliardi su esattamente 777 esempi di addestramento. Il modello più grande ha ottenuto un eval_loss sensibilmente migliore. La sua perplessità è diminuita. Sulla carta, stava imparando.
Poi ho guardato il win rate, ovvero il tasso effettivo con cui il modello effettuava previsioni corrette. Il modello da 14B ha performato significativamente peggio di quello da 7B. Aveva memorizzato il rumore di addestramento. Con meno di 3.000 esempi, il modello più grande aveva una capacità sufficiente per fare overfitting su correlazioni spurie e fluttuazioni casuali nei dati. In sostanza, ha costruito una tabella di consultazione del rumore.
Il modello da 7B, limitato dalla sua capacità ridotta, è stato costretto a imparare pattern più ampi. Non poteva permettersi di memorizzare ogni singola idiosincrasia. Se lavori con dataset piccoli, parti con modelli più piccoli. La scala non è gratuita. Può danneggiarti attivamente quando i dati sono scarsi.
Non fidarti della curva di perdita
Ho imparato a smettere di fissare le curve di perdita. Un modello può migliorare la sua cross-entropy a livello di token pur diventando peggiore nella decisione di business reale che ti interessa. Questo accade perché la loss del language modeling premia la previsione accurata del token successivo. In molti domini, specialmente nella finanza, la decisione corretta e il token successivo più probabile non sono la stessa cosa.
Ho visto modelli che riproducevano splendidamente la prosa di addestramento, ma sceglievano la direzione sbagliata in ogni scommessa. La loss scendeva. Il capitale scendeva insieme ad essa. Scegli la tua metrica di valutazione in base al compito del mondo reale. Se stai classificando documenti, misura la qualità del ranking. Se stai prevedendo esiti, misura l'accuratezza decisionale. Non lasciare mai che sia l'eval_loss a scegliere il modello per te.
Il fine-tuning brilla solo con un vocabolario estraneo
Ho condotto prove di fine-tuning degli embedder su due diversi tipi di testo. Il primo utilizzava notizie finanziarie standard e documenti pubblici. L'embedder sottoposto a fine-tuning e la versione standard hanno performato in modo identico. Il modello base conosceva già questo linguaggio. Stavo effettuando il tuning su un terreno familiare.
Il secondo dataset era pieno di gergo privato, codenam interni e abbreviazioni specifiche del settore che non apparivano mai sul web aperto. In questo caso, il fine-tuning ha migliorato l'accuratezza del retrieval del 79 percento. Il modello base semplicemente non sapeva cosa significassero quei termini. Il fine-tuning gli ha insegnato il vocabolario locale.
Questo ha cambiato completamente la mia prospettiva sull'intero esercizio. Il fine-tuning non serve a rendere un modello più intelligente in senso generale. Serve a insegnargli un nuovo vocabolario, un nuovo formato o uno stile editoriale specifico. Se i tuoi dati somigliano a quelli di internet, salta il fine-tuning. Se i tuoi dati parlano una lingua che il modello base non ha mai visto, il fine-tuning diventa essenziale.
Il RAG ti dà certezza, non verità
Ho testato otto diverse configurazioni RAG per compiti di previsione. In generale, l'aggiunta del retrieval ha modificato circa il 30 percento delle decisioni del modello. Sembra un impatto significativo. Non lo era. Quei cambiamenti erano puro rumore. L'accuratezza complessiva non è migliorata. Ciò che è cambiato è stata la fiducia del modello. Il RAG ha reso il sistema più sicuro di sé, ha citato più fonti e ha prodotto giustificazioni più lunghe. Il tutto rimanendo altrettanto errato.
Questa eccessiva sicurezza è un rischio per il prodotto. Un utente vede le citazioni e presuppone che il modello abbia fatto i compiti. In realtà, stava facendo delle congetture dall'aspetto sofisticato.
La lezione più dolorosa è arrivata dal backtesting di una variante RAG. Ha mostrato un profitto annuale dell'11 percento. In superficie, sembra una strategia vincente. Ma la sua AUC, l'area sotto la curva ROC e misura della capacità di classificazione, era 0,486. È peggio di un lancio di moneta, che si attesta a 0,500. Il profitto è stato un colpo di fortuna dovuto al periodo specifico di mercato, non un vantaggio ripetibile. Usare solo il P&L come metrica è pericoloso. I mercati regalano serie fortunate continuamente. Hai bisogno di metriche di abilità statistica per separare i colpi di fortuna dalla competenza.
Sapere cosa fa realmente ogni strumento
Quindi, a che punto siamo? Usa il fine-tuning quando il modello deve imparare nuove parole, formati specifici o uno stile distintivo. Usa il RAG quando il modello ha bisogno di accedere a fatti, repository di codice o memoria istituzionale che risiede al di fuori dei suoi pesi. Non usare nessuno dei due strumenti per cercare un segnale in dati che non ne hanno. Se il pattern sottostante non c'è, il retrieval e il fine-tuning ti aiuteranno solo a vestire il rumore con un abito più elegante.
Il vero collo di bottiglia
L'infrastruttura per il fine-tuning e il RAG non è mai stata così facile da configurare. Puoi avviare una pipeline in un pomeriggio. La tecnica non è più il collo di bottiglia. Lo è la valutazione. La maggior parte dei team salta il difficile lavoro statistico e celebra invece metriche di vanità. Rilasciano sistemi che sembrano intelligenti ma falliscono silenziosamente.
Esegui test onesti prima di spendere soldi. Metti in discussione le tue metriche. Controlla l'overfitting. Assicurati che il modello sia effettivamente migliore,
