I progetti di AI aziendale seguono uno schema ricorrente. Un team costruisce un prototipo. La demo sembra impressionante. Poi, tre mesi dopo, il sistema inizia a crollare. Le risposte divergono. I costi aumentano. Un responsabile della conformità chiede da dove provenga una specifica risposta, e nessuno nella stanza sa rispondere.

Questo collasso raramente inizia con un codice scritto male. Inizia con una singola scelta architettonica che viene trattata come un concorso di popolarità: Retrieval-Augmented Generation contro fine-tuning.

RAG e fine-tuning non sono due versioni dello stesso prodotto. Sono strumenti fondamentalmente diversi. Uno controlla ciò che un modello può vedere. L'altro controlla come un modello si comporta. Scegliere quello sbagliato per il compito assegnato non emergerà in un prototipo. Emergerà più tardi, quando l'azienda lavorerà su quella base.

La trappola della demo

La pressione per rilasciare una funzionalità di AI generativa è intensa. I team spesso scelgono un metodo perché l'hanno visto in un tutorial ben scritto o perché una presentazione di un fornitore lo faceva sembrare facile. Questo è un modo terribile per prendere decisioni sull'infrastruttura.

Un modello sottoposto a fine-tuning può sembrare magico in una demo controllata. Parla con la voce della tua azienda e riconosce i nomi dei tuoi prodotti. Anche una pipeline RAG può sembrare magica. Risponde a domande su un documento su cui non è mai stata addestrata. Ma la demo nasconde la realtà operativa. Se i tuoi dati sui prezzi cambiano settimanalmente e hai effettuato il fine-tuning sui numeri dell'ultimo trimestre, il modello citerà con sicurezza cifre obsolete. Se il tuo team di supporto ha bisogno che ogni risposta sia riconducibile a un PDF di policy specifico, un modello fine-tuned non ti fornisce note a piè di pagina. Ti fornisce solo testo.

Cosa significa realmente RAG

RAG sta per Retrieval-Augmented Generation, ma il nome lo fa sembrare più complesso di quanto non sia. In sostanza, RAG risponde a una domanda: di cosa ha bisogno il modello per effettuare una ricerca proprio ora?

Immagina un operatore del servizio clienti a cui è permesso consultare la wiki aziendale prima di rispondere a un ticket. RAG fa esattamente questo, ma in modo automatico. Quando un utente pone una domanda, il sistema cerca in un database vettoriale o in un archivio di documenti frammenti di testo rilevanti. Successivamente, passa questi frammenti al modello linguistico come contesto, insieme alla domanda originale. Il modello genera una risposta basata sulle prove recuperate.

Questo approccio brilla quando la tua base di conoscenza risiede al di fuori del modello. La documentazione del prodotto, i documenti legali, la ricerca medica e i fogli di calcolo dell'inventario cambiano continuamente. RAG mantiene il modello aggiornato senza dover riaddestrare un singolo peso. Crea inoltre una naturale traccia di audit. Poiché sai quali documenti sono stati recuperati, puoi mostrare a un auditor o a un ente regolatore esattamente da dove provenga una risposta.

Cosa significa realmente il fine-tuning

Il fine-tuning risponde a una domanda diversa: come dovrebbe comportarsi il modello?

Invece di fornire al modello del materiale di lettura esterno, lo istruisci tramite esempi. Raccogli centinaia o migliaia di esempi degli output che desideri e continui l'addestramento del modello base su quei dati. Questo processo modifica effettivamente i parametri interni del modello. Cambia i pesi.

Il risultato è un modello che ha interiorizzato degli schemi.