Les projets d'IA en entreprise suivent un schéma récurrent. Une équipe construit un prototype. La démo est impressionnante. Puis, trois mois plus tard, le système commence à s'effondrer. Les réponses dérivent. Les coûts grimpent. Un responsable de la conformité demande d'où provient une réponse spécifique, et personne dans la pièce ne peut répondre.

Cet effondrement commence rarement par un mauvais code. Il commence par un choix architectural unique qui est traité comme un concours de popularité : la génération augmentée par récupération (RAG) contre le fine-tuning.

Le RAG et le fine-tuning ne sont pas deux versions d'un même produit. Ce sont des outils fondamentalement différents. L'un contrôle ce qu'un modèle peut voir. L'autre contrôle la manière dont un modèle se comporte. Choisir la mauvaise méthode pour une tâche donnée ne se verra pas dans un prototype. Cela se verra plus tard, lorsque l'entreprise fonctionnera sur cette base.

Le piège de la démo

La pression pour déployer une fonctionnalité d'IA générative est intense. Les équipes choisissent souvent une méthode parce qu'elles l'ont vue dans un tutoriel bien écrit ou parce qu'une présentation de fournisseur la faisait paraître facile. C'est une très mauvaise façon de prendre des décisions d'infrastructure.

Un modèle ayant subi un fine-tuning peut sembler magique lors d'une démo contrôlée. Il s'exprime avec la voix de votre entreprise et reconnaît les noms de vos produits. Un pipeline RAG peut également sembler magique. Il répond à des questions sur un document sur lequel il n'a jamais été entraîné. Mais la démo cache la réalité opérationnelle. Si vos données de tarification changent chaque semaine et que vous avez effectué un fine-tuning sur les chiffres du dernier trimestre, le modèle citera avec assurance des chiffres obsolètes. Si votre équipe d'assistance a besoin que chaque réponse puisse être tracée jusqu'à un PDF de politique spécifique, un modèle fine-tuné ne vous donnera aucune note de bas de page. Il vous donnera simplement du texte.

Ce que signifie réellement le RAG

RAG signifie Retrieval-Augmented Generation, mais le nom le fait paraître plus complexe qu'il ne l'est en réalité. Fondamentalement, le RAG répond à une seule question : de quoi le modèle a-t-il besoin de consulter dès maintenant ?

Imaginez un agent de service client qui est autorisé à consulter le wiki de l'entreprise avant de répondre à un ticket. Le RAG fait exactement cela, mais de manière automatique. Lorsqu'un utilisateur pose une question, le système recherche des fragments de texte pertinents dans une base de données vectorielle ou un magasin de documents. Il transmet ensuite ces fragments au modèle de langage comme contexte, en plus de la question d'origine. Le modèle génère une réponse basée sur les éléments récupérés.

Cette approche est particulièrement efficace lorsque votre base de connaissances se trouve en dehors du modèle. La documentation produit, les documents juridiques, la recherche médicale et les feuilles de calcul d'inventaire changent constamment. Le RAG permet de maintenir le modèle à jour sans réentraîner un seul paramètre. Il crée également une piste d'audit naturelle. Puisque vous savez quels documents ont été récupérés, vous pouvez montrer à un auditeur ou à un régulateur exactement d'où provient une réponse.

Ce que signifie réellement le fine-tuning

Le fine-tuning répond à une question différente : comment le modèle doit-il se comporter ?

Au lieu de donner au modèle du matériel de lecture externe, vous lui apprenez par l'exemple. Vous collectez des centaines ou des milliers d'exemples des résultats que vous souhaitez obtenir, et vous continuez l'entraînement du modèle de base sur ces données. Ce processus ajuste réellement les paramètres internes du modèle. Il modifie les poids.

Le résultat est un modèle qui a internalisé des schémas.