Le GraphRAG et la mémoire contextuelle persistante sont désormais intégrés aux chatbots d'IA afin que la conversation survive à l'actualisation d'une page ou à l'ouverture d'un nouvel onglet de navigateur. Les développeurs affirment que cette combinaison élimine l'oubli provoqué par la fermeture de l'onglet (« tab-kill ») qui frustrait les utilisateurs de la plupart des assistants conversationnels.

Pourquoi l'ancienne approche est insuffisante

La plupart des systèmes d'IA basés sur le chat s'appuient sur la génération augmentée par récupération (RAG) standard. Le pipeline extrait des fragments de texte qui ressemblent à la question actuelle, les transmet à un modèle de langage et renvoie une réponse. Pour une recherche d'un fait unique — « Quelle est la capitale de la France ? » — la méthode fonctionne bien.

Mais le RAG traite chaque entrée utilisateur comme une requête isolée. Lorsqu'un suivi dépend de quelque chose dit quelques minutes plus tôt, le modèle n'a aucun souvenir de ce contexte. Le résultat est un chatbot qui vous demande de vous répéter ou qui donne une réponse ignorant les détails précédents. Le problème n'est pas un manque d'intelligence, mais un manque d'état (state).

GraphRAG : transformer le texte plat en réseau

Le GraphRAG remodèle l'étape de récupération. Au lieu d'une liste de fragments de texte sans lien, il construit un graphe :

  • Les nœuds représentent des entités telles que des personnes, des produits ou des événements.
  • Les arêtes capturent les relations entre eux — qui fournit quoi, quel projet dépend de quel composant, etc.

Parce que le graphe encode les connexions, le système peut effectuer un raisonnement multi-sauts : il peut suivre une chaîne de faits à travers plusieurs documents pour répondre à une requête qui dérouterait une recherche textuelle classique. Il peut également générer des résumés de sous-graphes entiers, offrant aux utilisateurs un aperçu concis d'un sujet plutôt qu'une collection d'extraits disparates.

Mémoire contextuelle : se souvenir de la conversation

La mémoire contextuelle persistante ajoute une couche temporelle au-dessus du graphe. Elle se divise en trois parties :

  • La mémoire à court terme conserve le dialogue actuel tour par tour, afin que l'utilisateur n'ait pas à reformuler un point mentionné quelques phrases plus tôt.
  • La mémoire à long terme enregistre des faits sélectifs sur l'utilisateur à travers les sessions — langue préférée, problèmes récurrents ou achats antérieurs.
  • La mémoire sélective décide de ce qu'il faut conserver, écartant les mots de remplissage et les bavardages non pertinents pour éviter de saturer le stockage.

Lorsqu'un utilisateur revient après avoir fermé l'onglet, le stockage à long terme peut faire remonter le contexte pertinent, permettant au chatbot de reprendre là où la dernière session s'était arrêtée.

Quand utiliser chaque outil

  • Utilisez le RAG standard pour des vérifications de faits simples où le coût d'une connexion manquée est faible.
  • Déployez GraphRAG lorsque le coût d'une mauvaise réponse est élevé, ou lorsque la réponse nécessite de lier des informations réparties sur plusieurs documents.
  • Ajoutez une mémoire contextuelle si l'application doit reconnaître les utilisateurs récurrents ou maintenir un fil conducteur personnel sur plusieurs jours ou semaines.

La construction de ces couches n'est pas un exercice « plug-and-play ». Un index GraphRAG doit être actualisé à mesure que les données sources changent, et le stockage de la mémoire nécessite des politiques qui équilibrent la pertinence et le coût de stockage. Une rétention trop zélée — stocker chaque mot prononcé — ralentit rapidement la récupération et noie le modèle sous un bruit inutile.

Le compromis

La mémoire contextuelle résout le problème de l'oubli. L'inconvénient est opérationnel : maintenir un graphe actif et un cache de mémoire sélectif exige un effort d'ingénierie continu.

À surveiller ensuite

À retenir : Le GraphRAG fournit la colonne vertébrale relationnelle, tandis que la mémoire contextuelle persistante fournit le lien temporel. Ensemble, ils permettent aux chatbots de maintenir le fil conducteur à travers les onglets et les sessions, transformant une réinitialisation frustrante en une conversation fluide.