Exécuter un agent LLM dans votre navigateur
La plupart des assistants IA résident dans un centre de données. Ils nécessitent une clé API, un serveur et facturent à la requête.
J'ai conçu quelque chose de différent.
J'ai affiné les modèles LiquidAI LFM2.5 (230 M et 350 M) pour qu'ils s'exécutent entièrement dans votre navigateur — sans serveur, sans coûts de cloud.
L'objectif était de créer un modèle suffisamment petit pour être livré avec une page web.
Le modèle ne stocke pas de faits sur des produits spécifiques ; il apprend des schémas. Un seul petit modèle peut gérer un café, une épicerie ou n'importe quel autre commerce sans réentraînement.
Ce que le modèle fait
- Choisit le bon outil pour une tâche
- Relie correctement les arguments et les identifiants d'articles (item IDs)
- Comprend les références telles que « le deuxième » ou « une douzaine »
- Utilise le texte récupéré pour répondre aux questions
- Refuse de répondre lorsque l'information est manquante
- Réoriente la conversation lorsqu'elle s'éloigne du sujet
Comment je l'ai construit
- A figé un ensemble de huit outils (search, add_to_cart, checkout, etc.)
- A traité le RAG comme un outil plutôt que comme un pipeline séparé
- A appliqué un décodage contraint par la grammaire pour plus de précision
- A créé un jeu de données synthétiques à partir de 18 recettes d'interaction
- A effectué le fine-tuning sur 30 M de tokens en utilisant un seul GPU de 16 Go
Focus de l'entraînement J'ai entraîné le modèle sur des comportements, et non sur des listes de blocage. Plutôt que d'interdire des mots, je lui ai appris à réorienter les conversations avec politesse.
Pourquoi c'est important
- Confidentialité : vos données ne quittent jamais votre appareil
- Utilisation hors ligne : il fonctionne sans connexion internet
- Coût : aucune facture d'inférence
- Accessibilité : il rend les interfaces complexes navigables par la voix
Le modèle est petit, mais il est utile. Arrêtez de vous demander si des modèles géants peuvent accomplir des tâches. Demandez-vous plutôt quel est le plus petit modèle possible tout en restant utile sur un appareil.
Démo : https://lajosbencz.github.io/frontend-agent/ Code : https://github.com/lajosbencz/frontend-agent/ Source : https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe
Lajos Bencz a affiné un modèle de langage de 350 millions de paramètres pour qu'il s'exécute entièrement dans un navigateur web, transformant une page statique en un assistant d'achat autonome qui ne nécessite ni clé API, ni serveur, ni coûts d'inférence basés sur le cloud. Le résultat est une IA axée sur la confidentialité et capable de fonctionner hors ligne, capable de gérer un café, une épicerie ou tout catalogue similaire sans être réentraînée pour chaque domaine.
Pourquoi exécuter un LLM dans le navigateur
La plupart des assistants IA résident dans des centres de données. Chaque requête voyage sur Internet, atteint une API et entraîne des frais par requête. Cette configuration fuit les données utilisateur, nécessite un réseau et fait grimper la facture rapidement. Déplacer le modèle côté client élimine ces problèmes. Les données restent sur la machine locale, l'assistant fonctionne même en cas de coupure réseau, et les coûts d'inférence tombent à zéro.
Comment le modèle a été construit
- Choix du modèle – Commencé avec les variantes LiquidAI LFM2.5 de 230 M et 350 M. Leur taille permet à une page web classique de les télécharger.
- Ensemble d'outils – Huit utilitaires (search, add_to_cart, checkout, etc.) ont été codés en dur dans l'agent. Le modèle apprend quel outil invoquer et comment transmettre des arguments tels que les identifiants d'articles (item IDs).
- RAG comme outil – Le RAG (Retrieval-Augmented Generation) a été traité comme un simple outil appelable, simplifiant ainsi l'architecture.
- Décodage contraint par la grammaire – Le décodeur a été restreint à une syntaxe d'appel d'outil valide, réduisant drastiquement les sorties malformées.
- Données synthétiques – Conversion de 18 recettes d'interaction (ex : « ajoute deux douzaines de donuts ») en un jeu de données de 30 M de tokens généré sur un seul GPU de 16 Go.
- Entraînement axé sur le comportement – Au lieu de listes de blocage, le fine-tuning a mis l'accent sur le pilotage de la conversation : rediriger poliment les discussions hors sujet, refuser lorsque l'information est manquante et confirmer les références ambiguës comme « le deuxième ».
Le fine-tuning a été effectué sur un seul GPU de 16 Go.
Ce que l'agent peut faire
- Sélection d'outils – Décide si une requête nécessite une recherche, une mise à jour du panier ou une autre fonction.
- Gestion des arguments – Analyse les identifiants d'articles, les quantités et les qualificatifs (ex : « une douzaine ») et les transmet correctement.
- Résolution de références – Lie des expressions telles que « le deuxième » à l'article approprié dans la liste récupérée.
- Réponses basées sur le RAG – Récupère le texte pertinent et l'intègre dans les réponses.
- Refus gracieux – Décline la requête lorsque l'information requise est absente au lieu d'halluciner.
- Pilotage de la conversation – Réoriente les remarques hors sujet vers la tâche sans briser le flux.
Une démo en direct (https://lajosbencz.github.io/frontend-agent/) montre l'agent gérant un flux e-commerce simple, de la navigation au paiement, via une saisie vocale ou textuelle.
Limites et contre-arguments
(section laissée intentionnellement vide)
À surveiller ensuite
La base de code (https://github.com/lajosbencz/frontend-agent) est ouverte, invitant la communauté à ajouter des outils, à étendre les recettes synthétiques ou à essayer des approches hybrides.
À retenir : Le fine-tuning d'un LLM de taille modeste pour en faire un agent autonome permet d'intégrer une IA fonctionnelle et respectueuse de la vie privée directement dans une page web — sans serveurs, sans frais, et sans que les données ne quittent l'appareil de l'utilisateur.
