Ejecutar un agente LLM en tu navegador

La mayoría de los asistentes de IA residen en un centro de datos. Necesitan una clave de API, un servidor y cobran por cada solicitud.

He construido algo diferente.

He realizado el fine-tuning de los modelos LiquidAI LFM2.5 (230 M y 350 M) para que se ejecuten completamente en tu navegador: sin servidor y sin costes de nube.

El objetivo era crear un modelo lo suficientemente pequeño como para enviarlo junto con una página web.

El modelo no almacena datos sobre productos específicos; aprende patrones. Un modelo diminuto puede gestionar una cafetería, una tienda de comestibles o cualquier otro establecimiento sin necesidad de reentrenamiento.

Qué hace el modelo

  • Selecciona la herramienta adecuada para una tarea
  • Conecta argumentos e IDs de artículos correctamente
  • Entiende referencias como «el segundo» o «una docena»
  • Utiliza el texto recuperado para responder preguntas
  • Se niega a responder cuando falta información
  • Reencauza la conversación cuando se desvía del tema

Cómo lo construí

  • Congelé un conjunto de ocho herramientas (search, add_to_cart, checkout, etc.)
  • Traté el RAG como una herramienta en lugar de un pipeline separado
  • Apliqué una decodificación con restricciones gramaticales para mayor precisión
  • Creé un conjunto de datos sintéticos a partir de 18 recetas de interacción
  • Realicé el fine-tuning con 30 M de tokens utilizando una única GPU de 16 GB

Enfoque del entrenamiento Entrené al modelo en comportamientos, no en listas de bloqueo. En lugar de prohibir palabras, le enseñé a dirigir las conversaciones con cortesía.

Por qué esto es importante

  • Privacidad: tus datos nunca salen de tu dispositivo
  • Uso sin conexión: funciona sin conexión a internet
  • Coste: facturas de inferencia de cero
  • Accesibilidad: permite navegar por interfaces complejas mediante la voz

El modelo es pequeño, pero es útil. Deja de preguntar si los modelos gigantes pueden realizar tareas. Pregunta qué tan pequeño puede ser un modelo mientras sigue siendo útil en un dispositivo.

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz realizó el fine-tuning de un modelo de lenguaje de 350 millones de parámetros para que se ejecute completamente en un navegador web, convirtiendo una página estática en un asistente de compras autónomo que no requiere clave de API, ni servidor, ni costes de inferencia en la nube. El resultado es una IA centrada en la privacidad y capaz de funcionar sin conexión, que puede gestionar una cafetería, una tienda de comestibles o cualquier catálogo similar sin necesidad de ser reentrenada para cada dominio.

Por qué ejecutar un LLM en el navegador

La mayoría de los asistentes de IA residen en centros de datos. Cada consulta viaja por internet, llega a una API e incurre en una tarifa por solicitud. Esa configuración filtra datos de usuario, requiere una red y aumenta rápidamente la factura. Trasladar el modelo al cliente elimina esos problemas. Los datos permanecen en la máquina local, el asistente funciona cuando se pierde la conexión y los costes de inferencia bajan a cero.

Cómo se construyó el modelo

  • Elección del modelo – Comenzó con las variantes de 230 M y 350 M de LiquidAI LFM2.5. Su tamaño permite que una página web típica los descargue.
  • Conjunto de herramientas – Se integraron ocho utilidades (search, add_to_cart, checkout, etc.) directamente en el agente. El modelo aprende qué herramienta invocar y cómo pasar argumentos como los IDs de los artículos.
  • RAG como herramienta – Se trató la Generación Aumentada por Recuperación (RAG) como una herramienta más que se puede llamar, simplificando la arquitectura.
  • Decodificación con restricciones gramaticales – Se restringió el decodificador a una sintaxis válida de llamada a herramientas, reduciendo drásticamente las salidas malformadas.
  • Datos sintéticos – Se convirtieron 18 recetas de interacción (por ejemplo, «añadir dos docenas de donuts») en un conjunto de datos de 30 M de tokens generado en una única GPU de 16 GB.
  • Entrenamiento centrado en el comportamiento – En lugar de listas de bloqueo, el fine-tuning hizo hincapié en la dirección conversacional: redirigir cortésmente las charlas fuera de tema, negarse cuando falta información y confirmar referencias ambiguas como «el segundo».

El fine-tuning se ejecutó en una única GPU de 16 GB.

Qué puede hacer el agente

  • Selección de herramientas – Decide si una consulta necesita una búsqueda, una actualización del carrito u otra función.
  • Gestión de argumentos – Analiza identificadores de artículos, cantidades y calificadores (por ejemplo, «una docena») y los pasa correctamente.
  • Resolución de referencias – Vincula frases como «el segundo» con el artículo correspondiente en la lista recuperada.
  • Respuestas basadas en RAG – Recupera el texto relevante y lo integra en las respuestas.
  • Rechazo cortés – Declina la solicitud cuando falta la información necesaria en lugar de alucinar.
  • Dirección de la conversación – Reencauza los comentarios fuera de tema hacia la tarea sin romper el flujo.

Una demo en vivo (https://lajosbencz.github.io/frontend-agent/) muestra al agente gestionando un flujo sencillo de comercio electrónico, desde la navegación hasta el pago, mediante entrada de voz o texto.

Limitaciones y contraargumentos

(sección dejada intencionadamente en blanco)

Qué esperar a continuación

La base de código (https://github.com/lajosbencz/frontend-agent) es abierta, lo que invita a la comunidad a añadir herramientas, expandir las recetas sintéticas o probar enfoques híbridos.

Idea clave: El ajuste fino de un LLM de tamaño moderado para convertirlo en un agente independiente permite integrar IA funcional que preserva la privacidad directamente en una página web: sin servidores, sin costes y sin que los datos salgan del dispositivo del usuario.