Executando um Agente LLM no Seu Navegador

A maioria dos assistentes de IA reside em um data center. Eles precisam de uma chave de API, um servidor e cobram por requisição.

Eu construí algo diferente.

Eu fiz o fine-tuning dos modelos LiquidAI LFM2.5 (230M e 350M) para rodar inteiramente no seu navegador — sem servidor, sem custos de nuvem.

O objetivo era tornar o modelo pequeno o suficiente para ser enviado junto com uma página web.

O modelo não armazena fatos sobre produtos específicos; ele aprende padrões. Um único modelo minúsculo pode gerenciar uma cafeteria, um supermercado ou qualquer outra loja sem necessidade de retreinamento.

O que o modelo faz

  • Escolhe a ferramenta certa para uma tarefa
  • Conecta argumentos e IDs de itens corretamente
  • Compreende referências como “o segundo” ou “uma dúzia”
  • Usa o texto recuperado para responder perguntas
  • Recusa-se a responder quando informações estão faltando
  • Redireciona a conversa quando ela sai do tópico

Como eu o construí

  • Congelou um conjunto de oito ferramentas (search, add_to_cart, checkout, etc.)
  • Tratou o RAG como uma ferramenta em vez de um pipeline separado
  • Aplicou decodificação com restrição gramatical (grammar-constrained decoding) para maior precisão
  • Criou um dataset sintético a partir de 18 receitas de interação
  • Fez o fine-tuning com 30M de tokens usando uma única GPU de 16 GB

Foco do treinamento Treinei o modelo com base em comportamentos, não em listas de bloqueio. Em vez de banir palavras, ensinei-o a conduzir as conversas de forma educada.

Por que isso é importante

  • Privacidade: seus dados nunca saem do seu dispositivo
  • Uso offline: funciona sem conexão com a internet
  • Custo: zero de faturas de inferência
  • Acessibilidade: torna interfaces complexas navegáveis por voz

O modelo é pequeno, mas é útil. Pare de perguntar se modelos gigantes podem realizar tarefas. Pergunte o quão pequeno um modelo pode ser e ainda assim ser útil em um dispositivo.

Demo: https://lajosbencz.github.io/frontend-agent/ Code: https://github.com/lajosbencz/frontend-agent/ Source: https://dev.to/lajosbencz/running-an-llm-agent-entirely-in-your-browser-5foe


Lajos Bencz fez o fine-tuning de um modelo de linguagem de 350 milhões de parâmetros para rodar inteiramente em um navegador web, transformando uma página estática em um assistente de compras autônomo que não precisa de chave de API, servidor ou custos de inferência baseados em nuvem. O resultado é uma IA focada em privacidade e capaz de operar offline, que pode gerenciar uma cafeteria, um supermercado ou qualquer catálogo semelhante sem ser retreinada para cada domínio.

Por que rodar um LLM no navegador

A maioria dos assistentes de IA vive em data centers. Cada consulta viaja pela internet, atinge uma API e gera uma taxa por requisição. Essa configuração vaza dados do usuário, exige uma rede e aumenta rapidamente o valor da conta. Mover o modelo para o cliente elimina esses problemas. Os dados permanecem na máquina local, o assistente funciona quando a rede cai e os custos de inferência caem para zero.

Como o modelo foi construído

  • Escolha do modelo – Começou com o LiquidAI LFM2.5, variantes de 230M e 350M. O tamanho delas permite que uma página web típica as baixe.
  • Conjunto de ferramentas – Implementou oito utilitários (search, add_to_cart, checkout, etc.) diretamente no agente. O modelo aprende qual ferramenta invocar e como passar argumentos como IDs de itens.
  • RAG como uma ferramenta – Tratou o Retrieval-Augmented Generation apenas como mais uma ferramenta chamável, simplificando a arquitetura.
  • Decodificação com restrição gramatical – Restringiu o decodificador à sintaxe válida de chamada de ferramenta, reduzindo drasticamente saídas malformadas.
  • Dados sintéticos – Converteu 18 receitas de interação (ex: “adicione duas dúzias de donuts”) em um dataset de 30M de tokens gerado em uma única GPU de 16 GB.
  • Treinamento focado em comportamento – Em vez de listas de bloqueio, o fine-tuning enfatizou o direcionamento conversacional: redirecionar educadamente conversas fora do tópico, recusar quando informações estão faltando e confirmar referências ambíguas como “o segundo”.

O fine-tuning foi executado em uma única GPU de 16 GB.

O que o agente pode fazer

  • Seleção de ferramentas – Decide se uma consulta precisa de busca, atualização de carrinho ou outra função.
  • Manipulação de argumentos – Analisa identificadores de itens, quantidades e qualificadores (ex: “uma dúzia”) e os passa corretamente.
  • Resolução de referências – Vincula frases como “o segundo” ao item apropriado na lista recuperada.
  • Respostas baseadas em RAG – Busca o texto relevante e o integra às respostas.
  • Recusa elegante – Recusa-se a responder quando a informação necessária está ausente, em vez de alucinar.
  • Direcionamento de conversa – Conduz comentários fora do tópico de volta à tarefa sem quebrar o fluxo.

Uma demonstração ao vivo (https://lajosbencz.github.io/frontend-agent/) mostra o agente lidando com um fluxo simples de e-commerce, da navegação ao checkout, com entrada de voz ou texto.

Limitações e contrapontos

(seção deixada propositalmente em branco)

O que observar a seguir

A base de código (https://github.com/lajosbencz/frontend-agent) é aberta, convidando a comunidade a adicionar ferramentas, expandir receitas sintéticas ou experimentar abordagens híbridas.

Conclusão: O fine-tuning de um LLM de tamanho modesto para transformá-lo em um agente autônomo torna possível incorporar uma IA funcional e que preserva a privacidade diretamente em uma página web — sem servidores, sem taxas e sem que os dados saiam do dispositivo do usuário.