Um benchmark de cinco agentes LLM executados localmente em uma única RTX 5090 mostra que um modelo mixture-of-experts (MoE) de 35 bilhões de parâmetros superou seus pares em uma tarefa de codificação do mundo real. O teste, que adicionou um Tag Manager a um painel administrativo existente sem o uso de APIs de nuvem, coroou o Qwen 3.6 35B-A3B como o vencedor indiscutível.
Por que o teste é importante
Executar grandes modelos de linguagem em hardware pessoal permite que os desenvolvedores evitem taxas de API e preocupações com a privacidade de dados. No entanto, "agentes locais" continuam sendo um termo da moda: eles conseguem realmente editar arquivos, chamar ferramentas de linha de comando e entregar código pronto para produção sem a supervisão de um humano? Esta comparação prática, livre de serviços de nuvem, oferece aos desenvolvedores uma noção concreta de onde a tecnologia se encontra.
O hardware e a tarefa
Todos os cinco modelos foram executados na mesma estação de trabalho: uma GPU RTX 5090, uma placa de consumo topo de linha típica, e sem serviços externos. A tarefa foi deliberadamente simples, mas representativa – adicionar um componente de Tag Manager a uma seção administrativa já construída. O sucesso exigia que o modelo localizasse os arquivos de origem corretos, os editasse e verificasse se o novo recurso se integrava sem quebrar as funcionalidades existentes.
Desempenho dos modelos
- Qwen 3.6 35B-A3B (MoE) – Concluiu o trabalho de forma autônoma, adicionou melhorias sensatas que não foram solicitadas e não precisou de correções pós-execução.
- Qwen 3.6 27B (dense) – Completou a tarefa, mas levou aproximadamente o dobro de etapas de interação e, ocasionalmente, interpretou incorretamente as instruções.
- GLM-4.7-Flash (dense) – Produziu uma implementação funcional, mas utilizou padrões de correspondência de arquivos incorretos e omitiu verificações de segurança, deixando o código vulnerável.
- Qwythos-9B – Não executou nenhuma ferramenta real; a falha pode ter origem no próprio modelo ou na configuração local, mas o teste não conseguiu isolar a causa.
- Nemotron-3-Nano (hybrid) – Ficou preso em um loop, gastando 40 turnos procurando por uma pasta que já havia localizado, e nunca progrediu além desse ponto.
O que os resultados revelam
A arquitetura não é um preditor confiável
O modelo MoE, que divide seus parâmetros entre várias sub-redes de especialistas, venceu de forma absoluta, enquanto as variantes densas e híbridas se dividiram entre o sucesso e a falha total. Isso sugere que escolhas arquiteturais puras não garantem competência no uso de ferramentas.
O uso de ferramentas continua sendo um grande obstáculo
Nenhum dos cinco agentes utilizou a ferramenta de captura de tela dedicada fornecida para o teste. Todos tentaram improvisar, seja adivinhando nomes de arquivos ou tentando contornos indiretos. A lacuna entre "conseguir gerar código" e "conseguir orquestrar utilitários externos" ainda é ampla.
Executar localmente significa depurar a stack, não apenas o modelo
Dois modelos exigiram correções imediatas em seus templates de prompt antes mesmo que o teste pudesse começar. O esforço gasto corrigindo bugs específicos do modelo eclipsou o tempo gasto escrevendo o código real do Tag Manager, destacando o quão frágeis são as implantações locais atuais.
Uma nota de cautela
O benchmark reflete uma única configuração de hardware, um único cenário de codificação e um pequeno conjunto de modelos. O Qwen 3.6 35B-A3B havia falhado anteriormente em uma rodada anterior; seu fracasso anterior foi um acaso. Os resultados são, portanto, indicativos, não definitivos.
O que observar a seguir
Rodadas futuras precisarão expandir o conjunto de tarefas, incluir toolchains mais diversas e testar em uma gama mais ampla de hardware. Observadores devem acompanhar se os modelos MoE superam consistentemente os designs densos e híbridos, e se os desenvolvedores conseguem construir wrappers confiáveis que eliminem a necessidade de correções manuais de bugs.
Conclusão: Um modelo MoE de 35B já pode atuar como um assistente de codificação local competente, mas o ecossistema mais amplo — integração de ferramentas, engenharia de prompt e runtimes estáveis — ainda está atrasado. Até que essas peças se encaixem, os desenvolvedores devem moderar as expectativas sobre agentes locais "plug-and-play".
