Alibaba revela o Qwen3.8-Max: um gigante de 2,4 trilhões de parâmetros para agentes de IA
A equipe Qwen da Alibaba anunciou o Qwen3.8-Max, um modelo flagship massivo de 2,4 trilhões de parâmetros, projetado para ir além de simples comandos de chat em direção ao raciocínio autônomo de longo horizonte. Ao focar em fluxos de trabalho de vários dias e na execução de tarefas complexas, este modelo marca uma mudança significativa de LLMs reativos para agentes de IA proativos.
Escalando Parâmetros para Inteligência Autônoma
O Qwen3.8-Max é uma potência técnica, utilizando um total de 2,4 trilhões de parâmetros, com 95 bilhões de parâmetros ativos por consulta. Baseado na arquitetura Qwen3.5, o modelo é especificamente otimizado para tarefas de "longo horizonte" — objetivos complexos que exigem que a IA opere de forma independente por dias ou até semanas.
Em um movimento significativo para a comunidade de código aberto, a Alibaba confirmou que os pesos para a classe Qwen-Max serão disponibilizados publicamente na próxima semana, desafiando o domínio de modelos de fronteira de portas fechadas como GPT e Claude.
Provando a Autonomia por meio de Programação e Pesquisa
Para demonstrar suas capacidades de agente, a Alibaba apresentou vários estudos de caso de alto risco nos quais o modelo operou sem intervenção humana:
- Engenharia de Software: Durante um período de 16 dias, o Qwen3.8-Max desenvolveu autonomamente a ferramenta de linha de comando
oh-my-cli. Ele gerenciou seus próprios issues no GitHub, escreveu código, executou testes e realizou 265 commits e 127 pull requests. - Reprodução Científica: Com a tarefa de reproduzir os resultados do artigo "Unified Data Selection for LLM Reasoning", o modelo dedicou 125 horas de tempo de computação escrevendo 7.600 linhas de código. Ele não apenas replicou a pesquisa original, mas melhorou a pontuação no benchmark de matemática AIME24 em 2,7 pontos.
- Ciência de Dados Competitiva: No desafio WWW2025 Multimodal Dialogue Intent Recognition Challenge, o modelo superou 458 de 526 equipes humanas, aumentando sua precisão de 0,60 para 0,853 em 24 horas.
Além do Software: Design de Chips e Simulação Fiscal
O raciocínio do Qwen3.8-Max estende-se ao hardware e à economia. Em uma tarefa de design de circuito criptográfico, o modelo reduziu iterativamente um design "inchado" de 8.298 portas lógicas para apenas 678 portas. Usando a ferramenta OpenROAD, isso resultou em uma redução de 81% na área física do chip.
Em uma simulação de varejo complexa chamada E-Commerce-Bench, o modelo gerenciou várias lojas online durante um ano fiscal simulado. Começando com 100.000 yuans, ele navegou por negociações com fornecedores, identificou 152 golpistas e gerenciou interrupções na cadeia de suprimentos para terminar com 416.252 yuans — quadruplicando seu capital inicial e superando significativamente o segundo colocado, GLM 5.2.
Fronteiras Multimodais e Dominância em Benchmarks
O modelo também expande os limites do processamento multimodal, sendo capaz de lidar com documentos de 200 páginas e vídeos que excedem 100 horas. A Alibaba também está introduzindo o RecreationBench, um benchmark que testa a capacidade de um agente de reconstruir aplicativos em execução (no Windows, macOS, Android, etc.) apenas por meio de interação visual e de teclado, sem acesso ao código-fonte.
De acordo com benchmarks internos, o Qwen3.8-Max compete diretamente com modelos de alto nível, situando-se próximo ou acima do Claude Opus 4.8 e do GPT-5.6 Sol em várias categorias, incluindo uma pontuação líder de 93 no PaperBench.
Principais Conclusões
- Escala Massiva: O Qwen3.8-Max apresenta 2,4 trilhões de parâmetros totais e 95 bilhões de parâmetros ativos, otimizados para fluxos de trabalho autônomos de vários dias.
- Maestria de Agente: O modelo demonstrou a capacidade de lidar autonomamente com engenharia de software complexa, otimização de design de chips e gestão fiscal em escala total.
- Impacto de Pesos Abertos: Ao contrário de muitos modelos de fronteira, a Alibaba planeja lançar os pesos para a classe Qwen-Max, proporcionando aos desenvolvedores um acesso sem precedentes à inteligência de agente de alto nível.
