O novo Kimi K3 da Moonshot AI superou o GPT-5.6 no benchmark AA-Briefcase, marcando 1.527 contra os 1.495 deste último. A vitória vem acompanhada de um modelo de preços que torna o modelo de pesos abertos de 2,8 trilhões de parâmetros uma opção surpreendentemente barata para tarefas de codificação de longa duração.
Por que o benchmark é importante
O AA-Briefcase mede o desempenho em cargas de trabalho sustentadas e do mundo real, em vez de perguntas de conhecimentos gerais isoladas. Uma pontuação mais alta significa que um modelo consegue manter o contexto, planejar com antecedência e manter o foco ao longo de milhares de tokens – exatamente as condições que os desenvolvedores enfrentam ao construir assistentes, geradores de código ou auxiliares de pesquisa. A vantagem do Kimi K3 sobre o GPT-5.6 mostra que um modelo aberto agora pode competir onde rivais fechados tradicionalmente dominavam.
O panorama técnico
- Tamanho – 2,8 trilhões de parâmetros, o maior modelo de pesos abertos lançado até hoje.
- Arquitetura – Stable LatentMoE (Mixture-of-Experts) com 896 especialistas, dos quais 16 estão ativos a qualquer momento.
- Janela de contexto – Mais de 1 milhão de tokens, o suficiente para conter livros inteiros ou bases de código extensas.
- Atenção – Kimi Delta Attention, um ajuste personalizado que supostamente melhora a eficiência de escala.
Essas escolhas dão ao modelo a capacidade de lidar com tarefas de "longo horizonte", mas também elevam os requisitos de computação, o que se reflete nos números de velocidade e custo.
Preços que chamam a atenção
A Moonshot divide o preço dos tokens em três categorias:
| Tipo de uso | Custo por 1 M de tokens |
|---|---|
| Entrada – cache miss | $3,00 |
| Entrada – cache hit | $0,30 |
| Saída | $15,00 |
A empresa afirma que as cargas de trabalho de codificação apresentam uma taxa de cache hit de 90%. Se for verdade, é uma opção muito barata para agentes de codificação.
As compensações que você sentirá
- Velocidade – O modelo processa cerca de 62 tokens por segundo, abaixo da mediana do setor. Um prompt longo pode demorar minutos, o que é relevante para o uso interativo.
- Custo de raciocínio – O Kimi K3 é executado com "esforço máximo de raciocínio" por padrão e não oferece um ajuste para reduzi-lo. Consultas simples, portanto, consomem o mesmo orçamento de tokens que as complexas, inflando os custos de tarefas rotineiras.
- Uso oculto de tokens – Alguns usuários relatam um prompt de sistema considerável que o modelo injeta automaticamente, adicionando tokens que são cobrados, mas não são visíveis na solicitação do usuário.
Esses fatores significam que o preço baixo anunciado pode ser compensado por um tempo de resposta mais lento e um maior consumo de tokens na prática.
Disponibilidade e o caminho a seguir
A API já está disponível, permitindo que os desenvolvedores experimentem imediatamente. Os pesos do modelo serão lançados em 27 de julho, após o que a auto-hospedagem se tornará possível. Até lá, os usuários devem depender do serviço hospedado da Moonshot e aceitar a latência e a estrutura de preços associadas.
Contraponto do campo dos modelos fechados
A conclusão principal
A principal conclusão é o estreitamento da lacuna entre modelos fechados e modelos abertos. O Kimi K3 prova que modelos de pesos abertos podem lidar com tarefas complexas e de longo horizonte.
