O novo Kimi K3 da Moonshot AI superou o GPT-5.6 no benchmark AA-Briefcase, marcando 1.527 contra os 1.495 deste último. A vitória vem acompanhada de um modelo de preços que torna o modelo de pesos abertos de 2,8 trilhões de parâmetros uma opção surpreendentemente barata para tarefas de codificação de longa duração.

Por que o benchmark é importante

O AA-Briefcase mede o desempenho em cargas de trabalho sustentadas e do mundo real, em vez de perguntas de conhecimentos gerais isoladas. Uma pontuação mais alta significa que um modelo consegue manter o contexto, planejar com antecedência e manter o foco ao longo de milhares de tokens – exatamente as condições que os desenvolvedores enfrentam ao construir assistentes, geradores de código ou auxiliares de pesquisa. A vantagem do Kimi K3 sobre o GPT-5.6 mostra que um modelo aberto agora pode competir onde rivais fechados tradicionalmente dominavam.

O panorama técnico

  • Tamanho – 2,8 trilhões de parâmetros, o maior modelo de pesos abertos lançado até hoje.
  • Arquitetura – Stable LatentMoE (Mixture-of-Experts) com 896 especialistas, dos quais 16 estão ativos a qualquer momento.
  • Janela de contexto – Mais de 1 milhão de tokens, o suficiente para conter livros inteiros ou bases de código extensas.
  • Atenção – Kimi Delta Attention, um ajuste personalizado que supostamente melhora a eficiência de escala.

Essas escolhas dão ao modelo a capacidade de lidar com tarefas de "longo horizonte", mas também elevam os requisitos de computação, o que se reflete nos números de velocidade e custo.

Preços que chamam a atenção

A Moonshot divide o preço dos tokens em três categorias:

Tipo de uso Custo por 1 M de tokens
Entrada – cache miss $3,00
Entrada – cache hit $0,30
Saída $15,00

A empresa afirma que as cargas de trabalho de codificação apresentam uma taxa de cache hit de 90%. Se for verdade, é uma opção muito barata para agentes de codificação.

As compensações que você sentirá

  • Velocidade – O modelo processa cerca de 62 tokens por segundo, abaixo da mediana do setor. Um prompt longo pode demorar minutos, o que é relevante para o uso interativo.
  • Custo de raciocínio – O Kimi K3 é executado com "esforço máximo de raciocínio" por padrão e não oferece um ajuste para reduzi-lo. Consultas simples, portanto, consomem o mesmo orçamento de tokens que as complexas, inflando os custos de tarefas rotineiras.
  • Uso oculto de tokens – Alguns usuários relatam um prompt de sistema considerável que o modelo injeta automaticamente, adicionando tokens que são cobrados, mas não são visíveis na solicitação do usuário.

Esses fatores significam que o preço baixo anunciado pode ser compensado por um tempo de resposta mais lento e um maior consumo de tokens na prática.

Disponibilidade e o caminho a seguir

A API já está disponível, permitindo que os desenvolvedores experimentem imediatamente. Os pesos do modelo serão lançados em 27 de julho, após o que a auto-hospedagem se tornará possível. Até lá, os usuários devem depender do serviço hospedado da Moonshot e aceitar a latência e a estrutura de preços associadas.

Contraponto do campo dos modelos fechados

A conclusão principal

A principal conclusão é o estreitamento da lacuna entre modelos fechados e modelos abertos. O Kimi K3 prova que modelos de pesos abertos podem lidar com tarefas complexas e de longo horizonte.