Le nouveau Kimi K3 de Moonshot AI a surpassé GPT-5.6 sur le benchmark AA-Briefcase, obtenant un score de 1 527 contre 1 495 pour ce dernier. Cette victoire s'accompagne d'un modèle de tarification qui fait de ce modèle à poids ouverts (open-weight) de 2,8 billions de paramètres une option étonnamment économique pour les tâches de codage de longue durée.

Pourquoi ce benchmark est important

AA-Briefcase mesure la performance sur des charges de travail réelles et soutenues plutôt que sur des questions de culture générale isolées. Un score plus élevé signifie qu'un modèle peut conserver le contexte, planifier à l'avance et rester concentré sur sa tâche sur des milliers de tokens — précisément les conditions auxquelles les développeurs sont confrontés lors de la création d'assistants, de générateurs de code ou d'outils d'aide à la recherche. L'avantage de Kimi K3 sur GPT-5.6 montre qu'un modèle ouvert peut désormais rivaliser là où les modèles fermés dominaient traditionnellement.

L'aspect technique

  • Taille – 2,8 billions de paramètres, le plus grand modèle à poids ouverts publié à ce jour.
  • Architecture – Stable LatentMoE (Mixture-of-Experts) avec 896 experts, dont 16 sont actifs à tout moment.
  • Fenêtre de contexte – Plus de 1 million de tokens, assez pour contenir des livres entiers ou de vastes bases de code.
  • Attention – Kimi Delta Attention, une modification personnalisée censée améliorer l'efficacité de la mise à l'échelle (scaling).

Ces choix donnent au modèle la capacité de gérer des tâches à « long horizon », mais ils augmentent également les besoins en calcul, ce qui se reflète dans les chiffres de vitesse et de coût.

Une tarification qui attire l'attention

Moonshot divise la tarification des tokens en trois catégories :

Type d'utilisation Coût pour 1 M de tokens
Entrée – échec de cache 3,00 $
Entrée – succès de cache 0,30 $
Sortie 15,00 $

L'entreprise affirme que les charges de travail de codage affichent un taux de succès de cache (cache-hit) de 90 %. Si cela est vrai, il s'agit d'une option très économique pour les agents de codage.

Les compromis que vous ressentirez

  • Vitesse – Le modèle traite environ 62 tokens par seconde, ce qui est inférieur à la médiane du secteur. Un prompt long peut prendre plusieurs minutes, ce qui est important pour une utilisation interactive.
  • Coût du raisonnement – Kimi K3 fonctionne par défaut avec un « effort de raisonnement maximal » et ne propose aucun réglage pour le réduire. Par conséquent, les requêtes simples consomment le même budget de tokens que les requêtes complexes, ce qui gonfle les coûts pour les tâches de routine.
  • Utilisation cachée de tokens – Certains utilisateurs signalent un prompt système conséquent que le modèle injecte automatiquement, ajoutant des tokens qui sont facturés mais invisibles dans la requête de l'utilisateur.

Ces facteurs signifient que le prix d'appel très bas peut être compensé par un temps de réponse plus lent et une consommation de tokens plus élevée en pratique.

Disponibilité et perspectives d'avenir

L'API est disponible dès aujourd'hui, permettant aux développeurs d'expérimenter immédiatement. Les poids du modèle seront eux-mêmes publiés le 27 juillet, après quoi l'auto-hébergement deviendra possible. D'ici là, les utilisateurs devront s'appuyer sur le service hébergé de Moonshot et accepter la latence et la structure tarifaire associées.

Contre-argument du camp des modèles fermés

La conclusion qui s'impose

L'enseignement principal est la réduction de l'écart entre les modèles fermés et les modèles ouverts. Kimi K3 prouve que les modèles à poids ouverts peuvent gérer des tâches complexes à long horizon.