Moonshot AIの新しいKimi K3は、AA-BriefcaseベンチマークにおいてGPT-5.6を上回り、後者の1,495に対し1,527を記録しました。この勝利は、2.8兆パラメータを持つオープンウェイトモデルを、長文コーディングタスクにおいて驚くほど安価な選択肢とする価格モデルとともに実現しました。
なぜこのベンチマークが重要なのか
AA-Briefcaseは、単発のトリビア問題ではなく、持続的な実世界のワークロードにおけるパフォーマンスを測定します。スコアが高いほど、モデルがコンテキストを維持し、先を見越して計画を立て、数千トークンにわたってタスクを遂行できることを意味します。これは、開発者がアシスタント、コード生成器、またはリサーチエイドを構築する際に直面する条件そのものです。Kimi K3がGPT-5.6に対して示した優位性は、これまでクローズドなライバルが支配してきた領域において、オープンモデルが今や対抗できることを示しています。
技術的な概要
- サイズ – 2.8兆パラメータ。これまでにリリースされたオープンウェイトモデルの中で最大です。
- アーキテクチャ – 896個の専門家(エキスパート)を持つStable LatentMoE(Mixture-of-Experts)。そのうち、常に16個がアクティブになります。
- コンテキストウィンドウ – 100万トークン以上。本一冊分や大規模なコードベース全体を保持するのに十分な量です。
- アテンション – Kimi Delta Attention。スケーリング効率を向上させるとされるカスタム調整技術です。
これらの選択により、モデルは「ロングホライゾン(長期的な)」タスクを処理する能力を備えていますが、同時に計算リソースの要求も高まり、それが速度やコストの数値に表れています。
目を引く価格設定
Moonshotは、トークン価格を3つの区分に分けています。
| 使用タイプ | 100万トークンあたりのコスト |
|---|---|
| 入力 – キャッシュミス | $3.00 |
| 入力 – キャッシュヒット | $0.30 |
| 出力 | $15.00 |
同社によれば、コーディングのワークロードでは90%のキャッシュヒット率を記録しているとのことです。もしこれが事実であれば、コーディングエージェントにとって非常に安価な選択肢となります。
実際に感じるトレードオフ
- 速度 – モデルの処理速度は約62トークン/秒で、業界の中央値を下回っています。長いプロンプトでは数分間待たされることもあり、対話的な利用においては重要な要素となります。
- 推論コスト – Kimi K3はデフォルトで「max reasoning effort(最大推論努力)」で動作し、これを弱める設定がありません。そのため、単純なクエリでも複雑なものと同じトークン予算を消費してしまい、日常的なタスクのコストを膨らませてしまいます。
- 隠れたトークン使用量 – 一部のユーザーからは、モデルが自動的に注入する大規模なシステムプロンプトの存在が報告されています。これにより、ユーザーのリクエストには表示されませんが、課金対象となるトークンが追加されます。
これらの要因により、見かけ上の低価格が、実際には処理の遅延やトークン消費量の増加によって相殺される可能性があります。
利用可能性と今後の展望
APIは本日公開されており、開発者はすぐに実験を開始できます。モデルのウェイト自体は7月27日にリリースされる予定で、その後はセルフホスティングが可能になります。それまでは、ユーザーはMoonshotのホストサービスに依存し、それに伴うレイテンシや価格体系を受け入れる必要があります。
クローズドモデル陣営からの反論
浮かび上がってきた教訓
主な教訓は、クローズドモデルとオープンモデルの差が縮まっていることです。Kimi K3は、オープンウェイトモデルが複雑で長期的なタスクを処理できることを証明しています。
