Kimi K3は力尽きた一方で、GPT-5.6-SOLは3つの重量級プロンプト——確率の問題、滑車の慣性シナリオ、そして複雑なPythonのバックパック・スクリプト——においてゴールを切りました。この差は、多段階の数学、物理、コードの推論においてモデルが停滞することなく処理を行うために、トークン予算とレイテンシがいかに重要であるかを示しています。

なぜこのベンチマークが重要なのか

開発者や研究者は、実環境の負荷における挙動ではなく、ヘッドライン上のスコアに基づいてLLMを選ぶことがよくあります。この比較テストでは、各モデルに長い推論の連鎖を必要とする問題に取り組ませました。GPT-5.6-SOLは3つの領域すべてにおいて完全かつ正確な回答を提供しましたが、Kimi K3はトークン予算を使い果たすか、実用的な回答を生成する前にタイムアウトしました。

テストのセットアップ

  • 数学 – パターン重複の確率、および期待値と分散(二次モーメント)の計算を必要とする確率の問題。
  • 物理 – 滑車の慣性と、バネで張られたケーブルが緩む際のエネルギー損失のモデリング。
  • プログラミング – 複雑な依存関係とタイブレーク・ルールを持つバックパック詰め問題に対するPythonソリューションの記述、および6つの独立したテストケースによる出力の検証。

数値が示すもの

GPT-5.6-SOL

  • 数学 – 期待値と分散を明確に示した、完全で正確な解法を生成しました。
  • 物理 – 慣性モデルを正しく構築し、エネルギー損失を考慮しており、解析的な回答と一致しました。
  • プログラミング – コンパイル可能で、実行可能であり、6つすべての外部チェックに合格するコードを生成しました。ただし、内部のテスト・アサーションに誤りがあり、モデルが生成したテストは万能ではないことを再認識させました。

Kimi K3

  • 数学 – トークン上限(初回は6,500トークン、次に10,000トークン)に達し、回答を表示せずに停止しました。
  • 物理 – 可視化可能な出力が現れる前にトークン切れとなりました。
  • プログラミング – 245秒後にタイムアウトし、評価対象となる出力を何も提供できませんでした。

推論効率 vs. 処理能力

本番環境のパイプラインを構築する者にとって、その示唆は明白です。出力を提供せずにトークンを浪費するモデルは、ダウンストリームのプロセスを停滞させ、コストを増大させ、ユーザーの不満を招く可能性があります。

信頼性と「完璧な」コードに隠れたコスト

勝者となったモデルでさえ、ミスを犯しました。GPT-5.6-SOLが自己生成したテストケースには、誤ったアサーションが含まれていました。これは、モデルが作成した検証が人間によるレビューの代わりにはならないことを示しています。モデルがコードを書く場合でも、依然として独立したチェックを実行する必要があります。

次に注目すべき点

  • 終了理由の追跡 – レスポンスがトークン制限、タイムアウト、または自然な停止のどれによって終了したかをログに記録すること。
  • 推論トークン数 – 各モデルが最終的な出力に対してではなく、内部的な検討にどれだけのトークンを費やしているかを比較すること。
  • レイテンシのモニタリング – 各ステップの実時間を測定すること。クエリごとに数分かかるモデルは、インタラクティブなアプリには不向きな場合があります。

開発者は、これらの指標を単なる最終回答としてではなく、第一級のシグナルとして扱うべきです。

結論

GPT-5.6-SOLは、完結性の面でKimi K3を上回っています。また、このテストは、「正解を出す」モデルであっても不完全な内部チェックを生成する可能性があることを思い出させてくれます。したがって、人間による監視は依然として不可欠です。終了理由、トークン使用量、およびレイテンシを追跡することで、サイレントなタイムアウトに陥ることなく、タスクに適したツールを選択できるようになります。