MetaのMuse Spark 1.1、コーディング性能とコスト効率で急進
Metaは、推論能力と効率性において飛躍的な進歩を遂げたモデル「Muse Spark 1.1」をリリースし、高性能LLMの基準を公式に引き上げました。専門的なコーディングタスクにおいて既存の競合他社を凌駕しつつ、より低い価格帯を維持することで、Metaは実用的で開発者中心のAI競争におけるリーダーとしての地位を確立しようとしています。
優れたコーディング性能とインテリジェンスの向上
Artificial Analysisによる最新データは、Muse Spark 1.1が急速に進化していることを示しています。わずか3ヶ月間で、同モデルはIntelligence Indexで8ポイント上昇し、現在は51というスコアを記録しています。これにより、GLM 5.2、GPT-5.4、GPT-5.6 Lunaといった強力なモデルと同等の水準に達しました。
最も目覚ましい向上は、コーディングとエージェントベースのナレッジワークに集中しています。専門的なCoding Indexにおいて、Muse Spark 1.1は71.3というスコアを達成し、68.8だったGLM 5.2を事実上上回りました。業界リーダーであるGPT-5.6 Luna (71.4)、GPT-5.6 Sol (77.4)、Claude Fable 5 (76.5)にはわずかに及びませんが、同モデルの急速な成長軌道は、フロンティアモデルとの差を加速的なペースで縮めていることを示唆しています。
コストとハルシネーション率の劇的な削減
開発者や創業者にとって、最も重要な指標は多くの場合、コストパフォーマンス(価格性能比)です。Muse Spark 1.1は、タスクあたり推定0.26ドルという非常に競争力のある価値提案を行っています。これにより、GLM-5.2(0.37ドル)よりも大幅に手頃であり、GPT-5.4(0.89ドル)と比較すると70%近く安価になります。
このコスト効率は、技術的な最適化によって実現されています。GLM-5.2が1億4100万トークンを必要とするのに対し、Muse Spark 1.1はタスクあたりわずか9400万出力トークンを使用します。さらに、Metaは業界最大の悩みの一つである「信頼性」にも対処しました。モデルのハルシネーション(幻覚)率は、73%から38%へと大幅に削減されました。特筆すべきは、誤った情報を提供するのではなく、不確実なクエリに対しては回答を拒否するように、正確性を優先するトレーニングが施されている点です。
大規模なコンテキスト拡張と可用性
インテリジェンスとコストに加え、Metaは大規模データの処理能力を大幅にアップグレードしました。Muse Spark 1.1はコンテキストウィンドウが4倍に拡大され、現在は100万トークンに達しています。この拡張により、開発者はコードベース全体や膨大な技術文書をプロンプトに投入できるようになり、複雑で長文の推論タスクにおける強力なツールとなります。
現在、Muse Spark 1.1はMeta独自のAPIを通じてのみ利用可能であり、これは独自のインフラを中心に開発者エコシステムを統合しようとする戦略的な動きを示しています。
なぜこれがAI業界において重要なのか
Muse Spark 1.1のリリースは、LLMの軍拡競争が「生の規模(raw scale)」から「洗練された効率性(refined efficiency)」へとシフトしていることを示しています。Metaは、より優れたトークン管理とハルシネーション率の低減を通じて、従来のフロンティアモデルのわずかなコストで、ハイレベルなコーディング・インテリジェンスを提供できることを証明しています。業界全体にとって、これは「価値主導型AI」の新たなベンチマークとなります。
主なポイント
- コーディングの優位性: Muse Spark 1.1はCoding Indexで71.3を記録し、GLM-5.2 (68.8)を上回り、GPT-5.6 Lunaの性能に迫っています。
- 経済的効率性: タスクあたり0.26ドルという価格で、GLM-5.2やGPT-5.4といった競合他社よりも大幅に安価です。
- 技術的アップグレード: Metaはコンテキストウィンドウを100万トークンへと4倍に拡大し、ハルシネーション率を73%から38%に低減させました。
