Sakana AIのFugu Ultra v1.1、最新アップデートでFable 5を凌駕
Sakana AIは、インテリジェント・モデル・ルーターであるFugu Ultra v1.1の重要なアップデートをリリースし、主要な技術ベンチマークにおいて大幅なパフォーマンス向上を実現したと発表しました。このアップデートは、優れた推論能力とコーディング能力を達成するために、クエリをトップティアのモデルへどのように分配するかを洗練させる戦略的な試みとなります。
ベンチマークにおける躍進:Fugu Ultra v1.1の優位性
Fugu Ultra v1.1の核心的なイノベーションは、そのルーティングのインテリジェンスにあります。これは、与えられたプロンプトに対して、公開されているLLMのプールから最も適切なモデルを選択するものです。Sakana AIの報告によると、本バージョンは初期のv1.0リリースと比較して、最大7.9ポイントのパフォーマンス向上を実現しています。
特に注目すべきは、このルーターが専門的な技術評価、具体的にはProgramBenchおよびTerminalBench 2.1のベンチマークにおいて大幅な飛躍を見せたことです。Sakanaは驚くべき主張として、Fable 5はルーターの選択プールに含まれていないにもかかわらず、Fugu Ultra v1.1がほとんどのベンチマークにおいてAnthropicのFable 5を凌駕していると断言しています。これらの結果は現時点では第三者機関による独立した検証がなされていませんが、ルーティング・ロジックが既存のモデル・アーキテクチャからピークパフォーマンスを引き出す上で、非常に効率的になりつつあることを示唆しています。
技術アーキテクチャと開発者への統合
最先端のモデルプールを維持するためのSakanaのアプローチは厳格です。同社によれば、新しいトップティアのモデルをFuguエコシステムに正式に統合する前に、約2週間の専用のトレーニングと評価が必要であるとしています。これにより、ルーターの意思決定プロセスが、市場における最新のウェイト(重み)や能力に対して最適化された状態を維持できるようになります。
開発者向けには、今回のアップデートで新しいClaude Code互換エンドポイントが導入され、ユーザーはターミナルから直接Fuguを呼び出すことが可能になりました。この統合により、高度な推論やターミナルベースの自動化を必要とするエンジニアのワークフローが効率化されます。こうした技術的な進歩の一方で、価格設定は以前のバージョンから変更ありません。入力トークン100万件あたり5ドル、出力トークン100万件あたり30ドルです。Fuguは現在、OpenRouterやVercelを含む主要なプラットフォームから利用可能です。
市場の課題と規制への対応
今回のリリースは、Fuguの初期リリースが精査を受けていた時期を経て行われました。初期の批判的な意見では、高いトークン消費量、レイテンシ、および結果の不一致といった問題が指摘されていました。v1.1において、Sakanaは開発者の信頼を取り戻すために、効率性と専門的なタスクのパフォーマンス向上に注力しているようです。
しかし、地理的な制限がグローバルな普及への障壁として残っています。Sakana AIは現在、GDPRやその他のEU固有の規制枠組みに関する複雑さを理由に、欧州連合(EU)および欧州経済領域(EEA)内のユーザーにはサービスを提供していません。「モデル・ルーター」というカテゴリーが成長する中で、透明性が高く検証可能なデータを通じてこれらのパフォーマンスに関する主張を証明できるかどうかが、競争の激しいAI業界における同社の生存能力を測る最終的な試金石となるでしょう。
主なポイント
- 優れたベンチマーク性能: Fugu Ultra v1.1はv1.0から7.9ポイントの向上を示しており、Fable 5がルーターのプールに含まれていないにもかかわらず、いくつかの指標でAnthropicのFable 5を明らかに上回っています。
- 開発者中心のアップデート: 新バージョンではClaude Code互換のターミナルエンドポイントが追加され、コーディングワークフローへの統合が容易になりました。
- 厳格なキュレーション: Sakanaは、高い精度とパフォーマンスを維持するために、ルーターに追加されるすべての新しいモデルに対して2週間の評価サイクルを採用しています。
