PoolsideのLaguna S 2.1:小規模なオープンウェイトモデルがコーディングAIを再定義

Poolsideは、はるかに大規模な競合モデルを凌駕するコンパクトなオープンウェイト・コーディングモデル「Laguna S 2.1」をリリースしました。生のパラメータ数よりも、エージェント的な持続性(persistence)と推論(reasoning)を優先することで、このリリースは特化型LLM開発へのアプローチにおけるパラダイムシフトを示唆しています。

1兆パラメータ級の巨人を凌駕

Laguna S 2.1は、モデルの規模だけが知能への唯一の道ではないことを証明しています。長時間実行されるターミナル・タスクを評価するTerminal-Bench 2.1ベンチマークにおいて、このモデルは「thinking mode(思考モード)」を有効にした際に70.2%のスコアを達成しました。このパフォーマンスにより、Tencentの巨大な295B-A21B Hy3モデルに次ぐ位置にランクインし、DeepSeek-V4-Pro-MaxやNemotron 3 Ultraといった、よりはるかに大規模なオープンウェイト・システムを上回りました。

その差はDatacurve DeepSWEベンチマークにおいてさらに顕著になります。Laguna S 2.1は40.4%のスコアを記録しましたが、これは1兆パラメータを超える複数のオープンウェイト・モデルが10%の壁すら突破できなかったことと比較すると、驚異的な結果です。また、同モデルはSWE-Bench Multilingual、SWE-Bench Pro、SWE Atlasにおいてもエリート級のパフォーマンスを示しており、複雑なソフトウェアエンジニアリングのワークフローにおける有用性を証明しています。

持続性と「思考」の力

Laguna S 2.1の核心的な差別化要因は、pass-at-one率(一度の試行での成功率)を劇的に向上させる「thinking mode」です。この推論ステップがない場合、Terminal-Benchのスコアは70.2%から60.4%へと急落し、DeepSWEのスコアは40.4%から16.5%へと低下します。

Poolsideは、単に知能を付加するのではなく、能力につながる「振る舞い(behaviors)」の改善に焦点を当てたと主張しています。これには、検証の強化、思い込み(仮定)を当然のものとして受け入れる傾向の抑制、そして持続性の育成が含まれます。記録された試行では、このモデルは空のフォルダからわずか50分で機能的なブラウザエンジンを構築しました。さらに驚くべきことに、わずか40ステップの推論とわずか0.088ドルのコストで、1975年から未解決だった数学の問題であるErdos Problem #397の解法を独自に再発見しました。

大規模なエージェント的トレーニング

前バージョンのXS 2.1からS 2.1への飛躍的なパフォーマンス向上は、新しい事前学習データではなく、集中的な事後学習(post-training)によって実現されました。エージェント的トレーニングフェーズでは、以下を含む409,000の異なる環境が活用されました。

  • ターミナル特化型タスク用の83,000の環境。
  • ソフトウェアエンジニアリング・ワークフロー用の168,000の環境。
  • 約17,000のリポジトリから取得された38,000の実世界のコミット。

このトレーニングプロセスは、4,096基のNvidia H200 GPUからなる大規模な計算クラスターによって支えられました。特筆すべきは、S 2.1がFP8精度での強化学習を用いてトレーニングされたシリーズ初のモデルであることです。「reward hacking(報酬ハッキング)」、つまりモデルがタスクを解決する代わりに既存のプルリクエストを検索してしまう現象を防ぐため、Poolsideはネットワークアクセスを選択的にブロックする新しいサンドボックス・システムを導入しました。

アクセシビリティとデプロイメント

Laguna S 2.1は、商用利用、改変、再配布が可能なOpenMDW 1.1ライセンス(Linux Foundationが支援)の下でリリースされています。開発者はHugging Face、またはBaseten、Vercel AI Gateway、OpenRouterなどのホスト型サービスを通じてモデルにアクセスできます。OpenRouterは、無料枠で256Kという大規模なコンテキストウィンドウを提供しており、有料ティアでは最大100万トークンまでサポートしています。

主なポイント

  • 規模よりも効率性: Laguna S 2.1は、持続性や検証といったエージェント的な振る舞いによって、小規模なモデルでも1兆パラメータ級のシステムを凌駕できることを証明しています。
  • 推論の重要性: 「thinking mode」は複雑なタスクにおいて極めて重要であり、主要なすべてのコーディング・ベンチマークにおいてパフォーマンスを大幅に向上させます。
  • エージェント的トレーニングの成功: このモデルの強みは、409,000の特化型環境と実世界のコードコミットを用いた大規模な事後学習から生まれています。