MistralがLeanstral 1.5をリリース:形式数学とコード検証における画期的な進歩
Mistral AIは、Lean 4プログラミング言語を用いた形式検証(formal verification)に特化して設計された強力なオープンソースモデル、Leanstral 1.5を正式にリリースしました。数学的証明の厳密さとソフトウェアの正確性を習得することで、このモデルは、極めて高い信頼性が求められる技術環境におけるオープンソースAIの有用性を大きく飛躍させました。
形式数学ベンチマークにおける圧倒的な性能
Leanstral 1.5は、数学的証明とソフトウェアの信頼性を検証するために構築された言語であるLean 4が要求する複雑なロジックを処理できるように設計されています。専門的なベンチマークにおける同モデルのパフォーマンスは、驚異的と言うほかありません。高校レベルの数学から数学オリンピックの難問までをカバーするベンチマーク「miniF2F」において、満点の100%を達成しました。
名門プットナム数学コンテスト(Putnam math competition)から選出された672問の課題を集めた「PutnamBench」を用いたテストでは、Leanstral 1.5は587問の解決に成功しました。この成績により、同モデルはオープンソース分野でトップに位置し、クローズドソースのAleph Proverに次ぐ結果を残しています。さらに、代数学における大学院レベルの数学においても習熟度を示しており、群論や環論などの高度なトピックを扱うFATE-Hベンチマークで87%、FATE-Xで34%のスコアを記録しました。
数学を超えて:実社会におけるコードのバグ検出
数学的な能力が大きな注目を集めていますが、Leanstral 1.5はコード検証機能を通じて、ソフトウェアエンジニアにとっても強力なツールであることが証明されています。Mistralは、57の異なるオープンソースリポジトリのスキャンに同モデルを適用することで、その実用的な有用性を実証しました。
この実用的なアプリケーションにおいて、モデルはこれまで未知であった5つのバグを特定することに成功しました。特筆すべき発見の一つは、Rustライブラリの varinteger 内に存在したオーバーフローのバグです。本番環境レベルのコードにおける、微細かつ重大な影響を及ぼすエラーを捉えるこの能力は、Leanstral 1.5が、メモリ安全性が重視される言語やミッションクリティカルな言語を扱う開発者にとって、自動化された「サニティチェック(妥当性確認)」として機能することを示唆しています。
技術的な厳密さとアクセシビリティ
Leanstral 1.5の開発には、mid-training、教師あり微調整(SFT)、および強化学習(RL)からなる高度なトレーニングパイプラインが用いられています。この多段階のアプローチにより、モデルは単に次のトークンを予測するだけでなく、形式的な推論に必要な基礎となる論理構造を理解することが可能になっています。
オープンソースのエコシステムを強化する動きとして、MistralはApache 2.0ライセンスの下でこのモデルをリリースしました。これにより、開発者や研究者は最小限の制限でモデルを統合、修正、デプロイすることができます。Leanstral 1.5は現在、Hugging Faceおよび無料のAPIを通じて利用可能であり、ワークフローに形式検証を導入しようとするチームの導入障壁を下げています。
主なポイント
- ベンチマークにおける卓越性: Leanstral 1.5はminiF2Fで100%のスコアを達成し、PutnamBenchや大学院レベルの代数テストにおいて、ほぼすべてのオープンソースの競合モデルを凌駕しています。
- 実用的なデバッグ: リポジトリのスキャン中に、Rustライブラリ内のオーバーフローバグなど、実社会における脆弱性を見つけ出す能力を証明しました。
- オープンソースによるエンパワーメント: Apache 2.0ライセンスの下でリリースされたこのモデルは、Hugging Faceや無料のAPIを通じて、世界の開発者コミュニティが非常に利用しやすい環境にあります。
