Mistral 发布 Leanstral 1.5:形式化数学与代码验证的突破

Mistral AI 正式推出了 Leanstral 1.5,这是一款专为使用 Lean 4 编程语言进行形式化验证而设计的强大开源模型。通过掌握数学证明和软件正确性的严谨要求,该模型标志着开源 AI 在高要求技术环境中的应用能力实现了重大飞跃。

统治形式化数学基准测试

Leanstral 1.5 旨在应对 Lean 4 所需的复杂逻辑,Lean 4 是一种专为验证数学证明和软件可靠性而构建的语言。该模型在专业基准测试中的表现堪称卓越。它在 miniF2F 上取得了 100% 的满分,该基准测试涵盖了从高中数学水平到难度极高的数学奥林匹克竞赛的内容。

在针对 PutnamBench(包含来自著名的 Putnam 数学竞赛的 672 道题目)的测试中,Leanstral 1.5 成功解决了 587 道题。这一表现使其处于开源领域的顶尖地位,仅次于闭源的 Aleph Prover。此外,该模型还展示了对研究生水平代数学的精通,在涵盖群论和环论等高级主题的 FATE-H 基准测试中得分 87%,在 FATE-X 中得分 34%。

超越数学:现实世界的代码漏洞检测

虽然其数学实力是头条新闻,但 Leanstral 1.5 通过其代码验证能力,证明了自己是软件工程师的强大工具。Mistral 通过部署该模型扫描 57 个不同的开源仓库,展示了其在实际应用中的效用。

在这一实际应用中,该模型成功识别了五个此前未知的漏洞。其中一个显著的发现是位于 varinteger Rust 库中的一个溢出漏洞。这种在生产级代码中捕捉细微且后果严重的错误的能力表明,Leanstral 1.5 可以为从事内存安全或任务关键型语言开发的工程师提供自动化的“合理性检查”(sanity check)。

技术严谨性与易用性

Leanstral 1.5 的开发涉及一个复杂的训练流水线,包括中期训练(mid-training)、监督微调(SFT)和强化学习(RL)。这种多阶段方法确保了模型不仅是在预测下一个 token,而且能够理解形式化推理所需的底层逻辑结构。

为了加强开源生态系统,Mistral 已根据 Apache 2.0 许可证发布了该模型。这允许开发人员和研究人员以极少的限制来集成、修改和部署该模型。Leanstral 1.5 目前可通过 Hugging Face 和免费 API 获取,降低了希望在工作流程中实现形式化验证的团队的准入门槛。

核心要点

  • 基准测试卓越: Leanstral 1.5 在 miniF2F 上取得了 100% 的得分,并在 PutnamBench 和研究生水平的代数测试中超越了几乎所有开源竞争对手。
  • 实际调试能力: 该模型已证明其在仓库扫描过程中发现现实世界漏洞的能力,例如 Rust 库中的溢出漏洞。
  • 赋能开源: 该模型根据 Apache 2.0 许可证发布,全球开发者社区可以通过 Hugging Face 和免费 API 轻松获取。