Mistral випускає Leanstral 1.5: прорив у формальній математиці та верифікації коду

Mistral AI офіційно представила Leanstral 1.5 — потужну модель із відкритим вихідним кодом, спеціально розроблену для формальної верифікації з використанням мови програмування Lean 4. Опанувавши суворі вимоги математичних доведень та коректності програмного забезпечення, ця модель стає значним кроком уперед у використанні open-source ШІ для критично важливих технічних середовищ.

Домінування у бенчмарках формальної математики

Leanstral 1.5 розроблена для роботи зі складною логікою, необхідною для Lean 4 — мови, створеної для верифікації математичних доведень та надійності програмного забезпечення. Результати моделі у спеціалізованих бенчмарках є просто надзвичайними. Вона досягла ідеального результату у 100 відсотків у miniF2F — бенчмарку, що охоплює діапазон від математики шкільного рівня до надскладних завдань математичних олімпіад.

Під час тестування на PutnamBench — колекції з 672 задач престижної математичної змагальної програми Putnam — Leanstral 1.5 успішно розв'язала 587 задач. Такий показник виводить її на вершину сфери open-source, поступаючись лише закритій (closed-source) моделі Aleph Prover. Крім того, модель продемонструвала майстерність у математиці магістерського рівня в галузі алгебри, набравши 87 відсотків у бенчмарку FATE-H та 34 відсотки у FATE-X, які охоплюють такі складні теми, як теорія груп та кілець.

Більше ніж математика: виявлення багів у реальному коді

Хоча головною новиною є її математична майстерність, Leanstral 1.5 виявляється потужним інструментом для інженерів програмного забезпечення завдяки своїм можливостям верифікації коду. Mistral продемонструвала практичну корисність моделі, застосувавши її для сканування 57 різних open-source репозиторіїв.

У цьому реальному застосуванні модель успішно виявила п'ять раніше невідомих багів. Одним із визначних відкриттів став баг переповнення (overflow bug) у бібліотеці varinteger мовою Rust. Здатність виявляти тонкі, критичні помилки в коді промислового рівня свідчить про те, що Leanstral 1.5 може слугувати автоматизованою «перевіркою на адекватність» (sanity check) для розробників, які працюють з безпечними щодо пам'яті або критично важливими мовами програмування.

Технічна суворість та доступність

Розробка Leanstral 1.5 включала складний конвеєр навчання, що складався з етапів mid-training, навчання з учителем (SFT) та навчання з підкріпленням (RL). Цей багатоетапний підхід гарантує, що модель не просто передбачає наступний токен, а розуміє базові логічні структури, необхідні для формального міркування.

Кроком, що зміцнює open-source екосистему, Mistral випустила модель під ліцензією Apache 2.0. Це дозволяє розробникам і дослідникам інтегрувати, модифікувати та розгортати модель з мінімальними обмеженнями. Наразі Leanstral 1.5 доступна через Hugging Face та через безкоштовний API, що знижує поріг входу для команд, які прагнуть впровадити формальну верифікацію у свої робочі процеси.

Основні висновки

  • Досконалість у бенчмарках: Leanstral 1.5 досягла 100% результату в miniF2F і перевершує майже всіх open-source конкурентів у PutnamBench та тестах з алгебри магістерського рівня.
  • Практичне налагодження: Під час сканування репозиторіїв модель довела свою здатність знаходити реальні вразливості, такі як баг переповнення в бібліотеці Rust.
  • Розширення можливостей open-source: Випущена під ліцензією Apache 2.0, модель є надзвичайно доступною через Hugging Face та безкоштовний API для світової спільноти розробників.