Mistral выпускает Leanstral 1.5: прорыв в области формальной математики и верификации кода
Mistral AI официально представила Leanstral 1.5 — мощную модель с открытым исходным кодом, специально разработанную для формальной верификации с использованием языка программирования Lean 4. Освоив строгость математических доказательств и корректности программного обеспечения, эта модель знаменует собой значительный скачок в полезности open-source ИИ для критически важных технических сред.
Доминирование в бенчмарках по формальной математике
Leanstral 1.5 спроектирована для работы со сложной логикой, требуемой Lean 4 — языком, созданным для верификации математических доказательств и надежности ПО. Результаты модели в специализированных бенчмарках просто экстраординарны. Она достигла идеального показателя в 100% в miniF2F — тесте, охватывающем задачи от уровня школьной математики до сложнейших олимпиадных задач.
При тестировании на PutnamBench — наборе из 672 задач престижного математического конкурса Putnam — Leanstral 1.5 успешно решила 587 задач. Этот результат выводит её в лидеры среди open-source решений, уступая лишь закрытой модели Aleph Prover. Кроме того, модель продемонстрировала мастерство в алгебре на уровне магистратуры, набрав 87% в бенчмарке FATE-H и 34% в FATE-X, которые охватывают такие продвинутые темы, как теория групп и колец.
Больше чем математика: обнаружение реальных багов в коде
Хотя математические способности являются главной новостью, Leanstral 1.5 оказывается грозным инструментом для инженеров по программному обеспечению благодаря своим возможностям верификации кода. Mistral продемонстрировала практическую полезность модели, развернув её для сканирования 57 различных open-source репозиториев.
В этом реальном сценарии использования модель успешно выявила пять ранее неизвестных багов. Одним из заметных открытий стала ошибка переполнения в Rust-библиотеке varinteger. Способность улавливать тонкие, критические ошибки в промышленном коде позволяет предположить, что Leanstral 1.5 может служить автоматизированной «проверкой на адекватность» (sanity check) для разработчиков, работающих с безопасными с точки зрения памяти или критически важными языками программирования.
Техническая строгость и доступность
Разработка Leanstral 1.5 включала сложный конвейер обучения, состоящий из промежуточного обучения (mid-training), обучения с учителем (SFT) и обучения с подкреплением (RL). Этот многоэтапный подход гарантирует, что модель не просто предсказывает следующий токен, но и понимает лежащие в основе логические структуры, необходимые для формальных рассуждений.
В рамках шага, укрепляющего open-source экосистему, Mistral выпустила модель под лицензией Apache 2.0. Это позволяет разработчикам и исследователям интегрировать, модифицировать и развертывать модель с минимальными ограничениями. В настоящее время Leanstral 1.5 доступна через Hugging Face и через бесплатный API, что снижает порог вхождения для команд, стремящихся внедрить формальную верификацию в свои рабочие процессы.
Основные выводы
- Превосходство в бенчмарках: Leanstral 1.5 достигла 100% результата в miniF2F и превосходит почти всех open-source конкурентов в PutnamBench и тестах по алгебре на уровне магистратуры.
- Практическая отладка: Модель доказала свою способность находить реальные уязвимости, такие как ошибка переполнения в Rust-библиотеке, в ходе сканирования репозиториев.
- Поддержка open-source: Выпущенная под лицензией Apache 2.0, модель широко доступна мировому сообществу разработчиков через Hugging Face и бесплатный API.
