Mistral, Leanstral 1.5 출시: 형식 수학 및 코드 검증의 획기적 발전
Mistral AI가 Lean 4 프로그래밍 언어를 사용한 형식 검증(formal verification)을 위해 특별히 설계된 강력한 오픈 소스 모델인 Leanstral 1.5를 공식 출시했습니다. 수학적 증명과 소프트웨어의 정확성이라는 엄격한 과정을 마스터함으로써, 이 모델은 높은 신뢰성이 요구되는 기술 환경에서 오픈 소스 AI의 활용성을 크게 도약시켰습니다.
형식 수학 벤치마크 압도
Leanstral 1.5는 수학적 증명과 소프트웨어 신뢰성을 검증하기 위해 구축된 언어인 Lean 4가 요구하는 복잡한 논리를 탐색하도록 설계되었습니다. 전문화된 벤치마크에서 이 모델이 보여준 성능은 놀라울 정도입니다. 고등학교 수준의 수학부터 수학 올림피아드의 고난도 문제까지 아우르는 벤치마크인 miniF2F에서 100%라는 완벽한 점수를 기록했습니다.
권위 있는 Putnam 수학 경시 대회의 문제 672개로 구성된 PutnamBench를 대상으로 테스트했을 때, Leanstral 1.5는 587개의 문제를 성공적으로 해결했습니다. 이러한 성과는 오픈 소스 분야에서 독보적인 위치를 차지하게 했으며, 폐쇄형 모델인 Aleph Prover에 이어서 두 번째로 높은 성적을 거두었습니다. 또한, 이 모델은 군(group) 및 환(ring) 이론과 같은 고급 주제를 다루는 FATE-H 벤치마크에서 87%, FATE-X에서 34%를 기록하며 대학원 수준의 대수학 수학에 대한 숙련도를 입증했습니다.
수학을 넘어: 실전 코드 버그 탐지
수학적 역량이 주요 화두이긴 하지만, Leanstral 1.5는 코드 검증 능력을 통해 소프트웨어 엔지니어들에게도 강력한 도구임을 입증했습니다. Mistral은 57개의 서로 다른 오픈 소스 저장소를 스캔하는 데 이 모델을 배치하여 실질적인 유용성을 보여주었습니다.
이러한 실전 적용 사례에서 모델은 이전에 알려지지 않았던 5개의 버그를 성공적으로 찾아냈습니다. 주목할 만한 발견 중 하나는 varinteger Rust 라이브러리 내에 위치한 오버플로(overflow) 버그였습니다. 프로덕션 수준의 코드에서 미세하고 결과가 중대한 오류를 잡아내는 이러한 능력은 Leanstral 1.5가 메모리 안전(memory-safe) 언어나 미션 크리티컬(mission-critical) 언어를 다루는 개발자들에게 자동화된 "새니티 체크(sanity check)" 역할을 할 수 있음을 시사합니다.
기술적 엄밀함과 접근성
Leanstral 1.5의 개발에는 미드 트레이닝(mid-training), 지도 미세 조정(SFT), 강화 학습(RL)으로 구성된 정교한 학습 파이프라인이 포함되었습니다. 이러한 다단계 접근 방식은 모델이 단순히 다음 토큰을 예측하는 것을 넘어, 형식적 추론에 필요한 근본적인 논리 구조를 이해하도록 보장합니다.
오픈 소스 생태계를 강화하기 위한 조치로, Mistral은 Apache 2.0 라이선스 하에 모델을 공개했습니다. 이를 통해 개발자와 연구자는 최소한의 제한 내에서 모델을 통합, 수정 및 배포할 수 있습니다. Leanstral 1.5는 현재 Hugging Face와 무료 API를 통해 이용할 수 있어, 워크플로에 형식 검증을 도입하려는 팀들의 진입 장벽을 낮추고 있습니다.
핵심 요약
- 벤치마크 우수성: Leanstral 1.5는 miniF2F에서 100% 점수를 달성했으며, PutnamBench 및 대학원 수준의 대수학 테스트에서 거의 모든 오픈 소스 경쟁 모델을 능가합니다.
- 실전 디버깅: 모델은 저장소 스캔 과정에서 Rust 라이브러리의 오버플로 버그와 같은 실제 취약점을 찾아내는 능력을 입증했습니다.
- 오픈 소스 역량 강화: Apache 2.0 라이선스로 출시된 이 모델은 Hugging Face와 무료 API를 통해 전 세계 개발자 커뮤니티가 매우 쉽게 접근할 수 있습니다.
