Mistral Merilis Leanstral 1.5: Terobosan dalam Matematika Formal dan Verifikasi Kode
Mistral AI telah resmi meluncurkan Leanstral 1.5, sebuah model sumber terbuka yang kuat yang dirancang khusus untuk verifikasi formal menggunakan bahasa pemrograman Lean 4. Dengan menguasai ketatnya pembuktian matematis dan kebenaran perangkat lunak, model ini menandai lompatan signifikan dalam kegunaan AI sumber terbuka untuk lingkungan teknis berisiko tinggi.
Mendominasi Benchmark Matematika Formal
Leanstral 1.5 dirancang untuk menavigasi logika kompleks yang diperlukan oleh Lean 4, sebuah bahasa yang dibangun untuk memverifikasi pembuktian matematis dan keandalan perangkat lunak. Performa model ini pada benchmark khusus sangatlah luar biasa. Model ini mencapai skor sempurna 100 persen pada miniF2F, sebuah benchmark yang mencakup rentang matematika tingkat sekolah menengah hingga tingkat kesulitan olimpiade matematika yang intens.
Saat diuji terhadap PutnamBench—kumpulan 672 soal dari kompetisi matematika bergengsi Putnam—Leanstral 1.5 berhasil menyelesaikan 587 soal. Performa ini menempatkannya di posisi teratas di bidang sumber terbuka, hanya tertinggal oleh Aleph Prover yang bersifat closed-source. Selain itu, model ini menunjukkan penguasaan atas matematika tingkat pascasarjana dalam aljabar, dengan skor 87 persen pada benchmark FATE-H dan 34 persen pada FATE-X, yang mencakup topik tingkat lanjut seperti teori grup dan ring.
Lebih dari Sekadar Matematika: Deteksi Bug Kode di Dunia Nyata
Meskipun kehebatan matematisnya menjadi sorotan utama, Leanstral 1.5 terbukti menjadi alat yang tangguh bagi para insinyur perangkat lunak melalui kemampuan verifikasi kodenya. Mistral mendemonstrasikan kegunaan praktis model ini dengan menerapkannya untuk memindai 57 repositori sumber terbuka yang berbeda.
Dalam aplikasi dunia nyata ini, model tersebut berhasil mengidentifikasi lima bug yang sebelumnya tidak diketahui. Salah satu temuan penting adalah bug overflow yang terletak di dalam pustaka Rust varinteger. Kemampuan untuk menangkap kesalahan halus dengan konsekuensi tinggi pada kode tingkat produksi ini menunjukkan bahwa Leanstral 1.5 dapat berfungsi sebagai "sanity check" otomatis bagi pengembang yang bekerja dalam bahasa pemrograman yang aman memori atau misi kritis.
Ketatnya Teknis dan Aksesibilitas
Pengembangan Leanstral 1.5 melibatkan pipeline pelatihan canggih yang terdiri dari mid-training, supervised fine-tuning (SFT), dan reinforcement learning (RL). Pendekatan multi-tahap ini memastikan bahwa model tidak hanya memprediksi token berikutnya, tetapi juga memahami struktur logis mendasar yang diperlukan untuk penalaran formal.
Dalam langkah yang memperkuat ekosistem sumber terbuka, Mistral telah merilis model ini di bawah lisensi Apache 2.0. Hal ini memungkinkan pengembang dan peneliti untuk mengintegrasikan, memodifikasi, dan menerapkan model tersebut dengan batasan minimal. Leanstral 1.5 saat ini tersedia melalui Hugging Face dan melalui API gratis, sehingga menurunkan hambatan masuk bagi tim yang ingin menerapkan verifikasi formal dalam alur kerja mereka.
Poin-Poin Penting
- Keunggulan Benchmark: Leanstral 1.5 mencapai skor 100% pada miniF2F dan mengungguli hampir semua kompetitor sumber terbuka pada PutnamBench dan tes aljabar tingkat pascasarjana.
- Debugging Praktis: Model ini telah membuktikan kemampuannya untuk menemukan kerentanan di dunia nyata, seperti bug overflow dalam pustaka Rust, selama pemindaian repositori.
- Pemberdayaan Sumber Terbuka: Dirilis di bawah lisensi Apache 2.0, model ini sangat mudah diakses melalui Hugging Face dan API gratis bagi komunitas pengembang global.
