Mistral, Leanstral 1.5'i Yayınladı: Formal Matematik ve Kod Doğrulamasında Bir Atılım
Mistral AI, Lean 4 programlama dilini kullanarak formal doğrulama için özel olarak tasarlanmış güçlü bir açık kaynaklı model olan Leanstral 1.5'i resmi olarak piyasaya sürdü. Matematiksel kanıtların ve yazılım doğruluğunun zorluklarında uzmanlaşan bu model, yüksek riskli teknik ortamlar için açık kaynaklı yapay zekanın kullanışlılığında önemli bir ileri sıçramayı temsil ediyor.
Formal Matematik Kıyaslamalarında Hakimiyet
Leanstral 1.5, matematiksel kanıtları ve yazılım güvenilirliğini doğrulamak için oluşturulmuş bir dil olan Lean 4'ün gerektirdiği karmaşık mantığı yönetmek üzere tasarlandı. Modelin özel kıyaslamalardaki performansı olağanüstü. Lise düzeyindeki matematikten matematik olimpiyatlarının yoğun zorluk seviyesine kadar uzanan bir yelpazeye sahip olan miniF2F kıyaslamasında %100 tam puan elde etti.
Prestijli Putnam matematik yarışmasından alınan 672 soruluk bir koleksiyon olan PutnamBench ile test edildiğinde, Leanstral 1.5 587 soruyu başarıyla çözdü. Bu performans, onu açık kaynak alanında en üst sıraya yerleştirirken, sadece kapalı kaynaklı Aleph Prover'ın gerisinde bırakıyor. Ayrıca model, grup ve halka teorisi gibi ileri konuları kapsayan FATE-H kıyaslamasında %87 ve FATE-X kıyaslamasında %34 puan alarak cebir alanındaki lisansüstü düzey matematik konusundaki uzmanlığını kanıtladı.
Matematiğin Ötesinde: Gerçek Dünyada Kod Hata Tespiti
Matematiksel yetkinliği ana haber olsa da Leanstral 1.5, kod doğrulama yetenekleri sayesinde yazılım mühendisleri için de dişli bir araç olduğunu kanıtlıyor. Mistral, modeli 57 farklı açık kaynaklı depoyu taramak üzere kullanarak modelin pratik faydasını gösterdi.
Bu gerçek dünya uygulamasında model, daha önce bilinmeyen beş hatayı başarıyla tespit etti. Dikkat çeken keşiflerden biri, varinteger Rust kütüphanesinde bulunan bir taşma (overflow) hatasıydı. Üretim düzeyindeki kodlarda ince ve yüksek sonuçları olan hataları yakalama yeteneği, Leanstral 1.5'in bellek güvenli veya kritik görev odaklı dillerde çalışan geliştiriciler için otomatik bir "mantık kontrolü" (sanity check) işlevi görebileceğini gösteriyor.
Teknik Titizlik ve Erişilebilirlik
Leanstral 1.5'in geliştirilmesi; orta düzey eğitim (mid-training), denetimli ince ayar (SFT) ve pekiştirmeli öğrenmeden (RL) oluşan gelişmiş bir eğitim hattını içeriyordu. Bu çok aşamalı yaklaşım, modelin sadece bir sonraki belirteci (token) tahmin etmesini değil, aynı zamanda formal akıl yürütme için gereken temel mantıksal yapıları anlamasını sağlıyor.
Açık kaynak ekosistemini güçlendiren bir hamleyle Mistral, modeli Apache 2.0 lisansı altında yayınladı. Bu, geliştiricilerin ve araştırmacıların modeli minimum kısıtlama ile entegre etmelerine, değiştirmelerine ve dağıtmalarına olanak tanıyor. Leanstral 1.5 şu anda Hugging Face üzerinden ve ücretsiz bir API aracılığıyla erişilebilir durumda olup, iş akışlarına formal doğrulama uygulamak isteyen ekipler için giriş bariyerini düşürüyor.
Önemli Çıkarımlar
- Kıyaslama Mükemmelliği: Leanstral 1.5, miniF2F'de %100 puan elde etti ve PutnamBench ile lisansüstü düzey cebir testlerinde neredeyse tüm açık kaynaklı rakiplerinden daha iyi performans gösteriyor.
- Pratik Hata Ayıklama: Model, depo taramaları sırasında bir Rust kütüphanesindeki taşma hatası gibi gerçek dünyadaki güvenlik açıklarını bulma yeteneğini kanıtladı.
- Açık Kaynak Güçlendirmesi: Apache 2.0 lisansı altında yayınlanan model, küresel geliştirici topluluğu için Hugging Face ve ücretsiz bir API aracılığıyla oldukça erişilebilirdir.
