Mistral ने Leanstral 1.5 जारी किया: औपचारिक गणित और कोड सत्यापन में एक बड़ी उपलब्धि
Mistral AI ने आधिकारिक तौर पर Leanstral 1.5 लॉन्च किया है, जो Lean 4 प्रोग्रामिंग भाषा का उपयोग करके औपचारिक सत्यापन (formal verification) के लिए विशेष रूप से तैयार किया गया एक शक्तिशाली ओपन-सोर्स मॉडल है। गणितीय प्रमाणों और सॉफ़्टवेयर की शुद्धता की जटिलताओं में महारत हासिल करके, यह मॉडल उच्च-जोखिम वाले तकनीकी वातावरण के लिए ओपन-सोर्स AI की उपयोगिता में एक महत्वपूर्ण छलांग लगाता है।
औपचारिक गणितीय बेंचमार्क पर दबदबा
Leanstral 1.5 को Lean 4 द्वारा आवश्यक जटिल तर्क (logic) को समझने के लिए डिज़ाइन किया गया है, जो गणितीय प्रमाणों और सॉफ़्टवेयर विश्वसनीयता को सत्यापित करने के लिए बनाई गई एक भाषा है। विशेष बेंचमार्क पर मॉडल का प्रदर्शन असाधारण रहा है। इसने miniF2F पर शत-प्रतिशत (100%) स्कोर हासिल किया, जो हाई स्कूल स्तर के गणित से लेकर गणित ओलंपियाड की कठिन समस्याओं तक फैला हुआ एक बेंचमार्क है।
जब PutnamBench—प्रतिष्ठित Putnam गणित प्रतियोगिता की 672 समस्याओं के संग्रह—के विरुद्ध परीक्षण किया गया, तो Leanstral 1.5 ने सफलतापूर्वक 587 समस्याओं को हल किया। यह प्रदर्शन इसे ओपन-सोर्स क्षेत्र में शीर्ष पर रखता है, जो केवल क्लोज्ड-सोर्स Aleph Prover से पीछे है। इसके अलावा, मॉडल ने बीजगणित (algebra) में स्नातक स्तर (graduate-level) के गणित पर महारत प्रदर्शित की, FATE-H बेंचमार्क पर 87 प्रतिशत और FATE-X पर 34 प्रतिशत स्कोर किया, जो ग्रुप और रिंग थ्योरी जैसे उन्नत विषयों को कवर करते हैं।
गणित से परे: वास्तविक दुनिया में कोड बग का पता लगाना
हालाँकि इसकी गणितीय क्षमता मुख्य आकर्षण है, लेकिन Leanstral 1.5 अपनी कोड सत्यापन क्षमताओं के माध्यम से सॉफ़्टवेयर इंजीनियरों के लिए एक जबरदस्त उपकरण साबित होता है। Mistral ने 57 अलग-अलग ओपन-सोर्स रिपॉजिटरी को स्कैन करने के लिए इसे तैनात करके मॉडल की व्यावहारिक उपयोगिता का प्रदर्शन किया।
इस वास्तविक अनुप्रयोग में, मॉडल ने सफलतापूर्वक पांच पहले से अज्ञात बग्स की पहचान की। एक उल्लेखनीय खोज varinteger Rust लाइब्रेरी के भीतर पाया गया एक ओवरफ्लो बग था। प्रोडक्शन-लेवल कोड में सूक्ष्म और गंभीर त्रुटियों को पकड़ने की यह क्षमता बताती है कि Leanstral 1.5 मेमोरी-सेफ या मिशन-क्रिटिकल भाषाओं में काम करने वाले डेवलपर्स के लिए एक स्वचालित "sanity check" के रूप में काम कर सकता है।
तकनीकी कठोरता और सुलभता
Leanstral 1.5 के विकास में मिड-ट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) और रीइन्फोर्समेंट लर्निंग (RL) से युक्त एक परिष्कृत प्रशिक्षण पाइपलाइन शामिल थी। यह बहु-चरणीय दृष्टिकोण सुनिश्चित करता है कि मॉडल केवल अगले टोकन की भविष्यवाणी नहीं करता है, बल्कि औपचारिक तर्क (formal reasoning) के लिए आवश्यक अंतर्निहित तार्किक संरचनाओं को भी समझता है।
ओपन-सोर्स इकोसिस्टम को मजबूत करने वाले एक कदम के रूप में, Mistral ने इस मॉडल को Apache 2.0 लाइसेंस के तहत जारी किया है। यह डेवलपर्स और शोधकर्ताओं को न्यूनतम प्रतिबंधों के साथ मॉडल को एकीकृत, संशोधित और तैनात करने की अनुमति देता है। Leanstral 1.5 वर्तमान में Hugging Face के माध्यम से और एक मुफ्त API के माध्यम से उपलब्ध है, जिससे अपने वर्कफ़्लो में औपचारिक सत्यापन लागू करने की इच्छा रखने वाली टीमों के लिए प्रवेश की बाधा कम हो जाती है।
मुख्य बातें
- बेंचमार्क उत्कृष्टता: Leanstral 1.5 ने miniF2F पर 100% स्कोर हासिल किया और PutnamBench तथा स्नातक स्तर के बीजगणित परीक्षणों पर लगभग सभी ओपन-सोर्स प्रतिस्पर्धियों से बेहतर प्रदर्शन किया।
- व्यावहारिक डिबगिंग: मॉडल ने रिपॉजिटरी स्कैन के दौरान एक Rust लाइब्रेरी में ओवरफ्लो बग जैसी वास्तविक दुनिया की कमजोरियों को खोजने की अपनी क्षमता साबित की है।
- ओपन-सोर्स सशक्तिकरण: Apache 2.0 लाइसेंस के तहत जारी, यह मॉडल वैश्विक डेवलपर समुदाय के लिए Hugging Face और एक मुफ्त API के माध्यम से अत्यधिक सुलभ है।
