Mistral ने Leanstral 1.5 लाँच केले: औपचारिक गणित आणि कोड पडताळणीमध्ये (Code Verification) एक मोठी झेप

Mistral AI ने अधिकृतपणे Leanstral 1.5 लाँच केले आहे, जे Lean 4 प्रोग्रामिंग लँग्वेज वापरून औपचारिक पडताळणीसाठी (formal verification) विशेषतः तयार केलेले एक शक्तिशाली ओपन-सोर्स मॉडेल आहे. गणितीय पुरावे आणि सॉफ्टवेअरची अचूकता यातील कठीण आव्हानांवर प्रभुत्व मिळवून, हे मॉडेल उच्च-जोखमीच्या तांत्रिक वातावरणात ओपन-सोर्स AI च्या उपयुक्ततेमध्ये एक महत्त्वपूर्ण प्रगती दर्शवते.

औपचारिक गणितीय बेंचमार्कवर वर्चस्व

Leanstral 1.5 हे Lean 4 द्वारे आवश्यक असलेल्या जटिल तर्काचा (logic) वापर करण्यासाठी डिझाइन केलेले आहे, जी भाषा गणितीय पुरावे आणि सॉफ्टवेअरची विश्वासार्हता पडताळण्यासाठी बनवण्यात आली आहे. विशेष बेंचमार्कवरील या मॉडेलची कामगिरी विलक्षण आहे. miniF2F वर या मॉडेलने १०० टक्के गुण मिळवले आहेत, जो बेंचमार्क हायस्कूल स्तरावरील गणितापासून ते गणित ऑलिम्पियाडमधील कठीण प्रश्नांपर्यंत विस्तारलेला आहे.

प्रतिष्ठित Putnam गणित स्पर्धेतील ६७२ प्रश्नांचा संग्रह असलेल्या PutnamBench वर चाचणी घेतल्यावर, Leanstral 1.5 ने ५८७ प्रश्नांची यशस्वीरित्या उत्तरे दिली. ही कामगिरी या मॉडेलला ओपन-सोर्स क्षेत्रात अव्वल स्थानी नेते, जे केवळ क्लोज्ड-सोर्स Aleph Prover च्या मागे आहे. शिवाय, या मॉडेलने अल्जेब्रा मधील पदवी स्तरावरील (graduate-level) गणितात प्रभुत्व दाखवले असून, FATE-H बेंचमार्कवर ८७ टक्के आणि FATE-X वर ३४ टक्के गुण मिळवले आहेत, जे ग्रुप आणि रिंग थिअरीसारख्या प्रगत विषयांचा समावेश करतात.

गणितापलीकडे: रिअल-वर्ल्ड कोड बग शोधणे

जरी याची गणितीय क्षमता मुख्य आकर्षण असली, तरी Leanstral 1.5 त्याच्या कोड पडताळणीच्या (code verification) क्षमतेमुळे सॉफ्टवेअर इंजिनिअर्ससाठी एक प्रभावी साधन ठरत आहे. Mistral ने ५७ वेगवेगळ्या ओपन-सोर्स रिपॉझिटरीज स्कॅन करण्यासाठी या मॉडेलचा वापर करून त्याची व्यावहारिक उपयुक्तता सिद्ध केली आहे.

या रिअल-वर्ल्ड ॲप्लिकेशनमध्ये, मॉडेलने यापूर्वी अज्ञात असलेले पाच बग्स यशस्वीरित्या शोधले. एक उल्लेखनीय शोध म्हणजे varinteger Rust लायब्ररीमधील एक ओव्हरफ्लो बग (overflow bug). प्रोडक्शन-लेव्हल कोडमधील सूक्ष्म आणि गंभीर चुका पकडण्याची ही क्षमता सुचवते की, मेमरी-सेफ किंवा मिशन-क्रिटिकल लँग्वेजेसमध्ये काम करणाऱ्या डेव्हलपर्ससाठी Leanstral 1.5 एक स्वयंचलित "सॅनिटी चेक" (sanity check) म्हणून काम करू शकते.

तांत्रिक अचूकता आणि सुलभता

Leanstral 1.5 च्या विकासात मिड-ट्रेनिंग, सुपरवाइज्ड फाईन-ट्यूनिंग (SFT) आणि रिइन्फोर्समेंट लर्निंग (RL) यांचा समावेश असलेल्या एका प्रगत ट्रेनिंग पाइपलाइनचा वापर करण्यात आला आहे. हा बहु-स्तरीय दृष्टिकोन हे सुनिश्चित करतो की मॉडेल केवळ पुढचा टोकन (token) वर्तवत नाही, तर औपचारिक तर्कासाठी (formal reasoning) आवश्यक असलेल्या मूळ तार्किक संरचना समजून घेते.

ओपन-सोर्स इकोसिस्टम मजबूत करण्याच्या दृष्टीने, Mistral ने हे मॉडेल Apache 2.0 लायसन्स अंतर्गत रिलीज केले आहे. यामुळे डेव्हलपर्स आणि संशोधकांना किमान निर्बंधांसह मॉडेल इंटिग्रेट, मॉडिफाय आणि डिप्लॉय करणे शक्य होईल. Leanstral 1.5 सध्या Hugging Face आणि मोफत API द्वारे उपलब्ध आहे, ज्यामुळे त्यांच्या वर्कफ्लोमध्ये औपचारिक पडताळणी लागू करू इच्छिणाऱ्या टीम्ससाठी याचा वापर करणे सोपे झाले आहे.

मुख्य मुद्दे

  • बेंचमार्क उत्कृष्टता: Leanstral 1.5 ने miniF2F वर १००% गुण मिळवले आहेत आणि PutnamBench व पदवी स्तरावरील अल्जेब्रा चाचण्यांमध्ये जवळजवळ सर्व ओपन-सोर्स स्पर्धकांना मागे टाकले आहे.
  • व्यावहारिक डीबगिंग: रिपॉझिटरी स्कॅन दरम्यान, मॉडेलने Rust लायब्ररीमधील ओव्हरफ्लो बग सारख्या रिअल-वर्ल्ड त्रुटी शोधण्याची आपली क्षमता सिद्ध केली आहे.
  • ओपन-सोर्स सक्षमीकरण: Apache 2.0 लायसन्स अंतर्गत रिलीज केलेले हे मॉडेल जागतिक डेव्हलपर समुदायासाठी Hugging Face आणि मोफत API द्वारे अत्यंत सुलभ उपलब्ध आहे.