Mistral مدل Leanstral 1.5 را منتشر کرد: پیشرفتی بزرگ در ریاضیات رسمی و تأیید صحت کد
Mistral AI بهطور رسمی Leanstral 1.5 را عرضه کرد؛ یک مدل متنباز قدرتمند که بهطور اختصاصی برای تأیید صحت رسمی (formal verification) با استفاده از زبان برنامهنویسی Lean 4 طراحی شده است. این مدل با تسلط بر دقتِ اثباتهای ریاضی و صحت نرمافزاری، جهشی بزرگ در کاربرد هوش مصنوعی متنباز برای محیطهای فنی حساس و حیاتی محسوب میشود.
تسلط بر بنچمارکهای ریاضیات رسمی
Leanstral 1.5 برای پیمایش در منطق پیچیده مورد نیاز Lean 4 طراحی شده است؛ زبانی که برای تأیید اثباتهای ریاضی و قابلیت اطمینان نرمافزار ساخته شده است. عملکرد این مدل در بنچمارکهای تخصصی فوقالعاده است. این مدل در miniF2F، بنچمارکی که از سطح ریاضیات دبیرستان تا سطح دشوار المپیادهای ریاضی را پوشش میدهد، امتیاز کامل ۱۰۰ درصد را کسب کرد.
هنگام آزمایش در برابر PutnamBench — مجموعهای شامل ۶۷۲ مسئله از مسابقات معتبر ریاضی Putnam — مدل Leanstral 1.5 موفق شد ۵۸۷ مسئله را حل کند. این عملکرد، آن را در صدر حوزه مدلهای متنباز قرار میدهد و تنها مدل بسته-منبع Aleph Prover از آن پیشی دارد. علاوه بر این، این مدل تسلط خود را بر ریاضیات سطح تحصیلات تکمیلی در جبر نشان داد و در بنچمارک FATE-H امتیاز ۸۷ درصد و در FATE-X امتیاز ۳۴ درصد را کسب کرد که مباحث پیشرفتهای مانند نظریه گروهها و حلقهها را پوشش میدهند.
فراتر از ریاضیات: شناسایی باگهای کد در دنیای واقعی
اگرچه توانمندی ریاضی این مدل تیتر اصلی اخبار است، اما Leanstral 1.5 از طریق قابلیتهای تأیید صحت کد، ابزاری قدرتمند برای مهندسان نرمافزار از خود نشان داده است. Mistral کاربرد عملی این مدل را با بهکارگیری آن برای اسکن ۵۷ مخزن (repository) مختلف متنباز اثبات کرد.
در این کاربرد واقعی، مدل موفق شد پنج باگ ناشناخته را شناسایی کند. یکی از کشفیات قابل توجه، یک باگ سرریز (overflow) در کتابخانه varinteger در زبان Rust بود. این توانایی در شناسایی خطاهای ظریف و پرخطر در کدهای سطح تولید (production-level)، نشان میدهد که Leanstral 1.5 میتواند به عنوان یک «بررسی سلامت» (sanity check) خودکار برای توسعهدهندگانی که با زبانهای ایمن از نظر حافظه یا زبانهای حیاتی کار میکنند، عمل کند.
دقت فنی و دسترسیپذیری
توسعه Leanstral 1.5 شامل یک خط لوله آموزشی (training pipeline) پیچیده شامل mid-training، تنظیم دقیق نظارتشده (SFT) و یادگیری تقویتی (RL) بود. این رویکرد چندمرحلهای تضمین میکند که مدل صرفاً توکن بعدی را پیشبینی نمیکند، بلکه ساختارهای منطقی زیربنایی مورد نیاز برای استدلال رسمی را درک میکند.
در اقدامی که اکوسیستم متنباز را تقویت میکند، Mistral این مدل را تحت لایسنس Apache 2.0 منتشر کرده است. این امر به توسعهدهندگان و پژوهشگران اجازه میدهد تا مدل را با کمترین محدودیت، ادغام، اصلاح و مستقر کنند. Leanstral 1.5 در حال حاضر از طریق Hugging Face و یک API رایگان در دسترس است که مانع ورود تیمهایی که به دنبال پیادهسازی تأیید صحت رسمی در گردش کار خود هستند را کاهش میدهد.
نکات کلیدی
- تعالی در بنچمارک: Leanstral 1.5 در miniF2F امتیاز ۱۰۰٪ را کسب کرد و در PutnamBench و آزمونهای جبر سطح تحصیلات تکمیلی، تقریباً از تمام رقبای متنباز خود پیشی میگیرد.
- عیبیابی عملی: این مدل توانایی خود را در یافتن آسیبپذیریهای دنیای واقعی، مانند یک باگ سرریز در یک کتابخانه Rust، در طول اسکن مخازن ثابت کرده است.
- توانمندسازی متنباز: این مدل که تحت لایسنس Apache 2.0 منتشر شده است، از طریق Hugging Face و یک API رایگان برای جامعه جهانی توسعهدهندگان بسیار در دسترس است.
