Mistral مدل Leanstral 1.5 را منتشر کرد: پیشرفتی بزرگ در ریاضیات رسمی و تأیید صحت کد

Mistral AI به‌طور رسمی Leanstral 1.5 را عرضه کرد؛ یک مدل متن‌باز قدرتمند که به‌طور اختصاصی برای تأیید صحت رسمی (formal verification) با استفاده از زبان برنامه‌نویسی Lean 4 طراحی شده است. این مدل با تسلط بر دقتِ اثبات‌های ریاضی و صحت نرم‌افزاری، جهشی بزرگ در کاربرد هوش مصنوعی متن‌باز برای محیط‌های فنی حساس و حیاتی محسوب می‌شود.

تسلط بر بنچمارک‌های ریاضیات رسمی

Leanstral 1.5 برای پیمایش در منطق پیچیده مورد نیاز Lean 4 طراحی شده است؛ زبانی که برای تأیید اثبات‌های ریاضی و قابلیت اطمینان نرم‌افزار ساخته شده است. عملکرد این مدل در بنچمارک‌های تخصصی فوق‌العاده است. این مدل در miniF2F، بنچمارکی که از سطح ریاضیات دبیرستان تا سطح دشوار المپیادهای ریاضی را پوشش می‌دهد، امتیاز کامل ۱۰۰ درصد را کسب کرد.

هنگام آزمایش در برابر PutnamBench — مجموعه‌ای شامل ۶۷۲ مسئله از مسابقات معتبر ریاضی Putnam — مدل Leanstral 1.5 موفق شد ۵۸۷ مسئله را حل کند. این عملکرد، آن را در صدر حوزه مدل‌های متن‌باز قرار می‌دهد و تنها مدل بسته-منبع Aleph Prover از آن پیشی دارد. علاوه بر این، این مدل تسلط خود را بر ریاضیات سطح تحصیلات تکمیلی در جبر نشان داد و در بنچمارک FATE-H امتیاز ۸۷ درصد و در FATE-X امتیاز ۳۴ درصد را کسب کرد که مباحث پیشرفته‌ای مانند نظریه گروه‌ها و حلقه‌ها را پوشش می‌دهند.

فراتر از ریاضیات: شناسایی باگ‌های کد در دنیای واقعی

اگرچه توانمندی ریاضی این مدل تیتر اصلی اخبار است، اما Leanstral 1.5 از طریق قابلیت‌های تأیید صحت کد، ابزاری قدرتمند برای مهندسان نرم‌افزار از خود نشان داده است. Mistral کاربرد عملی این مدل را با به‌کارگیری آن برای اسکن ۵۷ مخزن (repository) مختلف متن‌باز اثبات کرد.

در این کاربرد واقعی، مدل موفق شد پنج باگ ناشناخته را شناسایی کند. یکی از کشفیات قابل توجه، یک باگ سرریز (overflow) در کتابخانه varinteger در زبان Rust بود. این توانایی در شناسایی خطاهای ظریف و پرخطر در کدهای سطح تولید (production-level)، نشان می‌دهد که Leanstral 1.5 می‌تواند به عنوان یک «بررسی سلامت» (sanity check) خودکار برای توسعه‌دهندگانی که با زبان‌های ایمن از نظر حافظه یا زبان‌های حیاتی کار می‌کنند، عمل کند.

دقت فنی و دسترسی‌پذیری

توسعه Leanstral 1.5 شامل یک خط لوله آموزشی (training pipeline) پیچیده شامل mid-training، تنظیم دقیق نظارت‌شده (SFT) و یادگیری تقویتی (RL) بود. این رویکرد چندمرحله‌ای تضمین می‌کند که مدل صرفاً توکن بعدی را پیش‌بینی نمی‌کند، بلکه ساختارهای منطقی زیربنایی مورد نیاز برای استدلال رسمی را درک می‌کند.

در اقدامی که اکوسیستم متن‌باز را تقویت می‌کند، Mistral این مدل را تحت لایسنس Apache 2.0 منتشر کرده است. این امر به توسعه‌دهندگان و پژوهشگران اجازه می‌دهد تا مدل را با کمترین محدودیت، ادغام، اصلاح و مستقر کنند. Leanstral 1.5 در حال حاضر از طریق Hugging Face و یک API رایگان در دسترس است که مانع ورود تیم‌هایی که به دنبال پیاده‌سازی تأیید صحت رسمی در گردش کار خود هستند را کاهش می‌دهد.

نکات کلیدی

  • تعالی در بنچمارک: Leanstral 1.5 در miniF2F امتیاز ۱۰۰٪ را کسب کرد و در PutnamBench و آزمون‌های جبر سطح تحصیلات تکمیلی، تقریباً از تمام رقبای متن‌باز خود پیشی می‌گیرد.
  • عیب‌یابی عملی: این مدل توانایی خود را در یافتن آسیب‌پذیری‌های دنیای واقعی، مانند یک باگ سرریز در یک کتابخانه Rust، در طول اسکن مخازن ثابت کرده است.
  • توانمندسازی متن‌باز: این مدل که تحت لایسنس Apache 2.0 منتشر شده است، از طریق Hugging Face و یک API رایگان برای جامعه جهانی توسعه‌دهندگان بسیار در دسترس است.