Mistral প্রকাশ করল Leanstral 1.5: ফরমাল ম্যাথ এবং কোড ভেরিফিকেশনে এক যুগান্তকারী সাফল্য

Mistral AI আনুষ্ঠানিকভাবে Leanstral 1.5 লঞ্চ করেছে, যা Lean 4 প্রোগ্রামিং ল্যাঙ্গুয়েজ ব্যবহার করে ফরমাল ভেরিফিকেশনের জন্য বিশেষভাবে তৈরি একটি শক্তিশালী ওপেন-সোর্স মডেল। গাণিতিক প্রমাণ এবং সফটওয়্যারের নির্ভুলতার জটিলতা আয়ত্ত করার মাধ্যমে, এই মডেলটি উচ্চ-ঝুঁকিপূর্ণ টেকনিক্যাল পরিবেশে ওপেন-সোর্স AI-এর উপযোগিতায় একটি উল্লেখযোগ্য অগ্রগতি নির্দেশ করে।

ফরমাল ম্যাথমেটিক্স বেঞ্চমার্কে আধিপত্য

Leanstral 1.5 এমনভাবে ডিজাইন করা হয়েছে যাতে এটি Lean 4-এর প্রয়োজনীয় জটিল লজিকগুলো পরিচালনা করতে পারে, যা গাণিতিক প্রমাণ এবং সফটওয়্যার নির্ভরযোগ্যতা যাচাই করার জন্য তৈরি একটি ভাষা। বিশেষায়িত বেঞ্চমার্কে মডেলটির পারফরম্যান্স অসাধারণ। এটি miniF2F-এ ১০০ শতাংশ স্কোর অর্জন করেছে, যা হাই স্কুল পর্যায়ের গণিত থেকে শুরু করে গণিত অলিম্পিয়াডের মতো অত্যন্ত কঠিন পর্যায়ের সমস্যা কভার করে।

মর্যাদাপূর্ণ Putnam গণিত প্রতিযোগিতা থেকে সংগৃহীত ৬৭২টি সমস্যার একটি সংগ্রহ হলো PutnamBench; সেখানে পরীক্ষা করার সময় Leanstral 1.5 সফলভাবে ৫৮৭টি সমস্যার সমাধান করেছে। এই পারফরম্যান্স এটিকে ওপেন-সোর্স ক্ষেত্রে শীর্ষে নিয়ে এসেছে, যেখানে এটি শুধুমাত্র ক্লোজড-সোর্স Aleph Prover-এর চেয়ে কিছুটা পিছিয়ে রয়েছে। তদুপরি, মডেলটি বীজগণিতের (algebra) গ্রাজুয়েট-লেভেল গণিতে দক্ষতা প্রদর্শন করেছে, যেখানে এটি FATE-H বেঞ্চমার্কে ৮৭ শতাংশ এবং FATE-X বেঞ্চমার্কে ৩৪ শতাংশ স্কোর করেছে, যা গ্রুপ এবং রিং থিওরির মতো উন্নত বিষয়গুলো কভার করে।

গণিতের বাইরে: বাস্তব জগতের কোড বাগ শনাক্তকরণ

যদিও এর গাণিতিক দক্ষতা মূল আকর্ষণ, তবে Leanstral 1.5 তার কোড ভেরিফিকেশন ক্ষমতার মাধ্যমে সফটওয়্যার ইঞ্জিনিয়ারদের জন্য একটি শক্তিশালী হাতিয়ার হিসেবে প্রমাণিত হয়েছে। Mistral ৫৭টি ভিন্ন ভিন্ন ওপেন-সোর্স রিপোজিটরি স্ক্যান করার মাধ্যমে মডেলটির ব্যবহারিক উপযোগিতা প্রদর্শন করেছে।

এই বাস্তব প্রয়োগে, মডেলটি সফলভাবে পাঁচটি আগে অজানা বাগ (bug) শনাক্ত করেছে। একটি উল্লেখযোগ্য আবিষ্কার ছিল varinteger Rust লাইব্রেরির মধ্যে থাকা একটি ওভারফ্লো বাগ। প্রোডাকশন-লেভেল কোডে সূক্ষ্ম এবং উচ্চ-ফলপ্রসূ ত্রুটি ধরার এই ক্ষমতা নির্দেশ করে যে, Leanstral 1.5 মেমরি-সেফ বা মিশন-ক্রিটিক্যাল ল্যাঙ্গুয়েজে কাজ করা ডেভেলপারদের জন্য একটি স্বয়ংক্রিয় "sanity check" হিসেবে কাজ করতে পারে।

প্রযুক্তিগত কঠোরতা এবং সহজলভ্যতা

Leanstral 1.5-এর উন্নয়নে একটি উন্নত ট্রেনিং পাইপলাইন ব্যবহার করা হয়েছে, যার মধ্যে রয়েছে mid-training, supervised fine-tuning (SFT), এবং reinforcement learning (RL)। এই বহুমুখী পদ্ধতিটি নিশ্চিত করে যে মডেলটি কেবল পরবর্তী টোকেনটি অনুমান করে না, বরং ফরমাল রিজনিংয়ের জন্য প্রয়োজনীয় অন্তর্নিহিত লজিক্যাল স্ট্রাকচারগুলোও বুঝতে পারে।

ওপেন-সোর্স ইকোসিস্টেমকে শক্তিশালী করতে Mistral এই মডেলটি Apache 2.0 লাইসেন্সের অধীনে প্রকাশ করেছে। এটি ডেভেলপার এবং গবেষকদের ন্যূনতম বিধিনিষেধের সাথে মডেলটি ইন্টিগ্রেট, মডিফাই এবং ডেপ্লয় করার সুযোগ দেয়। Leanstral 1.5 বর্তমানে Hugging Face এবং একটি ফ্রি API-এর মাধ্যমে পাওয়া যাচ্ছে, যা তাদের কাজের ক্ষেত্রে ফরমাল ভেরিফিকেশন প্রয়োগ করতে ইচ্ছুক দলগুলোর জন্য প্রবেশাধিকার সহজ করে দিচ্ছে।

মূল বিষয়সমূহ

  • বেঞ্চমার্কে শ্রেষ্ঠত্ব: Leanstral 1.5 miniF2F-এ ১০০% স্কোর অর্জন করেছে এবং PutnamBench ও গ্রাজুয়েট-লেভেল অ্যালজেব্রা টেস্টে প্রায় সব ওপেন-সোর্স প্রতিযোগীকে ছাড়িয়ে গেছে।
  • ব্যবহারিক ডিবাগিং: রিপোজিটরি স্ক্যান করার সময় মডেলটি একটি Rust লাইব্রেরিতে ওভারফ্লো বাগের মতো বাস্তব জগতের দুর্বলতা খুঁজে পাওয়ার ক্ষমতা প্রমাণ করেছে।
  • ওপেন-সোর্স ক্ষমতায়ন: Apache 2.0 লাইসেন্সের অধীনে মুক্তি পাওয়া এই মডেলটি বিশ্বব্যাপী ডেভেলপার কমিউনিটির জন্য Hugging Face এবং একটি ফ্রি API-এর মাধ্যমে অত্যন্ত সহজলভ্য।