Mistral เปิดตัว Leanstral 1.5: ก้าวกระโดดครั้งสำคัญในการพิสูจน์คณิตศาสตร์เชิงรูปแบบและการตรวจสอบความถูกต้องของโค้ด

Mistral AI ได้เปิดตัว Leanstral 1.5 อย่างเป็นทางการ ซึ่งเป็นโมเดลโอเพนซอร์สทรงพลังที่ได้รับการออกแบบมาโดยเฉพาะสำหรับการตรวจสอบความถูกต้องเชิงรูปแบบ (formal verification) โดยใช้ภาษาโปรแกรม Lean 4 ด้วยความสามารถในการเชี่ยวชาญความเข้มงวดของการพิสูจน์ทางคณิตศาสตร์และความถูกต้องของซอฟต์แวร์ โมเดลนี้จึงถือเป็นก้าวกระโดดครั้งสำคัญในการนำ AI แบบโอเพนซอร์สมาใช้ในสภาพแวดล้อมทางเทคนิคที่มีความสำคัญสูง

ครองความเป็นหนึ่งในเกณฑ์มาตรฐานคณิตศาสตร์เชิงรูปแบบ

Leanstral 1.5 ถูกออกแบบมาเพื่อจัดการกับตรรกะที่ซับซ้อนซึ่งจำเป็นสำหรับ Lean 4 ซึ่งเป็นภาษาที่สร้างขึ้นเพื่อตรวจสอบการพิสูจน์ทางคณิตศาสตร์และความน่าเชื่อถือของซอฟต์แวร์ ประสิทธิภาพของโมเดลบนเกณฑ์มาตรฐาน (benchmark) เฉพาะทางนั้นถือว่ายอดเยี่ยมอย่างยิ่ง โดยสามารถทำคะแนนได้เต็ม 100 เปอร์เซ็นต์ใน miniF2F ซึ่งเป็นเกณฑ์มาตรฐานที่มีระดับตั้งแต่คณิตศาสตร์ระดับมัธยมปลายไปจนถึงโจทย์คณิตศาสตร์โอลิมปิกที่มีความยากระดับสูง

เมื่อทดสอบกับ PutnamBench ซึ่งเป็นชุดโจทย์ 672 ข้อจากการแข่งขันคณิตศาสตร์ Putnam อันทรงเกียรติ Leanstral 1.5 สามารถแก้โจทย์ได้สำเร็จถึง 587 ข้อ ประสิทธิภาพนี้ทำให้มันขึ้นสู่จุดสูงสุดในกลุ่มโอเพนซอร์ส โดยเป็นรองเพียง Aleph Prover ซึ่งเป็นโมเดลแบบปิดเท่านั้น นอกจากนี้ โมเดลยังแสดงให้เห็นถึงความเชี่ยวชาญในคณิตศาสตร์ระดับบัณฑิตศึกษาในสาขาพีชคณิต (algebra) โดยทำคะแนนได้ 87 เปอร์เซ็นต์ในเกณฑ์มาตรฐาน FATE-H และ 34 เปอร์เซ็นต์ใน FATE-X ซึ่งครอบคลุมหัวข้อขั้นสูงอย่างทฤษฎีกรุป (group theory) และทฤษฎีริง (ring theory)

เหนือกว่าคณิตศาสตร์: การตรวจจับบั๊กในโค้ดจากการใช้งานจริง

แม้ว่าความสามารถทางคณิตศาสตร์จะเป็นจุดเด่นหลัก แต่ Leanstral 1.5 ยังพิสูจน์ให้เห็นว่าเป็นเครื่องมือที่ทรงพลังสำหรับวิศวกรซอฟต์แวร์ผ่านความสามารถในการตรวจสอบความถูกต้องของโค้ด โดย Mistral ได้แสดงให้เห็นถึงประโยชน์ในการใช้งานจริงด้วยการนำโมเดลไปใช้สแกนคลังเก็บซอร์สโค้ด (repository) แบบโอเพนซอร์สที่แตกต่างกันถึง 57 แห่ง

ในการใช้งานจริงนี้ โมเดลสามารถระบุบั๊กที่ไม่เคยถูกค้นพบมาก่อนได้ถึง 5 รายการ หนึ่งในการค้นพบที่สำคัญคือบั๊กประเภท overflow ที่อยู่ในไลบรารี varinteger ของภาษา Rust ความสามารถในการตรวจจับข้อผิดพลาดที่ซับซ้อนและส่งผลกระทบรุนแรงในโค้ดระดับใช้งานจริง (production-level) นี้ บ่งชี้ว่า Leanstral 1.5 สามารถทำหน้าที่เป็น "การตรวจสอบความถูกต้องเบื้องต้น" (sanity check) แบบอัตโนมัติสำหรับนักพัฒนาที่ทำงานกับภาษาที่มีความปลอดภัยด้านหน่วยความจำ (memory-safe) หรือภาษาที่ใช้ในภารกิจสำคัญ (mission-critical)

ความเข้มงวดทางเทคนิคและการเข้าถึงได้ง่าย

การพัฒนา Leanstral 1.5 เกี่ยวข้องกับกระบวนการฝึกฝน (training pipeline) ที่ซับซ้อน ซึ่งประกอบด้วย mid-training, การปรับจูนแบบมีการสอน (supervised fine-tuning หรือ SFT) และการเรียนรู้แบบเสริมกำลัง (reinforcement learning หรือ RL) แนวทางแบบหลายขั้นตอนนี้ช่วยให้มั่นใจได้ว่าโมเดลจะไม่เพียงแค่ทำนายโทเคน (token) ถัดไป แต่จะเข้าใจโครงสร้างทางตรรกะที่เป็นพื้นฐานซึ่งจำเป็นสำหรับการใช้เหตุผลเชิงรูปแบบ

เพื่อเป็นการเสริมสร้างระบบนิเวศแบบโอเพนซอร์ส Mistral ได้ปล่อยโมเดลนี้ภายใต้ใบอนุญาต Apache 2.0 ซึ่งช่วยให้นักพัฒนาและนักวิจัยสามารถนำโมเดลไปรวม ปรับเปลี่ยน และใช้งานได้โดยมีข้อจำกัดน้อยที่สุด ปัจจุบัน Leanstral 1.5 พร้อมใช้งานผ่าน Hugging Face และผ่าน API ฟรี ซึ่งช่วยลดอุปสรรคในการเข้าถึงสำหรับทีมที่ต้องการนำการตรวจสอบความถูกต้องเชิงรูปแบบไปใช้ในกระบวนการทำงาน

สรุปประเด็นสำคัญ

  • ความเป็นเลิศด้านเกณฑ์มาตรฐาน: Leanstral 1.5 ทำคะแนนได้ 100% ใน miniF2F และมีประสิทธิภาพเหนือกว่าคู่แข่งแบบโอเพนซอร์สเกือบทั้งหมดใน PutnamBench และการทดสอบพีชคณิตระดับบัณฑิตศึกษา
  • การแก้บั๊กที่ใช้งานได้จริง: โมเดลได้พิสูจน์ความสามารถในการค้นหาช่องโหว่ในโลกแห่งความเป็นจริง เช่น บั๊ก overflow ในไลบรารี Rust ระหว่างการสแกน repository
  • การเสริมพลังให้โอเพนซอร์ส: ด้วยการปล่อยภายใต้ใบอนุญาต Apache 2.0 โมเดลนี้จึงเข้าถึงได้ง่ายมากผ่าน Hugging Face และ API ฟรี สำหรับชุมชนนักพัฒนาทั่วโลก