Mistral Yatoa Leanstral 1.5: Hatua Kubwa katika Hisabati Rasmi na Uhakiki wa Msimbo
Mistral AI imezindua rasmi Leanstral 1.5, modeli yenye nguvu ya chanzo huru (open-source) iliyoundwa mahususi kwa ajili ya uhakiki rasmi (formal verification) kwa kutumia lugha ya programu ya Lean 4. Kwa kufanya ubingwa katika ukali wa ushahidi wa hisabati na usahihi wa programu, modeli hii inaashiria hatua kubwa mbele katika manufaa ya AI ya chanzo huru kwa mazingira ya kiufundi yenye hatari kubwa.
Kutawala Viwango vya Upimaji vya Hisabati Rasmi
Leanstral 1.5 imeundwa kushughulikia mantiki tata inayohitajika na Lean 4, lugha iliyojengwa kwa ajili ya kuhakiki ushahidi wa hisabati na uaminifu wa programu. Utendaji wa modeli hii kwenye viwango maalum vya upimaji (benchmarks) ni wa ajabu sana. Imepata alama kamili ya asilimia 100 kwenye miniF2F, kiwango cha upimaji kinachohusisha hisabati ya kiwango cha shule ya upili hadi ugumu mkubwa wa olimpiadi za hisabati.
Inapofanyiwa majaribio dhidi ya PutnamBench—mkusanyiko wa matatizo 672 kutoka mashindano maarufu ya hisabati ya Putnam—Leanstral 1.5 imefanikiwa kutatua matatizo 587. Utendaji huu inaiweka katika nafasi ya juu katika uwanja wa chanzo huru, ikifuata tu Aleph Prover ambayo ni chanzo huru (closed-source). Aidha, modeli hiyo ilionyesha ubingwa katika hisabati ya kiwango cha uzamili katika aljebra, ikipata asilimia 87 kwenye kiwango cha upimaji cha FATE-H na asilimia 34 kwenye FATE-X, ambavyo vinahusisha mada za juu kama nadharia ya kikundi (group theory) na nadharia ya pete (ring theory).
Zaidi ya Hisabati: Ugunduzi wa Hitilafu za Msimbo katika Ulimwengu Halisi
Ingawa uwezo wake wa kihisabati ndio kichwa cha habari, Leanstral 1.5 inathibitika kuwa chombo chenye nguvu kwa wahandisi wa programu kupitia uwezo wake wa uhakiki wa msimbo. Mistral ilionyesha manufaa ya vitendo ya modeli hiyo kwa kuitumia kukagua ghala (repositories) 57 tofauti za chanzo huru.
Katika matumizi haya ya ulimwengu halisi, modeli hiyo ilifanikiwa kutambua hitilafu (bugs) tano ambazo hazikujulikana hapo awali. Ugunduzi mmoja muhimu ulikuwa ni hitilafu ya overflow iliyopatikana ndani ya maktaba ya varinteger ya Rust. Uwezo huu wa kunasa makosa madogo yenye madhara makubwa katika msimbo wa kiwango cha uzalishaji (production-level code) unaashiria kuwa Leanstral 1.5 inaweza kutumika kama "sanity check" ya kiotomatiki kwa watengenezaji wanaofanya kazi katika lugha zinazozingatia usalama wa kumbukumbu (memory-safe) au lugha muhimu sana (mission-critical).
Ukali wa Kiufundi na Upatikanaji
Maendeleo ya Leanstral 1.5 yalihusisha mchakato tata wa mafunzo ulioundwa na mid-training, supervised fine-tuning (SFT), na reinforcement learning (RL). Mbinu hii ya hatua nyingi inahakikisha kuwa modeli haitabiri tu neno linalofuata (token) bali inaelewa miundo ya kimantiki inayohitajika kwa ufikiri rasmi.
Katika hatua inayolijenga mfumo wa chanzo huru, Mistral imetoa modeli hiyo chini ya leseni ya Apache 2.0. Hii inaruhusu watengenezaji na watafiti kuunganisha, kurekebisha, na kutumia modeli hiyo kwa vizuizi vichache sana. Leanstral 1.5 kwa sasa inapatikana kupitia Hugging Face na kupitia API ya bure, ikipunguza vikwazo kwa timu zinazotafuta kutekeleza uhakiki rasmi katika mifumo yao ya kazi.
Mambo Muhimu ya Kuzingatia
- Ubora wa Viwango vya Upimaji: Leanstral 1.5 ilipata alama ya 100% kwenye miniF2F na inashinda karibu washindani wote wa chanzo huru kwenye PutnamBench na majaribio ya aljebra ya kiwango cha uzamili.
- Urekebishaji wa Hitilafu wa Vitendo: Modeli imethibitisha uwezo wake wa kupata udhaifu wa ulimwengu halisi, kama vile hitilafu ya overflow katika maktaba ya Rust, wakati wa ukaguzi wa ghala (repository scans).
- Uwezeshaji wa Chanzo Huru: Imeachiliwa chini ya leseni ya Apache 2.0, modeli hii inapatikana kwa urahisi kupitia Hugging Face na API ya bure kwa jamii ya watengenezaji duniani kote.
