Laguna S 2.1 ya Poolside: Model Ndogo ya Open-Weight Inabadilisha Maana ya AI ya Upangaji

Poolside imetoa Laguna S 2.1, model ndogo ya open-weight ya upangaji (coding) ambayo inafanya vizuri zaidi kuliko washindani wakubwa zaidi. Kwa kuweka kipaumbele kwenye uendelevu wa kiamilifu (agentic persistence) na uwezo wa kufikiri (reasoning) badala ya idadi kubwa ya vigezo (parameters), toleo hili linaashiria mabadiliko makubwa katika jinsi tunavyokabiliana na maendeleo ya LLM maalum.

Inafanya Vizuri Zaidi Kuliko Majitu yenye Trillion ya Parameters

Laguna S 2.1 inaonyesha kuwa ukubwa wa model si njia pekee ya kupata akili. Katika kipimo cha Terminal-Bench 2.1, ambacho hutathmini kazi za terminal zinazoendelea kwa muda mrefu, model hiyo ilipata alama ya 70.2% wakati "thinking mode" inapowashwa. Utendaji huu unaiweka moja kwa moja nyuma ya model kubwa ya Hy3 ya Tencent (295B-A21B), lakini mbele ya mifumo mikubwa zaidi ya open-weights kama DeepSeek-V4-Pro-Max na Nemotron 3 Ultra.

Tofauti hiyo inakuwa wazi zaidi katika kipimo cha Datacurve DeepSWE. Laguna S 2.1 ilipata alama ya 40.4%, matokeo ya kushangaza ikilinganishwa na model kadhaa za open-weight zenye zaidi ya trilioni moja ya parameters ambazo zilishindwa kufikia alama ya 10%. Model hiyo pia inaonyesha utendaji wa hali ya juu katika SWE-Bench Multilingual, SWE-Bench Pro, na SWE Atlas, ikithibitisha manufaa yake katika michakato tata ya uhandisi wa programu (software engineering workflows).

Nguvu ya Uendelevu na "Kufikiri"

Kipengele muhimu kinachoitofautisha Laguna S 2.1 ni "thinking mode" yake, ambayo inaboresha kwa kiasi kikubwa viwango vya pass-at-one. Bila hatua hii ya kufikiri (reasoning), alama za Terminal-Bench zinashuka kutoka 70.2% hadi 60.4%, na alama za DeepSWE zinashuka kutoka 40.4% hadi 16.5%.

Poolside inadai kuwa badala ya kuongeza tu akili, wamejikita katika kuboresha "tabia" (behaviors) zinazopelekea uwezo. Hii inajumuisha kuongeza uhakiki (verification), kupunguza tabia ya kuchukulia dhana fulani kama ukweli bila kuhakiki, na kukuza uendelevu. Katika majaribio yaliyorekodiwa, model hiyo ilijenga injini ya kivinjari (browser engine) inayofanya kazi kutoka kwenye folda tupu ndani ya dakika 50 tu. Jambo la kushangaza zaidi, iligundua upya suluhisho la Erdos Problem #397—tatizo la hisabati ambalo halijajibiwa tangu 1975—ikitumia hatua 40 tu za kufikiri na gharama ya dola $0.088 pekee.

Mafunzo ya Kiamilifu (Agentic Training) kwa Kiwango Kikubwa

Hatua kubwa ya utendaji kutoka toleo la awali la XS 2.1 hadi S 2.1 ilichochewa na mafunzo makali ya baada ya mafunzo (post-training) badala ya data mpya ya mafunzo ya awali (pre-training). Awamu ya mafunzo ya kiamilifu (agentic training) ilitumia mazingira 409,000 tofauti, ikiwa ni pamoja na:

  • 83,000 mazingira kwa kazi maalum za terminal.
  • 168,000 mazingira kwa michakato ya uhandisi wa programu.
  • 38,000 commits za ulimwengu halisi kutoka kwa takriban repositari 17,000.

Mchakato huu wa mafunzo uliungwa mkono na kundi kubwa la kompyuta (compute cluster) la Nvidia H200 GPUs 4,096. Inashangaza kwamba, S 2.1 ndiyo model ya kwanza katika mfululizo huu iliyofundishwa kwa kutumia reinforcement learning katika FP8 precision. Ili kuzuia "reward hacking"—ambapo model inaweza kutafuta pull requests zilizopo badala ya kutatua kazi—Poolside ilitekeleza mfumo mpya wa sandbox ili kuzuia ufikiaji wa mtandao kwa kuchagua.

Upatikanaji na Usambazaji

Laguna S 2.1 imetolewa chini ya leseni ya OpenMDW 1.1 (inayoungwa mkono na Linux Foundation), ikiruhusu matumizi ya kibiashara, marekebisho, na usambazaji upya. Watengenezaji wanaweza kupata model hii kupitia Hugging Face, au kupitia huduma zinazohifadhiwa kama Baseten, Vercel AI Gateway, na OpenRouter. OpenRouter inatoa dirisha la muktadha (context window) kubwa la 256K bure, huku kiwango cha kulipia kikisaidia hadi token milioni moja.

Mambo Muhimu ya Kuzingatia

  • Ufanisi badala ya Ukubwa: Laguna S 2.1 inathibitisha kuwa tabia za kiamilifu kama uendelevu na uhakiki zinaweza kuruhusu model ndogo kufanya vizuri zaidi kuliko mifumo yenye trilioni ya parameters.
  • Uwezo wa Kufikiri ni Muhimu: "Thinking mode" ni muhimu kwa kazi tata, ikiongeza utendaji kwa kiasi kikubwa katika vipimo vyote vikuu vya upangaji.
  • Mafanikio ya Mafunzo ya Kiamilifu: Nguvu ya model inatokana na mafunzo makubwa ya baada ya mafunzo (post-training) katika mazingira 409,000 maalum na commits za kodi za ulimwengu halisi.