Poolside యొక్క Laguna S 2.1: చిన్న ఓపెన్-వెయిట్ మోడల్ కోడింగ్ AIని పునర్నిర్వచిస్తోంది

Poolside తన Laguna S 2.1ని విడుదల చేసింది. ఇది ఒక కాంపాక్ట్ ఓపెన్-వెయిట్ కోడింగ్ మోడల్, ఇది తనకంటే చాలా పెద్దవైన పోటీదారుల కంటే మెరుగైన పనితీరును కనబరుస్తోంది. కేవలం పారామీటర్ల సంఖ్య కంటే ఏజెంటిక్ పర్సిస్టెన్స్ (agentic persistence) మరియు రీజనింగ్‌కు ప్రాధాన్యత ఇవ్వడం ద్వారా, ఈ విడుదల ప్రత్యేకమైన LLM అభివృద్ధి పద్ధతిలో ఒక పారాడైమ్ షిఫ్ట్‌ను సూచిస్తోంది.

ట్రిలియన్-పారామీటర్ దిగ్గజాలను అధిగమిస్తోంది

మోడల్ స్కేల్ మాత్రమే తెలివితేటలకు ఏకైక మార్గం కాదని Laguna S 2.1 నిరూపిస్తోంది. దీర్ఘకాలిక టెర్మినల్ పనులను అంచనా వేసే Terminal-Bench 2.1 బెంచ్‌మార్క్‌లో, "thinking mode" ఎనేబుల్ చేసినప్పుడు ఈ మోడల్ 70.2% స్కోరు సాధించింది. ఈ పనితీరుతో ఇది Tencent యొక్క భారీ 295B-A21B Hy3 మోడల్ తర్వాతే ఉన్నప్పటికీ, DeepSeek-V4-Pro-Max మరియు Nemotron 3 Ultra వంటి చాలా పెద్ద ఓపెన్-వెయిట్ సిస్టమ్స్ కంటే ముందుంది.

Datacurve DeepSWE బెంచ్‌మార్క్‌లో ఈ వ్యత్యాసం మరింత స్పష్టంగా కనిపిస్తుంది. Laguna S 2.1 40.4% స్కోరు సాధించింది; 10% మార్కును కూడా దాటలేకపోయిన ఒక ట్రిలియన్ కంటే ఎక్కువ పారామీటర్లు కలిగిన అనేక ఓపెన్-వెయిట్ మోడల్స్‌తో పోలిస్తే ఇది అద్భుతమైన ఫలితం. ఈ మోడల్ SWE-Bench Multilingual, SWE-Bench Pro, మరియు SWE Atlas లలో కూడా అత్యుత్తమ పనితీరును కనబరుస్తూ, సంక్లిష్టమైన సాఫ్ట్‌వేర్ ఇంజనీరింగ్ వర్క్‌ఫ్లోలలో తన ఉపయోగితావాన్ని నిరూపించుకుంది.

పర్సిస్టెన్స్ మరియు "Thinking" యొక్క శక్తి

Laguna S 2.1 యొక్క ప్రధాన ప్రత్యేకత దాని "thinking mode". ఇది pass-at-one రేట్లను గణనీయంగా మెరుగుపరుస్తుంది. ఈ రీజనింగ్ స్టెప్ లేకపోతే, Terminal-Bench స్కోర్లు 70.2% నుండి 60.4%కి, మరియు DeepSWE స్కోర్లు 40.4% నుండి 16.5%కి పడిపోతాయి.

కేవలం తెలివితేటలను పెంచడం కంటే, సామర్థ్యాన్ని పెంచే "ప్రవర్తనల" (behaviors) మెరుగుదలపై తాము దృష్టి సారించామని Poolside వాదిస్తోంది. ఇందులో పెరిగిన వెరిఫికేషన్, ఊహలను నిజమని నమ్మే ధోరణిని తగ్గించడం మరియు పర్సిస్టెన్స్‌ను పెంపొందించడం వంటివి ఉన్నాయి. డాక్యుమెంట్ చేయబడిన పరీక్షల్లో, ఈ మోడల్ కేవలం 50 నిమిషాల్లో ఖాళీ ఫోల్డర్ నుండి ఒక ఫంక్షనల్ బ్రౌజర్ ఇంజిన్‌ను నిర్మించింది. అంతకంటే ఆశ్చర్యకరంగా, ఇది కేవలం 40 రీజనింగ్ స్టెప్స్‌తో మరియు కేవలం $0.088 ఖర్చుతో, 1975 నుండి పరిష్కారం కాని గణిత సమస్య అయిన Erdos Problem #397కు స్వతంత్రంగా పరిష్కారాన్ని కనుగొంది.

భారీ స్థాయిలో ఏజెంటిక్ ట్రైనింగ్

మునుపటి XS 2.1 వెర్షన్ నుండి S 2.1 కి వచ్చిన పనితీరు పెరుగుదల కొత్త ప్రీ-ట్రైనింగ్ డేటా వల్ల కాకుండా, తీవ్రమైన పోస్ట్-ట్రైనింగ్ వల్ల సాధ్యమైంది. ఏజెంటిక్ ట్రైనింగ్ దశలో 409,000 విభిన్న ఎన్విరాన్మెంట్లను ఉపయోగించారు, వీటిలో:

  • టెర్మినల్-స్పెసిఫిక్ పనుల కోసం 83,000 ఎన్విరాన్మెంట్లు.
  • సాఫ్ట్‌వేర్ ఇంజనీరింగ్ వర్క్‌ఫ్లోల కోసం 168,000 ఎన్విరాన్మెంట్లు.
  • సుమారు 17,000 రిపోజిటరీల నుండి సేకరించిన 38,000 రియల్-వరల్డ్ కమిట్లు.

ఈ ట్రైనింగ్ ప్రక్రియకు 4,096 Nvidia H200 GPUలతో కూడిన భారీ కంప్యూట్ క్లస్టర్ మద్దతునిచ్చింది. ముఖ్యంగా, S 2.1 అనేది FP8 ప్రిసిజన్‌లో రీఇన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ ఉపయోగించి శిక్షణ పొందిన ఈ సిరీస్‌లోని మొదటి మోడల్. "reward hacking"—అంటే మోడల్ ఒక పనిని పరిష్కరించడానికి బదులుగా ఇప్పటికే ఉన్న pull requests కోసం వెతకడం—ని నిరోధించడానికి, Poolside నెట్‌వర్క్ యాక్సెస్‌ను ఎంపిక చేసిన విధంగా బ్లాక్ చేసే కొత్త సాండ్‌బాక్స్ సిస్టమ్‌ను అమలు చేసింది.

అందుబాటు మరియు డిప్లాయ్‌మెంట్

Laguna S 2.1ని OpenMDW 1.1 లైసెన్స్ (Linux Foundation మద్దతుతో) కింద విడుదల చేశారు, ఇది వాణిజ్య వినియోగం, మార్పులు మరియు పునఃపంపిణీకి అనుమతిస్తుంది. డెవలపర్లు Hugging Face ద్వారా లేదా Baseten, Vercel AI Gateway మరియు OpenRouter వంటి హోస్టెడ్ సర్వీసెస్ ద్వారా ఈ మోడల్‌ను పొందవచ్చు. OpenRouter ఉచితంగా 256K కాంటెక్స్ట్ విండోను అందిస్తుంది, మరియు పెయిడ్ టియర్ (paid tier) ద్వారా ఒక మిలియన్ టోకెన్ల వరకు సపోర్ట్ చేస్తుంది.

ముఖ్య అంశాలు

  • స్కేల్ కంటే సామర్థ్యం: పర్సిస్టెన్స్ మరియు వెరిఫికేషన్ వంటి ఏజెంటిక్ ప్రవర్తనలు చిన్న మోడల్స్ కూడా ట్రిలియన్-పారామీటర్ సిస్టమ్స్ కంటే మెరుగ్గా పనిచేయగలవని Laguna S 2.1 నిరూపిస్తోంది.
  • రీజనింగ్ అత్యవసరం: సంక్లిష్టమైన పనుల కోసం "thinking mode" చాలా కీలకం, ఇది అన్ని ప్రధాన కోడింగ్ బెంచ్‌మార్క్‌లలో పనితీరును గణనీయంగా పెంచుతుంది.
  • ఏజెంటిక్ ట్రైనింగ్ విజయం: 409,000 ప్రత్యేక ఎన్విరాన్మెంట్లు మరియు రియల్-వరల్డ్ కోడ్ కమిట్ల ద్వారా జరిగిన భారీ స్థాయి పోస్ట్-ట్రైనింగ్ నుండి ఈ మోడల్ యొక్క బలం లభిస్తుంది.