Poolside-இன் Laguna S 2.1: சிறிய Open-Weight மாடல் கோடிங் AI-ஐ மறுவரையறை செய்கிறது

Poolside நிறுவனம் Laguna S 2.1-ஐ வெளியிட்டுள்ளது. இது ஒரு சிறிய (compact) open-weight கோடிங் மாடலாகும், இது தன்னை விடப் பல மடங்கு பெரிய போட்டியாளர்களை விடச் சிறப்பாகச் செயல்படுகிறது. வெறும் அளவுருக்களின் (parameter count) எண்ணிக்கையை விட, ஏஜென்டிக் விடாமுயற்சி (agentic persistence) மற்றும் பகுத்தறிவுக்கு (reasoning) முன்னுரிமை அளிப்பதன் மூலம், இந்த வெளியீடு சிறப்பு வாய்ந்த LLM மேம்பாட்டு அணுகுமுறையில் ஒரு பாரடைம் ஷிஃப்ட்டை (paradigm shift) உணர்த்துகிறது.

டிரில்லியன்-பாராமீட்டர் மாபெரும் மாடல்களை விடச் சிறந்து விளங்குகிறது

மாடலின் அளவு மட்டுமே புத்திசாலித்தனத்திற்கான ஒரே வழி அல்ல என்பதை Laguna S 2.1 நிரூபித்துக் கொண்டிருக்கிறது. நீண்ட நேரம் இயங்கும் டெர்மினல் பணிகளை மதிப்பிடும் Terminal-Bench 2.1 பெஞ்ச்மார்க்கில், "thinking mode" செயல்படுத்தப்படும்போது இந்த மாடல் 70.2% மதிப்பெண்ணைப் பெற்றுள்ளது. இந்தச் செயல்பாடு, Tencent-இன் பிரம்மாண்டமான 295B-A21B Hy3 மாடலுக்கு அடுத்தபடியாக இருந்தாலும், DeepSeek-V4-Pro-Max மற்றும் Nemotron 3 Ultra போன்ற மிகப் பெரிய open-weights அமைப்புகளை விட முன்னிலையில் உள்ளது.

Datacurve DeepSWE பெஞ்ச்மார்க்கில் இந்த வேறுபாடு இன்னும் தெளிவாகத் தெரிகிறது. Laguna S 2.1 40.4% மதிப்பெண் பெற்றுள்ளது; இது ஒரு டிரில்லியனுக்கும் அதிகமான பாராமீட்டர்களைக் கொண்ட பல open-weight மாடல்கள் 10% மதிப்பெண்ணைத் தாண்டத் தவறிய நிலையில், ஒரு வியக்கத்தக்க முடிவாகும். மேலும், SWE-Bench Multilingual, SWE-Bench Pro மற்றும் SWE Atlas ஆகியவற்றிலும் இந்த மாடல் சிறந்த செயல்திறனை வெளிப்படுத்துகிறது, இது சிக்கலான மென்பொருள் பொறியியல் பணிப்பாய்வுகளில் (workflows) அதன் பயன்பாட்டை நிரூபிக்கிறது.

விடாமுயற்சி மற்றும் "சிந்தனை"யின் (Thinking) ஆற்றல்

Laguna S 2.1-இன் முக்கிய சிறப்பம்சமே அதன் "thinking mode" தான், இது pass-at-one விகிதங்களை வியத்தகு முறையில் மேம்படுத்துகிறது. இந்த பகுத்தறிவுப் படி (reasoning step) இல்லையென்றால், Terminal-Bench மதிப்பெண்கள் 70.2%-லிருந்து 60.4%-ஆகவும், DeepSWE மதிப்பெண்கள் 40.4%-லிருந்து 16.5%-ஆகவும் வீழ்ச்சியடைகின்றன.

வெறும் புத்திசாலித்தனத்தை அதிகரிப்பதற்குப் பதிலாக, திறனைத் தரும் "நடத்தைகளை" (behaviors) மேம்படுத்துவதில் தாங்கள் கவனம் செலுத்தியுள்ளதாக Poolside கூறுகிறது. இதில் அதிகரித்த சரிபார்ப்பு (verification), அனுமானங்களை அப்படியே ஏற்றுக்கொள்வதைக் குறைத்தல் மற்றும் விடாமுயற்சியை வளர்த்தல் ஆகியவை அடங்கும். ஆவணப்படுத்தப்பட்ட சோதனைகளில், இந்த மாடல் ஒரு காலியான ஃபோல்டரிலிருந்து (empty folder) வெறும் 50 நிமிடங்களில் ஒரு செயல்பாட்டு பிரவுசர் என்ஜினை (functional browser engine) உருவாக்கியது. இன்னும் வியக்கத்தக்க வகையில், 1975 முதல் தீர்க்கப்படாத கணிதப் பிரச்சனையான Erdos Problem #397-க்கான தீர்வை, வெறும் 40 பகுத்தறிவுப் படிகள் மற்றும் 0.088 டாலர் செலவில் இது சுயமாகக் கண்டறிந்தது.

பெரிய அளவிலான ஏஜென்டிக் பயிற்சி (Agentic Training)

முந்தைய XS 2.1 பதிப்பிலிருந்து S 2.1 பதிப்பிற்கு ஏற்பட்ட செயல்திறன் உயர்வு, புதிய pre-training தரவுகளால் அல்லாமல், தீவிரமான post-training மூலம் சாத்தியமானது. ஏஜென்டிக் பயிற்சி நிலையில் 409,000 தனித்துவமான சூழல்கள் (environments) பயன்படுத்தப்பட்டன, அவற்றில்:

  • 83,000 டெர்மினல் சார்ந்த பணிகளுக்கான சூழல்கள்.
  • 168,000 மென்பொருள் பொறியியல் பணிப்பாய்வுகளுக்கான சூழல்கள்.
  • சுமார் 17,000 களஞ்சியங்களிலிருந்து (repositories) பெறப்பட்ட 38,000 நிஜ உலக கமிட்கள் (real-world commits).

இந்த பயிற்சி செயல்முறை 4,096 Nvidia H200 GPUs கொண்ட ஒரு பிரம்மாண்டமான கம்ப்யூட் கிளஸ்டரால் (compute cluster) ஆதரிக்கப்பட்டது. குறிப்பிடத்தக்க வகையில், S 2.1 தொடரில் FP8 துல்லியத்தில் (precision) reinforcement learning மூலம் பயிற்சி அளிக்கப்பட்ட முதல் மாடல் இதுவாகும். "reward hacking" எனப்படும் சிக்கலைத் தவிர்க்க—அதாவது ஒரு மாடல் ஒரு பணியைத் தீர்ப்பதற்குப் பதிலாக ஏற்கனவே உள்ள pull requests-களைத் தேடக்கூடும்—நெட்வொர்க் அணுகலைத் தேர்ந்தெடுத்துத் தடுப்பதற்கான ஒரு புதிய சாண்ட்பாக்ஸ் (sandbox) அமைப்பை Poolside செயல்படுத்தியுள்ளது.

அணுகல் மற்றும் பயன்பாடு (Deployment)

Laguna S 2.1 ஆனது OpenMDW 1.1 உரிமத்தின் கீழ் (Linux Foundation ஆதரவுடன்) வெளியிடப்பட்டுள்ளது, இது வணிக ரீதியான பயன்பாடு, மாற்றம் மற்றும் மறுவிநியோகத்திற்கு அனுமதிக்கிறது. டெவலப்பர்கள் Hugging Face மூலமாகவோ அல்லது Baseten, Vercel AI Gateway மற்றும் OpenRouter போன்ற ஹோஸ்டட் சேவைகள் மூலமாகவோ இந்த மாடலை அணுகலாம். OpenRouter இலவசமாக 256K context window-வை வழங்குகிறது, மேலும் கட்டணத் திட்டத்தில் (paid tier) ஒரு மில்லியன் டோக்கன்கள் வரை ஆதரிக்கப்படுகிறது.

முக்கியக் குறிப்புகள்

  • அளவை விட செயல்திறன்: விடாமுயற்சி மற்றும் சரிபார்ப்பு போன்ற ஏஜென்டிக் நடத்தைகள், சிறிய மாடல்களும் டிரில்லியன்-பாராமீட்டர் அமைப்புகளை விடச் சிறப்பாகச் செயல்பட உதவும் என்பதை Laguna S 2.1 நிரூபிக்கிறது.
  • பகுத்தறிவு அவசியம்: சிக்கலான பணிகளுக்கு "thinking mode" மிகவும் முக்கியமானது, இது அனைத்து முக்கிய கோடிங் பெஞ்ச்மார்க்குகளிலும் செயல்திறனை கணிசமாக உயர்த்துகிறது.
  • ஏஜென்டிக் பயிற்சியின் வெற்றி: 409,000 சிறப்பு சூழல்கள் மற்றும் நிஜ உலக கோட் கமிட்கள் (code commits) மூலம் மேற்கொள்ளப்பட்ட மிகப்பெரிய அளவிலான post-training-லிருந்து இந்த மாடலின் வலிமை கிடைக்கிறது.