Laguna S 2.1 از Poolside: مدل کوچک با وزنهای باز که هوش مصنوعی برنامهنویسی را بازتعریف میکند
شرکت Poolside مدل Laguna S 2.1 را منتشر کرده است؛ یک مدل برنامهنویسی فشرده با وزنهای باز (open-weight) که عملکردی بسیار بهتر از رقبای بسیار بزرگتر خود دارد. این نسخه با اولویت دادن به استمرار عاملمحور (agentic persistence) و استدلال به جای صرفاً تعداد پارامترها، نشاندهنده یک تغییر پارادایم در نحوه رویکرد ما به توسعه مدلهای زبانی بزرگ (LLM) تخصصی است.
عملکرد بهتر از غولهای تریلیون-پارامتری
Laguna S 2.1 نشان میدهد که مقیاس مدل تنها راه رسیدن به هوش نیست. در بنچمارک Terminal-Bench 2.1 که وظایف طولانیمدت ترمینال را ارزیابی میکند، این مدل در صورت فعال بودن «حالت تفکر» (thinking mode)، به امتیاز ۷۰.۲٪ دست یافت. این عملکرد، آن را دقیقاً پس از مدل عظیم Hy3 با ۲۹۵ میلیارد پارامتر از Tencent قرار میدهد، اما از سیستمهای بسیار بزرگتر با وزنهای باز مانند DeepSeek-V4-Pro-Max و Nemotron 3 Ultra پیشی میگیرد.
این اختلاف در بنچمارک Datacurve DeepSWE حتی مشهودتر است. Laguna S 2.1 امتیاز ۴۰.۴٪ را کسب کرد؛ نتیجهای خیرهکننده در مقایسه با چندین مدل با وزنهای باز که بیش از یک تریلیون پارامتر داشتند اما نتوانستند از مرز ۱۰٪ عبور کنند. این مدل همچنین عملکردی سطح بالا در SWE-Bench Multilingual، SWE-Bench Pro و SWE Atlas از خود نشان میدهد که گویای کاربردی بودن آن در جریانهای کاری پیچیده مهندسی نرمافزار است.
قدرت استمرار و «تفکر»
یکی از تمایزهای اصلی Laguna S 2.1، «حالت تفکر» آن است که نرخ موفقیت در اولین تلاش (pass-at-one) را به شدت بهبود میبخشد. بدون این مرحله استدلال، امتیازات Terminal-Bench از ۷۰.۲٪ به ۶۰.۴٪ و امتیازات DeepSWE از ۴۰.۴٪ به ۱۶.۵٪ سقوط میکند.
Poolside استدلال میکند که آنها به جای صرفاً افزودن هوش، بر بهبود «رفتارهایی» تمرکز کردهاند که منجر به توانمندی میشوند. این شامل افزایش تأیید (verification)، کاهش تمایل به بدیهی فرض کردن پیشفرضها و تقویت استمرار است. در آزمایشهای مستند، این مدل تنها در ۵۰ دقیقه یک موتور مرورگر کاربردی را از یک پوشه خالی ساخت. حتی چشمگیرتر از آن، این مدل به طور مستقل راه حلی برای مسئله شماره ۳۹۷ اردوش (Erdos Problem #397) پیدا کرد؛ مسئلهای ریاضی که از سال ۱۹۷۵ حل نشده باقی مانده بود، و این کار را تنها با ۴۰ مرحله استدلال و با هزینهای ناچیز معادل ۰.۰۸۸ دلار انجام داد.
آموزش عاملمحور در مقیاس بزرگ
جهش عملکرد از نسخه قبلی XS 2.1 به S 2.1، به جای دادههای پیشآموزش (pre-training) جدید، ناشی از پسآموزش (post-training) متمرکز بود. مرحله آموزش عاملمحور از ۴۰۹,۰۰۰ محیط متمایز استفاده کرد، از جمله:
- ۸۳,۰۰۰ محیط برای وظایف خاص ترمینال.
- ۱۶۸,۰۰۰ محیط برای جریانهای کاری مهندسی نرمافزار.
- ۳۸,۰۰۰ کامیت (commit) واقعی که از حدود ۱۷,۰۰۰ مخزن (repository) استخراج شدهاند.
این فرآیند آموزشی توسط یک خوشه محاسباتی عظیم متشکل از ۴,۰۹۶ پردازنده گرافیکی Nvidia H200 پشتیبانی شد. قابل توجه است که S 2.1 اولین مدل از این سری است که با استفاده از یادگیری تقویتی (reinforcement learning) با دقت FP8 آموزش دیده است. برای جلوگیری از «تقلب در پاداش» (reward hacking) — که در آن مدل ممکن است به جای حل یک وظیفه، به دنبال درخواستهای Pull Request موجود بگردد — Poolside یک سیستم سندباکس (sandbox) جدید را برای مسدود کردن انتخابی دسترسی به شبکه پیادهسازی کرد.
دسترسی و استقرار
Laguna S 2.1 تحت لایسنس OpenMDW 1.1 (با حمایت بنیاد لینوکس) منتشر شده است که اجازه استفاده تجاری، تغییر و توزیع مجدد را میدهد. توسعهدهندگان میتوانند از طریق Hugging Face یا سرویسهای میزبانیشده مانند Baseten، Vercel AI Gateway و OpenRouter به این مدل دسترسی داشته باشند. OpenRouter یک پنجره بافت (context window) قابل توجه ۲۵۶ هزار توکنی را به صورت رایگان ارائه میدهد و نسخه پولی آن تا یک میلیون توکن را پشتیبانی میکند.
نکات کلیدی
- کارایی بر مقیاس مقدم است: Laguna S 2.1 ثابت میکند که رفتارهای عاملمحور مانند استمرار و تأیید میتوانند به مدلهای کوچک اجازه دهند از سیستمهای تریلیون-پارامتری پیشی بگیرند.
- استدلال ضروری است: «حالت تفکر» برای وظایف پیچیده حیاتی است و عملکرد را در تمام بنچمارکهای اصلی برنامهنویسی به طور قابل توجهی افزایش میدهد.
- موفقیت آموزش عاملمحور: قدرت این مدل از پسآموزش در مقیاس عظیم در ۴۰۹,۰۰۰ محیط تخصصی و کامیتهای کد واقعی نشأت میگیرد.
