Laguna S 2.1 از Poolside: مدل کوچک با وزن‌های باز که هوش مصنوعی برنامه‌نویسی را بازتعریف می‌کند

شرکت Poolside مدل Laguna S 2.1 را منتشر کرده است؛ یک مدل برنامه‌نویسی فشرده با وزن‌های باز (open-weight) که عملکردی بسیار بهتر از رقبای بسیار بزرگ‌تر خود دارد. این نسخه با اولویت دادن به استمرار عامل‌محور (agentic persistence) و استدلال به جای صرفاً تعداد پارامترها، نشان‌دهنده یک تغییر پارادایم در نحوه رویکرد ما به توسعه مدل‌های زبانی بزرگ (LLM) تخصصی است.

عملکرد بهتر از غول‌های تریلیون-پارامتری

Laguna S 2.1 نشان می‌دهد که مقیاس مدل تنها راه رسیدن به هوش نیست. در بنچمارک Terminal-Bench 2.1 که وظایف طولانی‌مدت ترمینال را ارزیابی می‌کند، این مدل در صورت فعال بودن «حالت تفکر» (thinking mode)، به امتیاز ۷۰.۲٪ دست یافت. این عملکرد، آن را دقیقاً پس از مدل عظیم Hy3 با ۲۹۵ میلیارد پارامتر از Tencent قرار می‌دهد، اما از سیستم‌های بسیار بزرگ‌تر با وزن‌های باز مانند DeepSeek-V4-Pro-Max و Nemotron 3 Ultra پیشی می‌گیرد.

این اختلاف در بنچمارک Datacurve DeepSWE حتی مشهودتر است. Laguna S 2.1 امتیاز ۴۰.۴٪ را کسب کرد؛ نتیجه‌ای خیره‌کننده در مقایسه با چندین مدل با وزن‌های باز که بیش از یک تریلیون پارامتر داشتند اما نتوانستند از مرز ۱۰٪ عبور کنند. این مدل همچنین عملکردی سطح بالا در SWE-Bench Multilingual، SWE-Bench Pro و SWE Atlas از خود نشان می‌دهد که گویای کاربردی بودن آن در جریان‌های کاری پیچیده مهندسی نرم‌افزار است.

قدرت استمرار و «تفکر»

یکی از تمایزهای اصلی Laguna S 2.1، «حالت تفکر» آن است که نرخ موفقیت در اولین تلاش (pass-at-one) را به شدت بهبود می‌بخشد. بدون این مرحله استدلال، امتیازات Terminal-Bench از ۷۰.۲٪ به ۶۰.۴٪ و امتیازات DeepSWE از ۴۰.۴٪ به ۱۶.۵٪ سقوط می‌کند.

Poolside استدلال می‌کند که آن‌ها به جای صرفاً افزودن هوش، بر بهبود «رفتارهایی» تمرکز کرده‌اند که منجر به توانمندی می‌شوند. این شامل افزایش تأیید (verification)، کاهش تمایل به بدیهی فرض کردن پیش‌فرض‌ها و تقویت استمرار است. در آزمایش‌های مستند، این مدل تنها در ۵۰ دقیقه یک موتور مرورگر کاربردی را از یک پوشه خالی ساخت. حتی چشمگیرتر از آن، این مدل به طور مستقل راه حلی برای مسئله شماره ۳۹۷ اردوش (Erdos Problem #397) پیدا کرد؛ مسئله‌ای ریاضی که از سال ۱۹۷۵ حل نشده باقی مانده بود، و این کار را تنها با ۴۰ مرحله استدلال و با هزینه‌ای ناچیز معادل ۰.۰۸۸ دلار انجام داد.

آموزش عامل‌محور در مقیاس بزرگ

جهش عملکرد از نسخه قبلی XS 2.1 به S 2.1، به جای داده‌های پیش‌آموزش (pre-training) جدید، ناشی از پس‌آموزش (post-training) متمرکز بود. مرحله آموزش عامل‌محور از ۴۰۹,۰۰۰ محیط متمایز استفاده کرد، از جمله:

  • ۸۳,۰۰۰ محیط برای وظایف خاص ترمینال.
  • ۱۶۸,۰۰۰ محیط برای جریان‌های کاری مهندسی نرم‌افزار.
  • ۳۸,۰۰۰ کامیت (commit) واقعی که از حدود ۱۷,۰۰۰ مخزن (repository) استخراج شده‌اند.

این فرآیند آموزشی توسط یک خوشه محاسباتی عظیم متشکل از ۴,۰۹۶ پردازنده گرافیکی Nvidia H200 پشتیبانی شد. قابل توجه است که S 2.1 اولین مدل از این سری است که با استفاده از یادگیری تقویتی (reinforcement learning) با دقت FP8 آموزش دیده است. برای جلوگیری از «تقلب در پاداش» (reward hacking) — که در آن مدل ممکن است به جای حل یک وظیفه، به دنبال درخواست‌های Pull Request موجود بگردد — Poolside یک سیستم سندباکس (sandbox) جدید را برای مسدود کردن انتخابی دسترسی به شبکه پیاده‌سازی کرد.

دسترسی و استقرار

Laguna S 2.1 تحت لایسنس OpenMDW 1.1 (با حمایت بنیاد لینوکس) منتشر شده است که اجازه استفاده تجاری، تغییر و توزیع مجدد را می‌دهد. توسعه‌دهندگان می‌توانند از طریق Hugging Face یا سرویس‌های میزبانی‌شده مانند Baseten، Vercel AI Gateway و OpenRouter به این مدل دسترسی داشته باشند. OpenRouter یک پنجره بافت (context window) قابل توجه ۲۵۶ هزار توکنی را به صورت رایگان ارائه می‌دهد و نسخه پولی آن تا یک میلیون توکن را پشتیبانی می‌کند.

نکات کلیدی

  • کارایی بر مقیاس مقدم است: Laguna S 2.1 ثابت می‌کند که رفتارهای عامل‌محور مانند استمرار و تأیید می‌توانند به مدل‌های کوچک اجازه دهند از سیستم‌های تریلیون-پارامتری پیشی بگیرند.
  • استدلال ضروری است: «حالت تفکر» برای وظایف پیچیده حیاتی است و عملکرد را در تمام بنچمارک‌های اصلی برنامه‌نویسی به طور قابل توجهی افزایش می‌دهد.
  • موفقیت آموزش عامل‌محور: قدرت این مدل از پس‌آموزش در مقیاس عظیم در ۴۰۹,۰۰۰ محیط تخصصی و کامیت‌های کد واقعی نشأت می‌گیرد.