Laguna S 2.1 від Poolside: мала модель з відкритими вагами переосмислює ШІ для програмування
Poolside випустила Laguna S 2.1 — компактну модель з відкритими вагами для програмування, яка перевершує значно більших конкурентів. Надаючи пріоритет агентській наполегливості та міркуванню (reasoning) замість простої кількості параметрів, цей реліз сигналізує про зміну парадигми в підході до розробки спеціалізованих LLM.
Перевершує гігантів із трильйонами параметрів
Laguna S 2.1 демонструє, що масштаб моделі — не єдиний шлях до інтелекту. У бенчмарку Terminal-Bench 2.1, який оцінює тривалі завдання в терміналі, модель досягла результату 70,2% із увімкненим «режимом мислення» (thinking mode). Цей показник ставить її одразу після масивної моделі Hy3 (295B-A21B) від Tencent, але попереду набагато більших систем із відкритими вагами, таких як DeepSeek-V4-Pro-Max та Nemotron 3 Ultra.
Розрив стає ще більш очевидним у бенчмарку Datacurve DeepSWE. Laguna S 2.1 набрала 40,4% — приголомшливий результат порівняно з кількома моделями з відкритими вагами, що мають понад один трильйон параметрів і не змогли подолати позначку в 10%. Модель також демонструє елітну продуктивність у SWE-Bench Multilingual, SWE-Bench Pro та SWE Atlas, доводячи свою корисність у складних робочих процесах програмної інженерії.
Сила наполегливості та «мислення»
Ключовою відмінною рисою Laguna S 2.1 є її «режим мислення» (thinking mode), який кардинально покращує показники pass-at-one. Без цього етапу міркування результати в Terminal-Bench падають із 70,2% до 60,4%, а в DeepSWE — з 40,4% до 16,5%.
Poolside стверджує, що замість простого нарощування інтелекту вони зосередилися на покращенні «поведінки», яка веде до здатності виконувати завдання. Це включає посилену перевірку (verification), зменшення схильності приймати припущення як належне та розвиток наполегливості. У задокументованих випробуваннях модель побудувала функціональний рушій браузера з порожньої папки всього за 50 хвилин. Ще більш вражає те, що вона самостійно знайшла рішення задачі Ердеша №397 — математичної проблеми, невирішеної з 1975 року, — використавши лише 40 кроків міркування та витративши всього $0,088.
Агентське навчання в масштабі
Стрибок продуктивності від попередньої версії XS 2.1 до S 2.1 був зумовлений інтенсивним донавчанням (post-training), а не новими даними для попереднього навчання (pre-training). Фаза агентського навчання використовувала 409 000 окремих середовищ, зокрема:
- 83 000 середовищ для завдань у терміналі.
- 168 000 середовищ для робочих процесів програмної інженерії.
- 38 000 реальних комітів із приблизно 17 000 репозиторіїв.
Цей процес навчання підтримувався масивним обчислювальним кластером із 4 096 GPU Nvidia H200. Примітно, що S 2.1 — це перша модель у серії, навчена з використанням навчання з підкріпленням (reinforcement learning) у точності FP8. Щоб запобігти «хакінгу винагороди» (reward hacking) — коли модель може шукати існуючі pull requests замість розв'язання завдання — Poolside впровадила нову систему «пісочниці» (sandbox) для вибіркового блокування доступу до мережі.
Доступність та розгортання
Laguna S 2.1 випущена під ліцензією OpenMDW 1.1 (за підтримки Linux Foundation), що дозволяє комерційне використання, модифікацію та розповсюдження. Розробники можуть отримати доступ до моделі через Hugging Face або через хостингові сервіси, такі як Baseten, Vercel AI Gateway та OpenRouter. OpenRouter пропонує безкоштовне контекстне вікно обсягом 256K, а платний рівень підтримує до одного мільйона токенів.
Основні висновки
- Ефективність важливіша за масштаб: Laguna S 2.1 доводить, що агентська поведінка, така як наполегливість і перевірка, дозволяє малим моделям перевершувати системи з трильйоном параметрів.
- Міркування є необхідним: «Режим мислення» є критично важливим для складних завдань, значно підвищуючи продуктивність у всіх основних бенчмарках для програмування.
- Успіх агентського навчання: Сила моделі зумовлена масштабним донавчанням у 409 000 спеціалізованих середовищах та на реальних комітах коду.
