Laguna S 2.1 от Poolside: компактная модель с открытыми весами меняет представление об ИИ для программирования

Компания Poolside выпустила Laguna S 2.1 — компактную модель с открытыми весами для написания кода, которая превосходит значительно более крупных конкурентов. Отдавая приоритет агентской настойчивости и рассуждению (reasoning), а не простому количеству параметров, этот релиз знаменует собой смену парадигмы в подходе к разработке специализированных LLM.

Превосходя гигантов с триллионами параметров

Laguna S 2.1 доказывает, что масштаб модели — не единственный путь к интеллекту. В бенчмарке Terminal-Bench 2.1, который оценивает длительные задачи в терминале, модель достигла показателя 70,2% при включенном «режиме размышления» (thinking mode). Этот результат ставит её сразу за массивной моделью Hy3 (295B-A21B) от Tencent, но опережает гораздо более крупные системы с открытыми весами, такие как DeepSeek-V4-Pro-Max и Nemotron 3 Ultra.

Разрыв становится еще более очевидным в бенчмарке Datacurve DeepSWE. Laguna S 2.1 набрала 40,4% — ошеломляющий результат по сравнению с несколькими моделями с открытыми весами, имеющими более одного триллиона параметров, которые не смогли преодолеть порог в 10%. Модель также демонстрирует элитную производительность в SWE-Bench Multilingual, SWE-Bench Pro и SWE Atlas, доказывая свою полезность в сложных рабочих процессах программной инженерии.

Сила настойчивости и «размышления»

Ключевым отличием Laguna S 2.1 является её «режим размышления» (thinking mode), который радикально повышает показатель pass-at-one. Без этого этапа рассуждения результаты в Terminal-Bench падают с 70,2% до 60,4%, а в DeepSWE — с 40,4% до 16,5%.

В Poolside утверждают, что вместо простого наращивания интеллекта они сосредоточились на улучшении «поведения», которое ведет к росту возможностей. Это включает в себя усиление верификации, снижение склонности принимать предположения как данность и развитие настойчивости. В задокументированных испытаниях модель создала функциональный движок браузера из пустой папки всего за 50 минут. Что еще более впечатляюще, она самостоятельно нашла решение задачи Эрдёша №397 — математической задачи, остававшейся нерешенной с 1975 года, — использовав всего 40 шагов рассуждения и затратив всего 0,088 доллара.

Агентское обучение в масштабе

Скачок производительности по сравнению с предыдущей версией XS 2.1 до S 2.1 был обусловлен интенсивным пост-обучением (post-training), а не новыми данными для пре-обучения. Этап агентского обучения задействовал 409 000 различных сред, включая:

  • 83 000 сред для задач, специфичных для терминала.
  • 168 000 сред для рабочих процессов программной инженерии.
  • 38 000 реальных коммитов из примерно 17 000 репозиториев.

Этот процесс обучения поддерживался массивным вычислительным кластером из 4 096 графических процессоров Nvidia H200. Примечательно, что S 2.1 — это первая модель в серии, обученная с использованием обучения с подкреплением (reinforcement learning) в точности FP8. Чтобы предотвратить «взлом вознаграждения» (reward hacking) — когда модель может искать существующие pull requests вместо решения задачи — Poolside внедрила новую систему «песочницы» для выборочной блокировки сетевого доступа.

Доступность и развертывание

Laguna S 2.1 выпущена под лицензией OpenMDW 1.1 (при поддержке Linux Foundation), что позволяет использовать её в коммерческих целях, модифицировать и распространять. Разработчики могут получить доступ к модели через Hugging Face или через хостинговые сервисы, такие как Baseten, Vercel AI Gateway и OpenRouter. OpenRouter предлагает бесплатное окно контекста объемом 256K, а платный уровень поддерживает до одного миллиона токенов.

Основные выводы

  • Эффективность важнее масштаба: Laguna S 2.1 доказывает, что агентское поведение, такое как настойчивость и верификация, позволяет малым моделям превосходить системы с триллионами параметров.
  • Рассуждение необходимо: «Режим размышления» критически важен для сложных задач, значительно повышая производительность во всех основных бенчмарках для программирования.
  • Успех агентского обучения: Сила модели обусловлена масштабным пост-обучением в 409 000 специализированных средах и на реальных коммитах кода.