Poolside의 Laguna S 2.1: 코딩 AI를 재정의하는 소형 오픈 웨이트(Open-Weight) 모델

Poolside가 훨씬 더 큰 경쟁 모델들을 압도하는 컴팩트한 오픈 웨이트 코딩 모델인 Laguna S 2.1을 출시했습니다. 단순한 파라미터 수보다 에이전트적 지속성(agentic persistence)과 추론(reasoning)을 우선시함으로써, 이번 출시는 특화된 LLM 개발에 접근하는 방식의 패러다임 전환을 예고합니다.

1조 개 파라미터 규모의 거대 모델을 압도하다

Laguna S 2.1은 모델의 규모가 지능으로 가는 유일한 길이 아님을 증명하고 있습니다. 장기 실행 터미널 작업을 평가하는 Terminal-Bench 2.1 벤치마크에서, 이 모델은 "thinking mode"를 활성화했을 때 70.2%의 점수를 기록했습니다. 이 성능은 텐센트(Tencent)의 거대한 295B-A21B Hy3 모델 바로 다음 순위이며, DeepSeek-V4-Pro-Max나 Nemotron 3 Ultra와 같은 훨씬 더 큰 오픈 웨이트 시스템들보다 앞서 있습니다.

이러한 격차는 Datacurve DeepSWE 벤치마크에서 더욱 명확하게 드러납니다. Laguna S 2.1은 40.4%의 점수를 기록했는데, 이는 10%의 벽을 넘지 못한 1조 개 이상의 파라미터를 가진 여러 오픈 웨이트 모델들과 비교했을 때 놀라운 결과입니다. 또한 이 모델은 SWE-Bench Multilingual, SWE-Bench Pro, SWE Atlas 전반에서 최상위권의 성능을 보여주며 복잡한 소프트웨어 엔지니어링 워크플로우에서의 유용성을 입증했습니다.

지속성과 "Thinking"의 힘

Laguna S 2.1의 핵심 차별점은 pass-at-one 비율을 획기적으로 높여주는 "thinking mode"입니다. 이 추론 단계가 없으면 Terminal-Bench 점수는 70.2%에서 60.4%로 급락하며, DeepSWE 점수는 40.4%에서 16.5%로 떨어집니다.

Poolside는 단순히 지능을 추가하는 대신, 능력을 이끌어내는 "행동(behaviors)"을 개선하는 데 집중했다고 주장합니다. 여기에는 검증 과정 강화, 가정을 당연하게 받아들이는 경향 감소, 그리고 지속성 함양이 포함됩니다. 기록된 테스트에서 이 모델은 빈 폴더에서 단 50분 만에 기능적인 브라우저 엔진을 구축했습니다. 더욱 놀라운 점은, 단 40단계의 추론만으로 1975년 이후 미해결 상태였던 수학 문제인 Erdos Problem #397의 해법을 독자적으로 찾아냈으며, 비용은 단 0.088달러에 불과했다는 것입니다.

대규모 에이전트 학습

이전 XS 2.1 버전에서 S 2.1로의 비약적인 성능 향상은 새로운 사전 학습(pre-training) 데이터가 아닌 집중적인 사후 학습(post-training)을 통해 이루어졌습니다. 에이전트 학습 단계에서는 다음과 같은 409,000개의 서로 다른 환경을 활용했습니다:

  • 터미널 특화 작업을 위한 83,000개의 환경.
  • 소프트웨어 엔지니어링 워크플로우를 위한 168,000개의 환경.
  • 약 17,000개의 저장소에서 가져온 38,000개의 실제 커밋.

이 학습 과정은 4,096개의 Nvidia H200 GPU로 구성된 거대한 컴퓨팅 클러스터의 지원을 받았습니다. 특히 S 2.1은 FP8 정밀도에서 강화 학습(reinforcement learning)을 사용하여 학습된 시리즈 최초의 모델입니다. 모델이 과제를 해결하는 대신 기존의 풀 리퀘스트(pull request)를 검색하는 "보상 해킹(reward hacking)"을 방지하기 위해, Poolside는 네트워크 접속을 선택적으로 차단하는 새로운 샌드박스 시스템을 구현했습니다.

접근성 및 배포

Laguna S 2.1은 (Linux Foundation이 지원하는) OpenMDW 1.1 라이선스 하에 출시되어 상업적 이용, 수정 및 재배포가 가능합니다. 개발자는 Hugging Face를 통하거나 Baseten, Vercel AI Gateway, OpenRouter와 같은 호스팅 서비스를 통해 모델에 접근할 수 있습니다. OpenRouter는 무료로 256K의 대규모 컨텍스트 창을 제공하며, 유료 티어에서는 최대 100만 토큰까지 지원합니다.

핵심 요약

  • 규모보다 효율성: Laguna S 2.1은 지속성과 검증 같은 에이전트적 행동이 소형 모델로도 1조 개 파라미터 규모의 시스템을 능가할 수 있음을 증명합니다.
  • 추론의 필수성: "thinking mode"는 복잡한 작업에 필수적이며, 모든 주요 코딩 벤치마크에서 성능을 크게 향상시킵니다.
  • 에이전트 학습의 성공: 이 모델의 강점은 409,000개의 특화된 환경과 실제 코드 커밋을 통한 대규모 사후 학습에서 비롯됩니다.