Laguna S 2.1 dari Poolside: Model Open-Weight Kecil Mendefinisikan Ulang AI Coding

Poolside telah merilis Laguna S 2.1, sebuah model coding open-weight yang ringkas yang mampu mengungguli kompetitor yang jauh lebih besar. Dengan memprioritaskan persistensi agentic dan penalaran (reasoning) di atas jumlah parameter mentah, rilis ini menandakan pergeseran paradigma dalam cara kita mendekati pengembangan LLM khusus.

Mengungguli Raksasa Berparameter Triliunan

Laguna S 2.1 menunjukkan bahwa skala model bukanlah satu-satunya jalan menuju kecerdasan. Pada benchmark Terminal-Bench 2.1, yang mengevaluasi tugas terminal jangka panjang, model ini mencapai skor 70,2% saat "thinking mode" diaktifkan. Performa ini menempatkannya tepat di belakang model Hy3 295B-A21B milik Tencent yang masif, namun berada di depan sistem open-weights yang jauh lebih besar seperti DeepSeek-V4-Pro-Max dan Nemotron 3 Ultra.

Kesenjangan ini menjadi semakin nyata pada benchmark Datacurve DeepSWE. Laguna S 2.1 meraih skor 40,4%, sebuah hasil yang mencengangkan dibandingkan dengan beberapa model open-weight dengan lebih dari satu triliun parameter yang gagal menembus angka 10%. Model ini juga menunjukkan performa elit di seluruh SWE-Bench Multilingual, SWE-Bench Pro, dan SWE Atlas, membuktikan kegunaannya dalam alur kerja rekayasa perangkat lunak yang kompleks.

Kekuatan Persistensi dan "Thinking"

Pembeda utama bagi Laguna S 2.1 adalah "thinking mode"-nya, yang secara drastis meningkatkan tingkat pass-at-one. Tanpa langkah penalaran ini, skor Terminal-Bench merosot dari 70,2% menjadi 60,4%, dan skor DeepSWE turun dari 40,4% menjadi 16,5%.

Poolside berargumen bahwa alih-alih sekadar menambah kecerdasan, mereka berfokus pada peningkatan "perilaku" yang mengarah pada kapabilitas. Ini mencakup peningkatan verifikasi, mengurangi kecenderungan untuk menganggap asumsi sebagai kebenaran, dan menumbuhkan persistensi. Dalam uji coba yang terdokumentasi, model ini membangun mesin browser fungsional dari folder kosong hanya dalam waktu 50 menit. Bahkan yang lebih mengesankan, ia secara mandiri menemukan kembali solusi untuk Erdos Problem #397—sebuah masalah matematika yang belum terpecahkan sejak 1975—hanya dengan menggunakan 40 langkah penalaran dan dengan biaya hanya $0,088.

Pelatihan Agentic dalam Skala Besar

Lonjakan performa dari versi XS 2.1 sebelumnya ke S 2.1 didorong oleh post-training yang intensif, bukan data pre-training baru. Fase pelatihan agentic menggunakan 409.000 lingkungan yang berbeda, termasuk:

  • 83.000 lingkungan untuk tugas khusus terminal.
  • 168.000 lingkungan untuk alur kerja rekayasa perangkat lunak.
  • 38.000 commit dunia nyata yang bersumber dari sekitar 17.000 repositori.

Proses pelatihan ini didukung oleh klaster komputasi masif berisi 4.096 GPU Nvidia H200. Khususnya, S 2.1 adalah model pertama dalam seri ini yang dilatih menggunakan reinforcement learning dalam presisi FP8. Untuk mencegah "reward hacking"—di mana model mungkin mencari pull request yang sudah ada alih-alih menyelesaikan tugas—Poolside menerapkan sistem sandbox baru untuk memblokir akses jaringan secara selektif.

Aksesibilitas dan Deployment

Laguna S 2.1 dirilis di bawah lisensi OpenMDW 1.1 (didukung oleh Linux Foundation), yang memungkinkan penggunaan komersial, modifikasi, dan redistribusi. Pengembang dapat mengakses model ini melalui Hugging Face, atau melalui layanan terhosting seperti Baseten, Vercel AI Gateway, dan OpenRouter. OpenRouter menawarkan context window sebesar 256K secara gratis, dengan tingkat berbayar yang mendukung hingga satu juta token.

Poin-Poin Penting

  • Efisiensi di atas Skala: Laguna S 2.1 membuktikan bahwa perilaku agentic seperti persistensi dan verifikasi dapat memungkinkan model kecil mengungguli sistem berparameter triliunan.
  • Penalaran itu Penting: "Thinking mode" sangat krusial untuk tugas-tugas kompleks, yang secara signifikan meningkatkan performa di seluruh benchmark coding utama.
  • Keberhasilan Pelatihan Agentic: Kekuatan model ini berasal dari post-training skala masif di 409.000 lingkungan khusus dan commit kode dunia nyata.