Laguna S 2.1 oleh Poolside: Model Open-Weight Kecil Mendefinisikan Semula AI Pengkodan
Poolside telah melancarkan Laguna S 2.1, sebuah model pengkodan open-weight yang kompak yang mengatasi pesaing yang jauh lebih besar. Dengan mengutamakan ketekunan ejen (agentic persistence) dan penaakulan berbanding jumlah parameter mentah, pelancaran ini menandakan anjakan paradigma dalam cara kita mendekati pembangunan LLM khusus.
Mengatasi Gergasi Trilion-Parameter
Laguna S 2.1 membuktikan bahawa skala model bukanlah satu-satunya jalan menuju kecerdasan. Dalam penanda aras Terminal-Bench 2.1, yang menilai tugasan terminal jangka panjang, model ini mencapai skor 70.2% apabila "thinking mode" diaktifkan. Prestasi ini meletakkannya tepat di belakang model Hy3 295B-A21B milik Tencent yang sangat besar, namun mendahului sistem open-weights yang jauh lebih besar seperti DeepSeek-V4-Pro-Max dan Nemotron 3 Ultra.
Perbezaan ini menjadi lebih ketara pada penanda aras Datacurve DeepSWE. Laguna S 2.1 mencatatkan skor 40.4%, satu keputusan yang menakjubkan berbanding beberapa model open-weight dengan lebih satu trilion parameter yang gagal melepasi tanda 10%. Model ini juga menunjukkan prestasi elit merentasi SWE-Bench Multilingual, SWE-Bench Pro, dan SWE Atlas, membuktikan kegunaannya dalam aliran kerja kejuruteraan perisian yang kompleks.
Kuasa Ketekunan dan "Thinking"
Perbezaan utama bagi Laguna S 2.1 ialah "thinking mode" miliknya, yang meningkatkan kadar pass-at-one secara drastik. Tanpa langkah penaakulan ini, skor Terminal-Bench menjunam daripada 70.2% kepada 60.4%, dan skor DeepSWE jatuh daripada 40.4% kepada 16.5%.
Poolside berhujah bahawa berbanding sekadar menambah kecerdasan, mereka telah menumpukan kepada penambahbaikan "tingkah laku" yang membawa kepada keupayaan. Ini termasuk peningkatan pengesahan, mengurangkan kecenderungan untuk menganggap andaian sebagai fakta, dan memupuk ketekunan. Dalam ujian yang didokumentasikan, model ini membina enjin pelayar yang berfungsi daripada folder kosong dalam masa hanya 50 minit. Lebih mengagumkan lagi, ia menemui semula penyelesaian kepada Masalah Erdos #397 secara bebas—sebuah masalah matematik yang tidak terungkai sejak 1975—dengan hanya menggunakan 40 langkah penaakulan dan menelan kos hanya $0.088.
Latihan Ejen pada Skala Besar
Lonjakan prestasi daripada versi XS 2.1 sebelumnya kepada S 2.1 didorong oleh latihan pasca (post-training) yang intensif dan bukannya data pra-latihan (pre-training) baharu. Fasa latihan ejen menggunakan 409,000 persekitaran yang berbeza, termasuk:
- 83,000 persekitaran untuk tugasan khusus terminal.
- 168,000 persekitaran untuk aliran kerja kejuruteraan perisian.
- 38,000 komit dunia nyata yang diperoleh daripada kira-kira 17,000 repositori.
Proses latihan ini disokong oleh kluster pengkomputeran besar yang terdiri daripada 4,096 GPU Nvidia H200. Menariknya, S 2.1 ialah model pertama dalam siri ini yang dilatih menggunakan pembelajaran pengukuhan (reinforcement learning) dalam ketepatan FP8. Untuk mengelakkan "reward hacking"—di mana model mungkin mencari permintaan tarik (pull requests) sedia ada dan bukannya menyelesaikan tugasan—Poolside melaksanakan sistem sandbox baharu untuk menyekat akses rangkaian secara terpilih.
Kebolehcapaian dan Pelaksanaan
Laguna S 2.1 dikeluarkan di bawah lesen OpenMDW 1.1 (disokong oleh Linux Foundation), yang membenarkan penggunaan komersial, pengubahsuaian, dan pengedaran semula. Pembangun boleh mengakses model ini melalui Hugging Face, atau melalui perkhidmatan hos seperti Baseten, Vercel AI Gateway, dan OpenRouter. OpenRouter menawarkan tetingkap konteks 256K yang besar secara percuma, dengan tier berbayar menyokong sehingga satu juta token.
Ringkasan Utama
- Kecekapan berbanding Skala: Laguna S 2.1 membuktikan bahawa tingkah laku ejen seperti ketekunan dan pengesahan membolehkan model kecil mengatasi sistem trilion-parameter.
- Penaakulan adalah Penting: "Thinking mode" adalah kritikal untuk tugasan kompleks, meningkatkan prestasi secara signifikan merentasi semua penanda aras pengkodan utama.
- Kejayaan Latihan Ejen: Kekuatan model ini berasal daripada latihan pasca berskala besar merentasi 409,000 persekitaran khusus dan komit kod dunia nyata.
