Poolside'ın Laguna S 2.1'i: Küçük Açık Ağırlıklı Model, Kodlama Yapay Zekasını Yeniden Tanımlıyor
Poolside, kendisinden çok daha büyük rakipleri geride bırakan kompakt bir açık ağırlıklı kodlama modeli olan Laguna S 2.1'i yayınladı. Bu sürüm, ham parametre sayısı yerine ajansal (agentic) süreklilik ve muhakemeye öncelik vererek, özelleşmiş LLM geliştirmeye yaklaşımımızda bir paradigma değişimine işaret ediyor.
Trilyon Parametreli Devleri Geride Bırakıyor
Laguna S 2.1, model ölçeğinin zekaya giden tek yol olmadığını kanıtlıyor. Uzun süreli terminal görevlerini değerlendiren Terminal-Bench 2.1 kıyaslamasında, "düşünme modu" (thinking mode) etkinleştirildiğinde model %70,2'lik bir puan elde etti. Bu performans, onu doğrudan Tencent'in devasa 295B-A21B Hy3 modelinin arkasına yerleştirirken; DeepSeek-V4-Pro-Max ve Nemotron 3 Ultra gibi çok daha büyük açık ağırlıklı sistemlerin önüne geçiriyor.
Aradaki fark, Datacurve DeepSWE kıyaslamasında daha da belirgin hale geliyor. Laguna S 2.1, %10 sınırını bile aşamayan bir trilyondan fazla parametreye sahip birkaç açık ağırlıklı modele kıyasla şaşırtıcı bir sonuç olan %40,4 puan aldı. Model ayrıca SWE-Bench Multilingual, SWE-Bench Pro ve SWE Atlas genelinde üst düzey performans sergileyerek karmaşık yazılım mühendisliği iş akışlarındaki faydasını kanıtlıyor.
Sürekliliğin ve "Düşünmenin" Gücü
Laguna S 2.1'in temel fark yaratan özelliği, pass-at-one oranlarını büyük ölçüde artıran "düşünme modu"dur (thinking mode). Bu muhakeme adımı olmadan, Terminal-Bench puanları %70,2'den %60,4'e, DeepSWE puanları ise %40,4'ten %16,5'e düşüyor.
Poolside, yalnızca zekayı artırmak yerine, yeteneğe yol açan "davranışları" geliştirmeye odaklandıklarını savunuyor. Bu; artırılmış doğrulama, varsayımları olduğu gibi kabul etme eğiliminin azaltılması ve sürekliliğin teşvik edilmesini içeriyor. Belgelenmiş denemelerde model, boş bir klasörden sadece 50 dakika içinde işlevsel bir tarayıcı motoru inşa etti. Daha da etkileyicisi, sadece 40 muhakeme adımı kullanarak ve yalnızca 0,088 dolara, 1975'ten beri çözülemeyen bir matematik problemi olan Erdos Problem #397'nin çözümünü bağımsız olarak yeniden keşfetti.
Ölçekli Ajansal Eğitim
Önceki XS 2.1 sürümünden S 2.1 sürümüne geçişteki performans sıçraması, yeni ön eğitim (pre-training) verilerinden ziyade yoğun bir son eğitim (post-training) süreciyle sağlandı. Ajansal eğitim aşamasında, aşağıdakiler de dahil olmak üzere 409.000 farklı ortam kullanıldı:
- 83.000 terminale özgü görev ortamı.
- 168.000 yazılım mühendisliği iş akışı ortamı.
- Yaklaşık 17.000 depodan (repository) alınan 38.000 gerçek dünya commit'i.
Bu eğitim süreci, 4.096 adet Nvidia H200 GPU'dan oluşan devasa bir hesaplama kümesiyle desteklendi. Özellikle S 2.1, seride FP8 hassasiyetinde pekiştirmeli öğrenme (reinforcement learning) kullanılarak eğitilen ilk modeldir. Modelin bir görevi çözmek yerine mevcut pull request'leri arayabileceği "ödül avcılığını" (reward hacking) önlemek için Poolside, ağ erişimini seçici olarak engelleyen yeni bir sandbox (kum havuzu) sistemi uyguladı.
Erişilebilirlik ve Dağıtım
Laguna S 2.1, ticari kullanıma, değişikliğe ve yeniden dağıtıma izin veren OpenMDW 1.1 lisansı (Linux Foundation tarafından desteklenmektedir) altında yayınlanmıştır. Geliştiriciler modele Hugging Face üzerinden veya Baseten, Vercel AI Gateway ve OpenRouter gibi barındırılan hizmetler aracılığıyla erişebilirler. OpenRouter, ücretsiz olarak 256K'lık önemli bir bağlam penceresi (context window) sunarken, ücretli katmanı bir milyon tokene kadar desteklemektedir.
Önemli Çıkarımlar
- Ölçekten ziyade verimlilik: Laguna S 2.1; süreklilik ve doğrulama gibi ajansal davranışların, küçük modellerin trilyon parametreli sistemlerden daha iyi performans göstermesini sağlayabileceğini kanıtlıyor.
- Muhakeme esastır: "Düşünme modu", karmaşık görevler için kritiktir ve tüm önemli kodlama kıyaslamalarında performansı önemli ölçüde artırır.
- Ajansal eğitim başarısı: Modelin gücü, 409.000 özelleşmiş ortam ve gerçek dünya kod commit'leri üzerinden gerçekleştirilen devasa ölçekli son eğitimden (post-training) gelmektedir.
