Poolside चे Laguna S 2.1: लहान Open-Weight मॉडेल कोडिंग AI ची व्याख्या बदलत आहे
Poolside ने Laguna S 2.1 लाँच केले आहे, जे एक कॉम्पॅक्ट open-weight कोडिंग मॉडेल असून ते मोठ्या प्रतिस्पर्ध्यांच्या तुलनेत उत्कृष्ट कामगिरी करत आहे. केवळ पॅरामीटरच्या संख्येपेक्षा 'agentic persistence' (एजंटिक चिकाटी) आणि 'reasoning' (तर्कक्षमता) ला प्राधान्य देऊन, हे मॉडेल विशेषीकृत LLM विकासाच्या दृष्टिकोनात एक मोठा बदल घडवून आणत आहे.
ट्रिलियन-पॅरामीटर असलेल्या दिग्गजांना मागे टाकते
Laguna S 2.1 हे सिद्ध करत आहे की बुद्धिमत्तेसाठी केवळ मॉडेलचा आकार (scale) हा एकमेव मार्ग नाही. Terminal-Bench 2.1 बेंचमार्कवर, जो दीर्घकाळ चालणाऱ्या टर्मिनल कार्यांचे मूल्यमापन करतो, "thinking mode" सुरू असताना या मॉडेलने ७०.२% गुण मिळवले आहेत. ही कामगिरी या मॉडेलला Tencent च्या प्रचंड मोठ्या 295B-A21B Hy3 मॉडेलच्या अगदी मागे ठेवते, परंतु DeepSeek-V4-Pro-Max आणि Nemotron 3 Ultra सारख्या खूप मोठ्या open-weights सिस्टम्सच्या पुढे नेते.
Datacurve DeepSWE बेंचमार्कवर ही तफावत अधिक स्पष्टपणे दिसून येते. Laguna S 2.1 ने ४०.४% गुण मिळवले आहेत, जे एक थक्क करणारे निकाल आहे; विशेषतः जेव्हा एक ट्रिलियनपेक्षा जास्त पॅरामीटर्स असलेल्या अनेक open-weight मॉडेल्स १०% चा टप्पाही पार करू शकली नाहीत. हे मॉडेल SWE-Bench Multilingual, SWE-Bench Pro आणि SWE Atlas मध्ये देखील उत्कृष्ट कामगिरी करते, ज्यामुळे जटिल सॉफ्टवेअर इंजिनीअरिंग वर्कफ्लोमध्ये त्याची उपयुक्तता सिद्ध होते.
चिकाटी आणि "Thinking" ची शक्ती
Laguna S 2.1 चे मुख्य वैशिष्ट्य म्हणजे त्याचा "thinking mode", जो 'pass-at-one' रेटमध्ये मोठी सुधारणा करतो. या 'reasoning' स्टेपशिवाय, Terminal-Bench स्कोअर ७०.२% वरून ६०.४% पर्यंत खाली येतात आणि DeepSWE स्कोअर ४०.४% वरून १६.५% पर्यंत घसरतात.
Poolside चे असे म्हणणे आहे की, केवळ बुद्धिमत्ता वाढवण्याऐवजी त्यांनी क्षमता निर्माण करणाऱ्या "behaviors" (वर्तणुकी) सुधारण्यावर लक्ष केंद्रित केले आहे. यामध्ये वाढीव पडताळणी (verification), गृहितके मानण्याची प्रवृत्ती कमी करणे आणि चिकाटी वाढवणे यांचा समावेश आहे. नोंदणीकृत चाचण्यांमध्ये, या मॉडेलने केवळ ५० मिनिटांत एका रिकाम्या फोल्डरपासून एक कार्यात्मक ब्राउझर इंजिन तयार केले. त्याहूनही थक्क करणारी गोष्ट म्हणजे, या मॉडेलने केवळ ४० स्टेप्सच्या तर्कशक्तीचा वापर करून आणि अवघ्या $०.०८८ खर्च करून Erdos Problem #397—१९७५ पासून सुटलेले नसलेले एक गणिती कोडे—याचे उत्तर स्वतंत्रपणे शोधून काढले.
मोठ्या प्रमाणावर Agentic Training
मागील XS 2.1 आवृत्तीपासून S 2.1 पर्यंत कामगिरीतील ही मोठी झेप नवीन pre-training डेटाऐवजी सखोल post-training मुळे शक्य झाली आहे. 'Agentic training' टप्प्यात ४,०९,००० वेगवेगळ्या वातावरणांचा (environments) वापर करण्यात आला, ज्यामध्ये खालील गोष्टींचा समावेश आहे:
- ८३,००० टर्मिनल-विशिष्ट कार्यांसाठी वातावरणे.
- १,६८,००० सॉफ्टवेअर इंजिनीअरिंग वर्कफ्लोसाठी वातावरणे.
- सुमारे १७,००० रिपॉझिटरीजमधून घेतलेले ३८,००० रिअल-वर्ल्ड कमिट्स (commits).
या प्रशिक्षण प्रक्रियेला ४,०९६ Nvidia H200 GPUs च्या प्रचंड मोठ्या कम्प्युट क्लस्टरने पाठबळ दिले. विशेष म्हणजे, S 2.1 हे या मालिकेतील FP8 precision मध्ये reinforcement learning वापरून प्रशिक्षित केलेले पहिले मॉडेल आहे. "reward hacking" रोखण्यासाठी—जिथे मॉडेल एखादे कार्य सोडवण्याऐवजी अस्तित्वात असलेल्या pull requests शोधू शकते—Poolside ने नेटवर्क ॲक्सेस निवडकपणे ब्लॉक करण्यासाठी एक नवीन सँडबॉक्स (sandbox) सिस्टम लागू केली आहे.
उपलब्धता आणि उपयोजन (Deployment)
Laguna S 2.1 हे OpenMDW 1.1 लायसन्स अंतर्गत (Linux Foundation च्या समर्थनासह) रिलीज केले गेले आहे, ज्यामुळे व्यावसायिक वापर, सुधारणा आणि पुनर्वितरण करणे शक्य आहे. डेव्हलपर्स Hugging Face द्वारे किंवा Baseten, Vercel AI Gateway आणि OpenRouter सारख्या होस्टेड सेवांद्वारे या मॉडेलचा वापर करू शकतात. OpenRouter मोफत २५६K कॉन्टेक्स्ट विंडो प्रदान करते, तर सशुल्क टियरमध्ये एक दशलक्ष (one million) टोकन्सपर्यंत सपोर्ट उपलब्ध आहे.
मुख्य निष्कर्ष
- Scale पेक्षा कार्यक्षमता महत्त्वाची: Laguna S 2.1 हे सिद्ध करते की चिकाटी आणि पडताळणी यांसारख्या agentic वर्तणुकीमुळे लहान मॉडेल्स ट्रिलियन-पॅरामीटर सिस्टम्सना मागे टाकू शकतात.
- तर्कक्षमता (Reasoning) आवश्यक आहे: जटिल कार्यांसाठी "thinking mode" अत्यंत महत्त्वाचा आहे, ज्यामुळे सर्व प्रमुख कोडिंग बेंचमार्कवर कामगिरी लक्षणीयरीत्या सुधारते.
- Agentic Training चे यश: मॉडेलची ताकद ४,०९,००० विशेष वातावरणांमध्ये आणि रिअल-वर्ल्ड कोड कमिट्समधील मोठ्या प्रमाणावरील post-training मधून येते.
