Poolside کا Laguna S 2.1: ایک چھوٹا اوپن ویٹ ماڈل کوڈنگ AI کی نئی تعریف کر رہا ہے
Poolside نے Laguna S 2.1 جاری کیا ہے، جو کہ ایک جامع اوپن ویٹ کوڈنگ ماڈل ہے اور یہ اپنے سے کہیں زیادہ بڑے حریفوں کو پیچھے چھوڑ رہا ہے۔ خام پیرا میٹرز کی تعداد کے بجائے ایجنٹک استقامت (agentic persistence) اور استدلال (reasoning) کو ترجیح دے کر، یہ ریلیز اس بات کا اشارہ ہے کہ ہم مخصوص LLM ڈویلپمنٹ کے حوالے سے ایک نئے دور میں داخل ہو رہے ہیں۔
ٹریلین پیرا میٹرز والے دیو ہیکل ماڈلز سے بہتر کارکردگی
Laguna S 2.1 یہ ثابت کر رہا ہے کہ ذہانت کے لیے ماڈل کا سائز ہی واحد راستہ نہیں ہے۔ Terminal-Bench 2.1 بینچ مارک پر، جو طویل عرصے تک چلنے والے ٹرمینل ٹاسکس کا جائزہ لیتا ہے، "thinking mode" فعال ہونے کی صورت میں ماڈل نے 70.2% اسکور حاصل کیا۔ یہ کارکردگی اسے Tencent کے عظیم الشان 295B-A21B Hy3 ماڈل کے فوراً بعد لیکن DeepSeek-V4-Pro-Max اور Nemotron 3 Ultra جیسے بہت بڑے اوپن ویٹ سسٹمز سے آگے رکھتی ہے۔
Datacurve DeepSWE بینچ مارک پر یہ فرق مزید واضح ہو جاتا ہے۔ Laguna S 2.1 نے 40.4% اسکور کیا، جو کہ ایک سے زیادہ ٹریلین پیرا میٹرز والے کئی اوپن ویٹ ماڈلز کے مقابلے میں حیران کن نتیجہ ہے جو 10% کی حد کو بھی عبور کرنے میں ناکام رہے۔ ماڈل SWE-Bench Multilingual، SWE-Bench Pro، اور SWE Atlas پر بھی بہترین کارکردگی دکھاتا ہے، جو پیچیدہ سافٹ ویئر انجینئرنگ ورک فلو میں اس کی افادیت کو ثابت کرتا ہے۔
استقامت اور "Thinking" کی طاقت
Laguna S 2.1 کی ایک بنیادی خصوصیت اس کا "thinking mode" ہے، جو pass-at-one ریٹس میں نمایاں بہتری لاتا ہے۔ اس استدلال کے مرحلے کے بغیر، Terminal-Bench اسکور 70.2% سے گر کر 60.4% ہو جاتے ہیں، اور DeepSWE اسکور 40.4% سے کم ہو کر 16.5% رہ جاتے ہیں۔
Poolside کا کہنا ہے کہ محض ذہانت بڑھانے کے بجائے، انہوں نے ان "رویوں" (behaviors) کو بہتر بنانے پر توجہ دی ہے جو صلاحیتوں کا باعث بنتے ہیں۔ اس میں تصدیق (verification) میں اضافہ، مفروضوں کو بلا چون تسلیم کرنے کے رجحان کو کم کرنا، اور استقامت کو فروغ دینا شامل ہے۔ دستاویزی تجربات میں، ماڈل نے محض 50 منٹ میں ایک خالی فولڈر سے ایک فعال براؤزر انجن تیار کر لیا۔ اس سے بھی زیادہ متاثر کن بات یہ ہے کہ اس نے صرف 40 استدلال کے مراحل استعمال کرتے ہوئے اور محض $0.088 کی لاگت پر Erdos Problem #397 کا حل خود سے دریافت کر لیا—جو کہ ایک ایسا ریاضی کا مسئلہ ہے جو 1975 سے حل نہیں ہوا تھا۔
بڑے پیمانے پر ایجنٹک ٹریننگ
پچھلے XS 2.1 ورژن سے S 2.1 تک کارکردگی میں آنے والا بڑا اضافہ نئے پری ٹریننگ ڈیٹا کے بجائے شدید پوسٹ ٹریننگ (post-training) کی وجہ سے تھا۔ ایجنٹک ٹریننگ کے مرحلے میں 409,000 مختلف ماحول (environments) استعمال کیے گئے، جن میں شامل ہیں:
- ٹرمینل سے متعلقہ ٹاسکس کے لیے 83,000 ماحول۔
- سافٹ ویئر انجینئرنگ ورک فلو کے لیے 168,000 ماحول۔
- تقریباً 17,000 ریپوزٹریز سے حاصل کردہ 38,000 حقیقی دنیا کے کمٹس (commits)۔
اس ٹریننگ کے عمل کو 4,096 Nvidia H200 GPUs کے ایک عظیم الشان کمپیوٹ کلسٹر سے مدد فراہم کی گئی۔ خاص طور پر، S 2.1 اس سیریز کا پہلا ماڈل ہے جسے FP8 پریسیژن میں ری انفورسمنٹ لرننگ (reinforcement learning) کا استعمال کرتے ہوئے تربیت دی گئی ہے۔ "reward hacking" سے بچنے کے لیے—جہاں ایک ماڈل ٹاسک حل کرنے کے بجائے موجودہ پل ریکویسٹس (pull requests) تلاش کر سکتا ہے—Poolside نے نیٹ ورک تک رسائی کو منتخب طور پر بلاک کرنے کے لیے ایک نیا سینڈ باکس سسٹم نافذ کیا۔
رسائی اور تعیناتی (Deployment)
Laguna S 2.1 کو OpenMDW 1.1 لائسنس (جس کی پشت پناہی Linux Foundation کر رہی ہے) کے تحت جاری کیا گیا ہے، جو تجارتی استعمال، ترمیم اور دوبارہ تقسیم کی اجازت دیتا ہے۔ ڈویلپرز Hugging Face کے ذریعے، یا Baseten، Vercel AI Gateway، اور OpenRouter جیسی ہوسٹڈ سروسز کے ذریعے ماڈل تک رسائی حاصل کر سکتے ہیں۔ OpenRouter مفت میں 256K کا بڑا کانٹیکسٹ ونڈو (context window) فراہم کرتا ہے، جبکہ پیڈ ٹائر (paid tier) دس لاکھ ٹوکنز تک کی حمایت کرتا ہے۔
اہم نکات
- سائز کے مقابلے میں کارکردگی: Laguna S 2.1 ثابت کرتا ہے کہ استقامت اور تصدیق جیسے ایجنٹک رویے چھوٹے ماڈلز کو ٹریلین پیرا میٹر سسٹمز سے بہتر کارکردگی دکھانے کے قابل بنا سکتے ہیں۔
- استدلال ضروری ہے: پیچیدہ ٹاسکس کے لیے "thinking mode" انتہائی اہم ہے، جو تمام بڑے کوڈنگ بینچ مارکس پر کارکردگی کو نمایاں طور پر بڑھاتا ہے۔
- ایجنٹک ٹریننگ کی کامیابی: ماڈل کی طاقت 409,000 مخصوص ماحول اور حقیقی دنیا کے کوڈ کمٹس پر مبنی بڑے پیمانے کی پوسٹ ٹریننگ سے حاصل ہوتی ہے۔
