نسخه جدید Fugu Ultra v1.1 از Sakana AI در عملکرد از Fable 5 پیشی گرفت

Sakana AI به‌روزرسانی مهمی را برای روتر هوشمند مدل خود، Fugu Ultra v1.1، منتشر کرده است و مدعی جهش‌های عملکردی عظیم در بنچمارک‌های فنی حیاتی شده است. این به‌روزرسانی نشان‌دهنده تلاشی استراتژیک برای بهبود نحوه توزیع پرس‌وجوها (queries) میان مدل‌های سطح بالا است تا به قابلیت‌های استدلال و کدنویسی برتری دست یابد.

شکستن بنچمارک‌ها: مزیت Fugu Ultra v1.1

نوآوری اصلی Fugu Ultra v1.1 در هوش مسیریابی (routing intelligence) آن نهفته است که مناسب‌ترین مدل را از میان مجموعه‌ای از LLMهای در دسترس عموم برای هر پرامپت مشخص انتخاب می‌کند. Sakana AI گزارش می‌دهد که این نسخه نسبت به نسخه اولیه v1.0، بهبود عملکردی تا ۷.۹ امتیاز را ارائه می‌دهد.

قابل توجه‌ترین نکته این است که این روتر جهش‌های قابل توجهی را در ارزیابی‌های فنی تخصصی، به‌ویژه در بنچمارک‌های ProgramBench و TerminalBench 2.1 نشان داده است. Sakana در ادعایی خیره‌کننده تأکید می‌کند که Fugu Ultra v1.1 اکنون در اکثر بنچمارک‌ها از Fable 5 شرکت Anthropic پیشی گرفته است؛ با این حال، Fable 5 در واقع در مجموعه انتخاب‌های این روتر قرار ندارد. اگرچه این نتایج در حال حاضر فاقد تأییدیه مستقل از سوی شخص ثالث هستند، اما نشان می‌دهند که منطق مسیریابی در استخراج حداکثر عملکرد از معماری‌های مدل موجود، بسیار کارآمد شده است.

معماری فنی و ادغام با توسعه‌دهندگان

رویکرد Sakana برای حفظ مجموعه‌ای پیشرو، بسیار دقیق است؛ این شرکت اعلام کرده است که پیش از ادغام رسمی هر مدل سطح بالای جدید در اکوسیستم Fugu، حدود دو هفته آموزش و ارزیابی اختصاصی لازم است. این امر تضمین می‌کند که فرآیند تصمیم‌گیری روتر برای آخرین وزن‌ها (weights) و قابلیت‌های موجود در بازار، بهینه باقی بماند.

برای توسعه‌دهندگان، این به‌روزرسانی یک endpoint سازگار با Claude Code جدید معرفی می‌کند که به کاربران اجازه می‌دهد Fugu را مستقیماً از ترمینال خود فراخوانی کنند. این ادغام، جریان‌های کاری مهندسانی را که به استدلال سطح بالا و اتوماسیون مبتنی بر ترمینال نیاز دارند، تسهیل می‌کند. با وجود این پیشرفت‌های فنی، قیمت‌گذاری مطابق با نسخه قبلی ثابت مانده است: ۵ دلار به ازای هر میلیون توکن ورودی و ۳۰ دلار به ازای هر میلیون توکن خروجی. Fugu در حال حاضر از طریق پلتفرم‌های اصلی از جمله OpenRouter و Vercel قابل دسترسی است.

مقابله با چالش‌های بازار و مقررات

این انتشار پس از دوره‌ای از بررسی‌های دقیق نسبت به عرضه اولیه Fugu صورت می‌گیرد. منتقدان اولیه به مسائلی نظیر مصرف بالای توکن، تأخیر (latency) و نتایج متناقض اشاره کرده بودند. با نسخه v1.1، به نظر می‌رسد Sakana برای بازپس‌گیری اعتماد توسعه‌دهندگان، بر کارایی و عملکرد در وظایف تخصصی تمرکز بیشتری کرده است.

با این حال، محدودیت‌های جغرافیایی همچنان مانعی برای پذیرش جهانی است. Sakana AI در حال حاضر با استناد به پیچیدگی‌های مربوط به GDPR و سایر چارچوب‌های مقرراتی خاص اتحادیه اروپا، به کاربران داخل اتحادیه اروپا (EU) یا منطقه اقتصادی اروپا (EEA) خدمات ارائه نمی‌دهد. با رشد دسته «مدل روتر»، توانایی Sakana در اثبات این ادعاهای عملکردی از طریق داده‌های شفاف و قابل تأیید، آزمون نهایی بقای آن در چشم‌انداز رقابتی هوش مصنوعی خواهد بود.

نکات کلیدی

  • بنچمارک برتر: Fugu Ultra v1.1 بهبود ۷.۹ امتیازی نسبت به v1.0 نشان می‌دهد و با وجود اینکه Fable 5 در مجموعه انتخاب‌های روتر نیست، در چندین معیار به‌طور قابل توجهی از Fable 5 شرکت Anthropic پیشی گرفته است.
  • به‌روزرسانی‌های توسعه‌دهنده-محور: نسخه جدید یک endpoint ترمینال سازگار با Claude Code اضافه کرده است که ادغام آسان‌تر در جریان‌های کاری کدنویسی را تسهیل می‌کند.
  • انتخاب دقیق: Sakana برای هر مدل جدیدی که به روتر اضافه می‌شود، از یک چرخه ارزیابی دو هفته‌ای استفاده می‌کند تا دقت و عملکرد بالا را حفظ کند.