Anthropic از Claude Opus 5 رونمایی کرد: عملکرد ممتاز با نصف هزینه

شرکت Anthropic رسماً Claude Opus 5 را عرضه کرد؛ یک مدل پرچم‌دار جدید که با ارائه عملکردی تقریباً مشابه با مدل ممتاز Claude Fable 5 در قیمتی به‌مراتب پایین‌تر، قصد دارد بازار مدل‌های زبانی بزرگ (LLM) سطح بالا را متحول کند. این حرکت استراتژیک با هدف خنثی کردن فشار قیمتی رقبا مانند GPT-5.6 Sol و در عین حال فراهم کردن ابزاری کارآمدتر برای برنامه‌نویسی و کارهای دانش‌محور پیچیده برای توسعه‌دهندگان انجام شده است.

تحول در مرز قیمت-عملکرد

چشم‌گیرترین ویژگی Claude Opus 5، ساختار قیمت‌گذاری تهاجمی آن است. در حالی که مدل سطح بالای Claude Fable 5 برای هر میلیون توکن ورودی ۱۰ دلار و برای هر میلیون توکن خروجی ۵۰ دلار هزینه دارد، Opus 5 این نرخ‌ها را به نصف کاهش داده و قیمت آن ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای هر میلیون توکن خروجی است.

برای پاسخگویی به نیازهای مربوط به تأخیر (latency)، Anthropic همچنین حالت «Fast Mode» را معرفی کرده است که سرعت پردازش را تا ۲.۵ برابر افزایش می‌دهد، هرچند این امر با دو برابر شدن قیمت توکن‌ها همراه است. این قیمت‌گذاری پلکانی، در کنار پنجره بافت (context window) عظیم ۱ میلیون توکنی، Opus 5 را به عنوان مدل پیش‌فرض جدید برای Claude Max و توانمندترین گزینه برای کاربران Claude Pro معرفی می‌کند.

برتری در بنچمارک‌های برنامه‌نویسی و استدلال

Opus 5 صرفاً یک جایگزین ارزان‌قیمت نیست؛ بلکه یک غول عملکردی در حوزه‌های خاص است. در زمینه برنامه‌نویسی ترمینال مبتنی بر عامل (agentic terminal coding) از طریق Frontier-Bench v0.1، مدل Opus 5 به امتیاز ۴۳.۳٪ دست یافت که به‌طور قابل‌توجهی از Fable 5 (۳۳.۷٪) و GPT-5.6 Sol (۳۴.۴٪) بهتر است. این مدل همچنین تسلط خود را در کارهای دانش‌محور نشان داد و با امتیاز Elo برابر با ۱۸۶۱، در بنچمارک GDPval-AA v2 پیشتاز شد.

شاید خیره‌کننده‌ترین آمار مربوط به بنچمارک ARC-AGI-3 باشد که توانایی حل مسائل نوظهور را می‌سنجد. Opus 5 امتیاز ۳۰.۲٪ را کسب کرد که تقریباً چهار برابر بیشتر از امتیاز ۷.۸٪ به‌دست‌آمده توسط GPT-5.6 Sol است. این موضوع نشان‌دهنده جهشی عظیم در توانایی مدل برای مدیریت وظایفی است که خارج از الگوهای داده‌های آموزشی آن قرار دارند.

مقیاس‌پذیری هوشمند تلاش و کارایی

Anthropic یک سیستم پیچیده «effort» (میزان تلاش) را معرفی کرده است که به کاربران اجازه می‌دهد بین پنج تنظیم مختلف جابه‌جا شوند: low ،medium ،high ،xhigh و max. این قابلیت امکان ایجاد یک تعادل دقیق بین میزان مصرف توکن و عمق استدلال را فراهم می‌کند.

در حالی که Anthropic تنظیمات low و medium را برای وظایف عمومی جهت بهینه‌سازی هزینه‌ها توصیه می‌کند، پیشنهاد می‌دهد برای برنامه‌نویسی عامل پیچیده از xhigh استفاده شود. جالب اینجاست که شرکت متوجه کاهش بازدهی در تنظیم max شده است؛ در هر دو بنچمارک Frontier-Bench v0.1 و Artificial Analysis Coding Agent Index، مدل Opus 5 با وجود هزینه بالاتر، در حداکثر میزان تلاش (maximum effort) با افت جزئی عملکرد مواجه شد که نشان می‌دهد تنظیم xhigh ممکن است در حال حاضر بهترین نقطه تعادل برای کارایی باشد.

بهبود ایمنی و خودمختاری

در پاسخ مستقیم به بازخوردهای کاربران، Anthropic طبقه‌بندی‌کننده‌های ایمنی (safety classifiers) را برای Opus 5 بازتنظیم کرده است. فیلترهای سایبری این مدل تقریباً ۸۵٪ کمتر از Fable 5 فعال می‌شوند که به انتقادات قبلی در مورد مسدودسازی بیش از حد تحقیقات مشروع پاسخ می‌دهد. اگرچه این مدل همچنان از تولید اکسپلویت (exploit) و اسکن‌های مبتنی بر باینری جلوگیری می‌کند، اما برای تحقیقات مربوط به آسیب‌پذیری کد منبع، بسیار منعطف‌تر عمل می‌کند.

علاوه بر این، Opus 5 قابلیت‌های خوداصلاحی (self-correction) بهبودیافته‌ای را نشان می‌دهد. در آزمایش‌های دنیای واقعی، این مدل با نوشتن خط لوله (pipeline) بینایی ماشین خود برای تفسیر هندسه، با موفقیت یک مدل سه‌بعدی در FreeCAD ساخت؛ وظیفه‌ای که تمام مدل‌های رقیب دیگر را مبهوت کرد.

نکات کلیدی

  • کاهش شدید هزینه‌ها: Opus 5 عملکردی در سطح پرچم‌دار را با ۵۰٪ هزینه توکن Claude Fable 5 ارائه می‌دهد.
  • پیشرفت در استدلال: این مدل در بنچمارک ARC-AGI-3 برای حل مسائل نوظهور، برتری عظیم ۴ برابری نسبت به رقبا نشان داد.
  • بهینه‌سازی جریان کاری توسعه‌دهندگان: با بهبود طبقه‌بندی‌کننده‌های ایمنی و تنظیمات تخصصی effort ،Opus 5 تجربه روان‌تری را برای برنامه‌نویسی عامل و تحقیق فراهم می‌کند.