Anthropic از Claude Opus 5 رونمایی کرد: عملکرد ممتاز با نصف هزینه
شرکت Anthropic رسماً Claude Opus 5 را عرضه کرد؛ یک مدل پرچمدار جدید که با ارائه عملکردی تقریباً مشابه با مدل ممتاز Claude Fable 5 در قیمتی بهمراتب پایینتر، قصد دارد بازار مدلهای زبانی بزرگ (LLM) سطح بالا را متحول کند. این حرکت استراتژیک با هدف خنثی کردن فشار قیمتی رقبا مانند GPT-5.6 Sol و در عین حال فراهم کردن ابزاری کارآمدتر برای برنامهنویسی و کارهای دانشمحور پیچیده برای توسعهدهندگان انجام شده است.
تحول در مرز قیمت-عملکرد
چشمگیرترین ویژگی Claude Opus 5، ساختار قیمتگذاری تهاجمی آن است. در حالی که مدل سطح بالای Claude Fable 5 برای هر میلیون توکن ورودی ۱۰ دلار و برای هر میلیون توکن خروجی ۵۰ دلار هزینه دارد، Opus 5 این نرخها را به نصف کاهش داده و قیمت آن ۵ دلار برای هر میلیون توکن ورودی و ۲۵ دلار برای هر میلیون توکن خروجی است.
برای پاسخگویی به نیازهای مربوط به تأخیر (latency)، Anthropic همچنین حالت «Fast Mode» را معرفی کرده است که سرعت پردازش را تا ۲.۵ برابر افزایش میدهد، هرچند این امر با دو برابر شدن قیمت توکنها همراه است. این قیمتگذاری پلکانی، در کنار پنجره بافت (context window) عظیم ۱ میلیون توکنی، Opus 5 را به عنوان مدل پیشفرض جدید برای Claude Max و توانمندترین گزینه برای کاربران Claude Pro معرفی میکند.
برتری در بنچمارکهای برنامهنویسی و استدلال
Opus 5 صرفاً یک جایگزین ارزانقیمت نیست؛ بلکه یک غول عملکردی در حوزههای خاص است. در زمینه برنامهنویسی ترمینال مبتنی بر عامل (agentic terminal coding) از طریق Frontier-Bench v0.1، مدل Opus 5 به امتیاز ۴۳.۳٪ دست یافت که بهطور قابلتوجهی از Fable 5 (۳۳.۷٪) و GPT-5.6 Sol (۳۴.۴٪) بهتر است. این مدل همچنین تسلط خود را در کارهای دانشمحور نشان داد و با امتیاز Elo برابر با ۱۸۶۱، در بنچمارک GDPval-AA v2 پیشتاز شد.
شاید خیرهکنندهترین آمار مربوط به بنچمارک ARC-AGI-3 باشد که توانایی حل مسائل نوظهور را میسنجد. Opus 5 امتیاز ۳۰.۲٪ را کسب کرد که تقریباً چهار برابر بیشتر از امتیاز ۷.۸٪ بهدستآمده توسط GPT-5.6 Sol است. این موضوع نشاندهنده جهشی عظیم در توانایی مدل برای مدیریت وظایفی است که خارج از الگوهای دادههای آموزشی آن قرار دارند.
مقیاسپذیری هوشمند تلاش و کارایی
Anthropic یک سیستم پیچیده «effort» (میزان تلاش) را معرفی کرده است که به کاربران اجازه میدهد بین پنج تنظیم مختلف جابهجا شوند: low ،medium ،high ،xhigh و max. این قابلیت امکان ایجاد یک تعادل دقیق بین میزان مصرف توکن و عمق استدلال را فراهم میکند.
در حالی که Anthropic تنظیمات low و medium را برای وظایف عمومی جهت بهینهسازی هزینهها توصیه میکند، پیشنهاد میدهد برای برنامهنویسی عامل پیچیده از xhigh استفاده شود. جالب اینجاست که شرکت متوجه کاهش بازدهی در تنظیم max شده است؛ در هر دو بنچمارک Frontier-Bench v0.1 و Artificial Analysis Coding Agent Index، مدل Opus 5 با وجود هزینه بالاتر، در حداکثر میزان تلاش (maximum effort) با افت جزئی عملکرد مواجه شد که نشان میدهد تنظیم xhigh ممکن است در حال حاضر بهترین نقطه تعادل برای کارایی باشد.
بهبود ایمنی و خودمختاری
در پاسخ مستقیم به بازخوردهای کاربران، Anthropic طبقهبندیکنندههای ایمنی (safety classifiers) را برای Opus 5 بازتنظیم کرده است. فیلترهای سایبری این مدل تقریباً ۸۵٪ کمتر از Fable 5 فعال میشوند که به انتقادات قبلی در مورد مسدودسازی بیش از حد تحقیقات مشروع پاسخ میدهد. اگرچه این مدل همچنان از تولید اکسپلویت (exploit) و اسکنهای مبتنی بر باینری جلوگیری میکند، اما برای تحقیقات مربوط به آسیبپذیری کد منبع، بسیار منعطفتر عمل میکند.
علاوه بر این، Opus 5 قابلیتهای خوداصلاحی (self-correction) بهبودیافتهای را نشان میدهد. در آزمایشهای دنیای واقعی، این مدل با نوشتن خط لوله (pipeline) بینایی ماشین خود برای تفسیر هندسه، با موفقیت یک مدل سهبعدی در FreeCAD ساخت؛ وظیفهای که تمام مدلهای رقیب دیگر را مبهوت کرد.
نکات کلیدی
- کاهش شدید هزینهها: Opus 5 عملکردی در سطح پرچمدار را با ۵۰٪ هزینه توکن Claude Fable 5 ارائه میدهد.
- پیشرفت در استدلال: این مدل در بنچمارک ARC-AGI-3 برای حل مسائل نوظهور، برتری عظیم ۴ برابری نسبت به رقبا نشان داد.
- بهینهسازی جریان کاری توسعهدهندگان: با بهبود طبقهبندیکنندههای ایمنی و تنظیمات تخصصی
effort،Opus 5 تجربه روانتری را برای برنامهنویسی عامل و تحقیق فراهم میکند.
