Claude Opus 5 در تاریخ ۲۴ جولای روانه بازار شد و ارقام اصلی آن نوید جهشی سه‌برابری نسبت به نزدیک‌ترین رقیب و دو برابر شدن عملکرد Opus 4.8 خودِ Anthropic را می‌دهد. پرسش اصلی برای هر کسی که بابت خروجی هوش مصنوعی هزینه می‌کند این است که آیا این نسبت‌ها بدون افزایش قیمت، به دستاوردهای ملموس تبدیل می‌شوند یا خیر.

چرا این ارقام اهمیت دارند

توسعه‌دهندگان بیش از هر چیز به امتیاز SWE-bench Pro اهمیت می‌دهند؛ بنچمارکی که یک مدل را در برابر مسائل واقعی GitHub آزمایش می‌کند تا ببیند چقدر در رفع کدها موفق است. Opus 5 به امتیاز ۷۹.۲٪ رسید، در حالی که Opus 4.8 موفق به کسب ۶۹.۲٪ شده بود—یعنی رشدی ده واحدی تنها در عرض دو ماه. Anthropic قیمت هر توکن را بدون تغییر نگه داشت، بنابراین کاربران با همان هزینه، یک دستیار کدنویسی به‌مراتب هوشمندتر دریافت می‌کنند.

اگر این نسبت‌های اصلی در سایر آزمایش‌ها نیز پابرجا بمانند، داستانِ «هزینه در برابر عملکرد» می‌تواند نحوه انتخاب مدل‌های زبانی توسط شرکت‌ها برای حجم‌های کاری سنگینِ کدنویسی را تغییر دهد.

عملکرد Opus 5 در آزمایش‌های کلیدی

  • SWE-bench Pro – ۷۹.۲٪ در مقابل ۶۹.۲٪ (Opus 4.8). قیمت توکن یکسان، نرخ موفقیت بالاتر در رفع باگ‌های دنیای واقعی.
  • CursorBench 3.2 – Opus 5 از نظر سرعت انجام وظیفه، در فاصله ۰.۵٪ از مدل پیشرو Fable 5 قرار می‌گیرد، با این حال هزینه آن در هر وظیفه تقریباً نصف است.
  • ARC-AGI-3 – Opus 5 امتیاز ۳۰.۲ را کسب کرد، در حالی که نفر دوم با امتیاز ۷.۸ فاصله زیادی دارد. این شکاف بسیار چشمگیر است و نشان می‌دهد Opus 5 مسائل استدلال انتزاعی را بسیار بهتر از اکثر رقبای هم‌دوره خود مدیریت می‌کند.
  • General Reasoning – رقابت در این بخش نزدیک‌تر است. GPT-5.6 Sol با میانگین ۹۲.۵ پیشتاز است و با اختلاف اندکی از امتیاز ۹۰.۴ مدل Opus 5 جلو می‌افتد. در اینجا Opus 5 رقابتی است اما برتری مطلق ندارد.

این ارقام تصویری دقیق و چندبعدی ارائه می‌دهند: Opus 5 در بنچمارک‌های مرتبط با کدنویسی و برخی بنچمارک‌های استدلالی عالی عمل می‌کند، اما همچنان از برترین مدل استدلال عمومی عقب‌تر است.

تحلیل دقیق‌تر

اعداد بنچمارک اگر شرایط آزمایش شفاف نباشد، می‌توانند گمراه‌کننده باشند. چهار مورد به تفکیک واقعیت از تبلیغات کمک می‌کند:

  1. سطح تلاش (Effort level) – آیا مدل با تلاش کم، پیش‌فرض یا حداکثری اجرا شده است؟ تلاش بیشتر می‌تواند امتیازات را بالا ببرد اما باعث افزایش تأخیر (latency) و هزینه نیز می‌شود.
  2. تعداد دفعات آزمایش – اجرای تک‌باره ممکن است نتایج استثنایی و خوش‌شانسی را ثبت کند. تکرار آزمایش‌ها (پنج بار یا بیشتر) تصویر پایدارتری ارائه می‌دهد.
  3. منبع – بنچمارک‌های ارائه شده توسط خودِ سازنده برای تعیین یک خط پایه مفید هستند، اما باید توسط آزمایشگاه‌های مستقل تأیید شوند.
  4. خط پایه مقایسه – آیا «مدل بعدی» هنوز پیشتاز فعلی است، یا از زمان انجام آزمایش، رقیب جدیدتری وارد میدان شده است؟

پیامدها برای کاربران و رقبا

شرکت‌هایی که خطوط لوله (pipelines) بازبینی کد در مقیاس بزرگ را اجرا می‌کنند، می‌توانند با ۱۰ واحد افزایش در SWE-bench Pro و در عین حال ثابت ماندن قیمت توکن، ساعت‌ها از چرخه‌های عیب‌یابی (debugging) بکاهند و هزینه‌های محاسبات ابری خود را کاهش دهند. تیم‌های کوچک‌تر نیز بدون نیاز به افزایش بودجه، به دستیاری توانمندتر دست می‌یابند.

امتیازات نزدیک در بخش General Reasoning به توسعه‌دهندگان یادآوری می‌کند که Opus 5 جایگزینی همه‌جانبه برای بهترین مدل همه‌کاره فعلی نیست.

آنچه باید در آینده زیر نظر داشت

  • انتشار بنچمارک‌های مستقل – آزمایشگاه‌های شخص ثالث به‌زودی Opus 5 را با همان مجموعه آزمایش در سطوح مختلف تلاش، مورد سنجش قرار خواهند داد. یافته‌های آن‌ها ادعاهای Anthropic را تأیید یا رد خواهد کرد.

جمع‌بندی

Claude Opus 5 یک بهبود آشکار در عملکرد کدنویسی با همان قیمت توکن ارائه می‌دهد که آن را به ارتقایی جذاب برای توسعه‌دهندگانی که بر وظایف نرم‌افزاری تمرکز دارند، تبدیل می‌کند. این مدل همچنان یک قدم از پیشتاز مطلق در استدلال عمومی عقب‌تر است و مزایای تبلیغ‌شده آن هنوز نیاز به تأیید مستقل دارند. برای هر کسی که در حال بودجه‌بندی خدمات هوش مصنوعی است، کارایی هزینه این مدل در کارهای کدنویسی، ملموس‌ترین دلیل برای بررسی جدی آن است.