OpenAI و Anthropic جدیدترین مدل‌های خود را با تمرکز بر توسعه‌دهندگان در جولای ۲۰۲۶ عرضه کردند—GPT-5.6 از OpenAI و Claude Fable 5 از Anthropic—که هر کدام وعده دستیاری سریع‌تر و هوشمندتر در مقیاس بالا را می‌دهند. اعداد اصلی حائز اهمیت هستند: ارزان‌ترین سطح GPT-5.6 (Sol) با قیمت ۵ دلار به ازای هر ۱ میلیون توکن ورودی و ۳۰ دلار به ازای هر ۱ میلیون توکن خروجی، در حالی که Claude Fable 5 به ترتیب ۱۰ دلار و ۵۰ دلار هزینه دریافت می‌کند.

چرا این عرضه برای توسعه‌دهندگان اهمیت دارد

هر دو شرکت این مدل‌ها را به عنوان موتور نسل بعدی برای نرم‌افزارهای سازمانی، دستیارهای چت و عوامل خودگردان (autonomous agents) معرفی کرده‌اند.

چشم‌انداز قیمت‌گذاری

سطح مدل قیمت ورودی (به ازای هر ۱ میلیون توکن) قیمت خروجی (به ازای هر ۱ میلیون توکن)
GPT-5.6 Sol $5 $30
GPT-5.6 Terra $2.50 $15
GPT-5.6 Luna $1 $6
Claude Fable 5 $10 $50

سه سطح GPT-5.6 به توسعه‌دهندگان اجازه می‌دهد تا هزینه را با شدت حجم کاری مطابقت دهند. Claude Fable 5 یک نقطه قیمتی واحد ارائه می‌دهد اما ۹۰٪ تخفیف برای prompt-caching در نظر گرفته است—مکانیزمی که دستورات پرکاربرد را ذخیره می‌کند تا از پردازش مجدد آن‌ها جلوگیری شود. اگر مورد استفاده شما حول محور پرس‌وجوهای تکراری می‌چرخد، این تخفیف شکاف هزینه‌ها را کاهش می‌دهد، اما نرخ‌های پایه بالاتر را از بین نمی‌برد.

عملکرد بنچمارک در یک نگاه

  • هوش عمومی (Artificial Analysis Index) – Claude Fable 5 امتیاز ۵۹.۹ و GPT-5.6 Sol امتیاز ۵۸.۹ را کسب کرده است. این دو در تست‌های استدلال خالص عملاً با هم برابر هستند.
  • گردش‌های کاری حرفه‌ای (Agents’ Last Exam) – GPT-5.6 Sol به ۵۳.۶٪ در مقابل ۴۰.۵٪ برای Claude Fable 5 دست یافته است. در وظایف چندمرحله‌ای که فرآیندهای تجاری دنیای واقعی را شبیه‌سازی می‌کنند، GPT-5.6 پیشتاز است.
  • کدنویسی در دنیای واقعی (SWE-Bench Pro) – Claude Fable 5 به ۸۰٪ می‌رسد در حالی که GPT-5.6 Sol به ۶۴.۶٪ دست می‌یابد. برای پایگاه‌های کد بزرگ و دستورات پیچیده مهندسی نرم‌افزار، Claude برتری آشکاری نشان می‌دهد.

این اعداد از مجموعه‌های بنچمارک عمومی استخراج شده‌اند که جنبه‌های مختلف قابلیت مدل را تحت فشار قرار می‌دهند. "Artificial Analysis Index" استدلال انتزاعی را اندازه‌گیری می‌کند؛ "Agents’ Last Exam" توانایی مدل در زنجیره‌سازی اقدامات در ابزارهای مختلف را آزمایش می‌کند؛ و "SWE-Bench Pro" کیفیت تولید کد را در مسائل برنامه‌نویسی دنیای واقعی ارزیابی می‌کند.

هر مدل در کجا می‌درخشد

GPT-5.6 را انتخاب کنید اگر:

  • نیاز دارید هزینه‌های API را پایین نگه دارید، به‌ویژه هنگام مقیاس‌پذیری به حجم‌های بالای درخواست.
  • به پلاگین‌های مرور وب یا استفاده از کامپیوتر (computer-use) که OpenAI در "ultra mode" خود ادغام کرده است، متکی هستید.
  • می‌خواهید چهار عامل خودگردان را به صورت موازی بدون برخورد با سقف‌های هزینه اجرا کنید.

Claude Fable 5 را انتخاب کنید اگر:

  • به جلسات کدنویسی عمیق و خودگردان نیاز دارید که بتوانند روزها بدون دخالت انسان اجرا شوند.
  • با اسناد متراکم، نمودارهای پیچیده یا داده‌های پر از دیاگرام کار می‌کنید که به نظر می‌رسد آموزش Claude در مدیریت آن‌ها بهتر عمل می‌کند.
  • اتصال‌های بومی (native hooks) به AWS یا Google Cloud را ترجیح می‌دهید، که Anthropic در عرضه سازمانی خود بر آن‌ها تأکید کرده است.

گام‌های عملی پیش از تعهد

  1. یک دوره آزمایشی (pilot) با داده‌های خود اجرا کنید. بنچمارک‌ها مفید هستند، اما نمی‌توانند ویژگی‌های خاص دستورات، قالب‌های داده و الزامات تأخیر (latency) شما را بازسازی کنند.
  2. هزینه‌های caching مدل مهم هستند. تخفیف ۹۰ درصدی Claude فقط برای دستورات ذخیره‌شده (cached) اعمال می‌شود؛ نرخ ذخیره‌سازی و نرخ عدم برخورد با حافظه پنهان (cache-miss rate) مورد انتظار خود را در نظر بگیرید.
  3. مدل را با وظیفه مطابقت دهید، نه با برند. از GPT-5.6 برای حجم کاری بالا و حساس به هزینه استفاده کنید؛ برای کارهای سنگین کدنویسی یا متمرکز بر اسناد، به Claude سوئیچ کنید.

دام‌هایی که باید از آن‌ها اجتناب کرد

  • به یک بنچمارک واحد تکیه نکنید. هر تست بخشی از قابلیت‌ها را ایزوله می‌کند؛ مدلی که در یک مورد عالی است ممکن است در مورد دیگر عقب بماند.

خلاصه نهایی

هیچ برنده جهانی بین GPT-5.6 و Claude Fable 5 وجود ندارد. انتخاب به آنچه بیشتر برایتان ارزش دارد بستگی دارد: کارایی هزینه و اجرای موازی عوامل، یا تولید کد برتر و مدیریت عمیق اسناد. هر دو را در برابر حجم کاری واقعی خود آزمایش کنید، تخفیف‌های caching و حجم را در نظر بگیرید و اجازه دهید اعداد به جای وفاداری به برند، راهنمای تصمیم شما باشند.