OpenAI و Anthropic جدیدترین مدلهای خود را با تمرکز بر توسعهدهندگان در جولای ۲۰۲۶ عرضه کردند—GPT-5.6 از OpenAI و Claude Fable 5 از Anthropic—که هر کدام وعده دستیاری سریعتر و هوشمندتر در مقیاس بالا را میدهند. اعداد اصلی حائز اهمیت هستند: ارزانترین سطح GPT-5.6 (Sol) با قیمت ۵ دلار به ازای هر ۱ میلیون توکن ورودی و ۳۰ دلار به ازای هر ۱ میلیون توکن خروجی، در حالی که Claude Fable 5 به ترتیب ۱۰ دلار و ۵۰ دلار هزینه دریافت میکند.
چرا این عرضه برای توسعهدهندگان اهمیت دارد
هر دو شرکت این مدلها را به عنوان موتور نسل بعدی برای نرمافزارهای سازمانی، دستیارهای چت و عوامل خودگردان (autonomous agents) معرفی کردهاند.
چشمانداز قیمتگذاری
| سطح مدل | قیمت ورودی (به ازای هر ۱ میلیون توکن) | قیمت خروجی (به ازای هر ۱ میلیون توکن) |
|---|---|---|
| GPT-5.6 Sol | $5 | $30 |
| GPT-5.6 Terra | $2.50 | $15 |
| GPT-5.6 Luna | $1 | $6 |
| Claude Fable 5 | $10 | $50 |
سه سطح GPT-5.6 به توسعهدهندگان اجازه میدهد تا هزینه را با شدت حجم کاری مطابقت دهند. Claude Fable 5 یک نقطه قیمتی واحد ارائه میدهد اما ۹۰٪ تخفیف برای prompt-caching در نظر گرفته است—مکانیزمی که دستورات پرکاربرد را ذخیره میکند تا از پردازش مجدد آنها جلوگیری شود. اگر مورد استفاده شما حول محور پرسوجوهای تکراری میچرخد، این تخفیف شکاف هزینهها را کاهش میدهد، اما نرخهای پایه بالاتر را از بین نمیبرد.
عملکرد بنچمارک در یک نگاه
- هوش عمومی (Artificial Analysis Index) – Claude Fable 5 امتیاز ۵۹.۹ و GPT-5.6 Sol امتیاز ۵۸.۹ را کسب کرده است. این دو در تستهای استدلال خالص عملاً با هم برابر هستند.
- گردشهای کاری حرفهای (Agents’ Last Exam) – GPT-5.6 Sol به ۵۳.۶٪ در مقابل ۴۰.۵٪ برای Claude Fable 5 دست یافته است. در وظایف چندمرحلهای که فرآیندهای تجاری دنیای واقعی را شبیهسازی میکنند، GPT-5.6 پیشتاز است.
- کدنویسی در دنیای واقعی (SWE-Bench Pro) – Claude Fable 5 به ۸۰٪ میرسد در حالی که GPT-5.6 Sol به ۶۴.۶٪ دست مییابد. برای پایگاههای کد بزرگ و دستورات پیچیده مهندسی نرمافزار، Claude برتری آشکاری نشان میدهد.
این اعداد از مجموعههای بنچمارک عمومی استخراج شدهاند که جنبههای مختلف قابلیت مدل را تحت فشار قرار میدهند. "Artificial Analysis Index" استدلال انتزاعی را اندازهگیری میکند؛ "Agents’ Last Exam" توانایی مدل در زنجیرهسازی اقدامات در ابزارهای مختلف را آزمایش میکند؛ و "SWE-Bench Pro" کیفیت تولید کد را در مسائل برنامهنویسی دنیای واقعی ارزیابی میکند.
هر مدل در کجا میدرخشد
GPT-5.6 را انتخاب کنید اگر:
- نیاز دارید هزینههای API را پایین نگه دارید، بهویژه هنگام مقیاسپذیری به حجمهای بالای درخواست.
- به پلاگینهای مرور وب یا استفاده از کامپیوتر (computer-use) که OpenAI در "ultra mode" خود ادغام کرده است، متکی هستید.
- میخواهید چهار عامل خودگردان را به صورت موازی بدون برخورد با سقفهای هزینه اجرا کنید.
Claude Fable 5 را انتخاب کنید اگر:
- به جلسات کدنویسی عمیق و خودگردان نیاز دارید که بتوانند روزها بدون دخالت انسان اجرا شوند.
- با اسناد متراکم، نمودارهای پیچیده یا دادههای پر از دیاگرام کار میکنید که به نظر میرسد آموزش Claude در مدیریت آنها بهتر عمل میکند.
- اتصالهای بومی (native hooks) به AWS یا Google Cloud را ترجیح میدهید، که Anthropic در عرضه سازمانی خود بر آنها تأکید کرده است.
گامهای عملی پیش از تعهد
- یک دوره آزمایشی (pilot) با دادههای خود اجرا کنید. بنچمارکها مفید هستند، اما نمیتوانند ویژگیهای خاص دستورات، قالبهای داده و الزامات تأخیر (latency) شما را بازسازی کنند.
- هزینههای caching مدل مهم هستند. تخفیف ۹۰ درصدی Claude فقط برای دستورات ذخیرهشده (cached) اعمال میشود؛ نرخ ذخیرهسازی و نرخ عدم برخورد با حافظه پنهان (cache-miss rate) مورد انتظار خود را در نظر بگیرید.
- مدل را با وظیفه مطابقت دهید، نه با برند. از GPT-5.6 برای حجم کاری بالا و حساس به هزینه استفاده کنید؛ برای کارهای سنگین کدنویسی یا متمرکز بر اسناد، به Claude سوئیچ کنید.
دامهایی که باید از آنها اجتناب کرد
- به یک بنچمارک واحد تکیه نکنید. هر تست بخشی از قابلیتها را ایزوله میکند؛ مدلی که در یک مورد عالی است ممکن است در مورد دیگر عقب بماند.
خلاصه نهایی
هیچ برنده جهانی بین GPT-5.6 و Claude Fable 5 وجود ندارد. انتخاب به آنچه بیشتر برایتان ارزش دارد بستگی دارد: کارایی هزینه و اجرای موازی عوامل، یا تولید کد برتر و مدیریت عمیق اسناد. هر دو را در برابر حجم کاری واقعی خود آزمایش کنید، تخفیفهای caching و حجم را در نظر بگیرید و اجازه دهید اعداد به جای وفاداری به برند، راهنمای تصمیم شما باشند.
