Anthropic در تاریخ ۱ سپتامبر، Claude Fable 5.1 و Claude Mythos 5.1 را عرضه کرد. هر دو مدل اکنون تا ۱ میلیون توکن در پنجره بافت (context) را می‌پذیرند، می‌توانند تا ۱۲۸ هزار توکن خروجی بدهند و عمق استدلال خود را به‌صورت آنی تنظیم می‌کنند—آن هم در حالی که هزینه‌های هر فراخوانی را کاهش داده‌اند. این ارتقاءها نه فقط برای کسب امتیازات بالاتر در بنچمارک‌ها، بلکه با هدف کدنویسی کم‌هزینه‌تر و قابل‌اعتمادتر به کمک هوش مصنوعی و انجام تحقیقات حساس طراحی شده‌اند.

چرا نسخه‌های جدید اهمیت دارند

نسل قبلی Claude پنجره‌های بافت را به چند هزار توکن محدود می‌کرد که توسعه‌دهندگان را مجبور می‌کرد کدها یا داده‌ها را به‌صورت دستی تقسیم کنند. کاربران همچنین مجبور بودند عمق استدلال را به‌صورت دستی تنظیم کنند که باعث می‌شد یک پرامپت ساده به بازی آزمون و خطا تبدیل شود. هزینه‌های خواندن از حافظه پنهان (cache-read) باعث می‌شد جلسات طولانی و فراخوانی‌های مکرر ابزارها گران تمام شود، و تیم‌های امنیتی نیز از سیل هشدارهای مثبت کاذب (false-positive) که بررسی کدها را کند می‌کرد، شکایت داشتند.

Claude Fable 5.1 و Claude Mythos 5.1 مستقیماً به سراغ این نقاط ضعف می‌روند. آن‌ها از یک مغز مرکزی یکسان استفاده می‌کنند، اما Anthropic برای هر مدل با توجه به مخاطبان هدف، محدودیت‌های حفاظتی (guardrails) متفاوتی را اعمال کرده است.

تغییرات در واقع چه کاری انجام می‌دهند

  • کاهش هزینه‌ها – Anthropic قیمت خواندن از حافظه پنهان را کاهش داد، بنابراین جلسات طولانی و تکراری کدنویسی و فراخوانی‌های مکرر ابزارها اکنون به‌طور محسوسی ارزان‌تر تمام می‌شوند؛ این یک عامل تعیین‌کننده برای استارتاپ‌ها و تیم‌های توسعه داخلی است.
  • تفکر تطبیقی – مدل به‌صورت آنی تصمیم می‌گیرد که یک وظیفه به چه میزان استدلال نیاز دارد. کاربران دیگر نیازی به تغییر دستی «سطوح تلاش» یا حدس زدن میزان نیاز به پرامپت‌نویسی زنجیره تفکر (chain-of-thought) ندارند.
  • پیام‌های محدود به هر نوبت (Turn-scoped) – دستورالعمل‌های سطح سیستم فقط برای یک تبادل واحد اعمال می‌شوند و از آلوده شدن مراحل بعدی توسط دستورالعمل‌های قدیمی جلوگیری می‌کنند.
  • بهبودهای امنیتی – کاربران Claude Code گزارش داده‌اند که هشدارهای مثبت کاذب در حوزه امنیت سایبری حدود ۶۰ درصد کاهش یافته است که باعث صرفه‌جویی در زمان برای پیگیری هشدارهای خیالی می‌شود.
  • تشخیص آسیب‌پذیری – Fable 5.1 نقص‌های نرم‌افزاری را شناسایی می‌کند اما از تولید کدهای اکسپلویت (exploit code) منع شده است تا بازرسان بدون باز کردن راه برای بازیگران مخرب، بهره‌وری خود را حفظ کنند.
  • تمرکز بر تحقیقات حساس – Mythos 5.1 در برنامه‌های مورد اعتماد در حوزه‌های امنیت سایبری و علوم زیستی خدمت‌رسانی می‌کند. Anthropic آن را در وظایفی مانند طراحی رمز (cipher design) تحت تست‌های فشار قرار می‌دهد و سپس یافته‌ها را به مدل عمومی Fable بازمی‌گرداند.

چه کسانی سود می‌برند و چه کسانی ممکن است نادیده گرفته شوند

توسعه‌دهندگانی که دستیارهای IDE، خطوط لوله CI یا بات‌های سفارشی می‌سازند، در هزینه‌ها صرفه‌جویی کرده و با حواس‌پرتی‌های امنیتی کمتری مواجه خواهند شد. تحلیلگران امنیتی و محققان بیوتکنولوژی که معیارهای اعتماد Anthropic را دارا هستند، می‌توانند از محدودیت‌های حفاظتی سخت‌گیرانه‌تر Mythos 5.1 برای حجم کارهای حساس استفاده کنند. نکته منفی اینجاست: Mythos برای عموم مردم بسته می‌ماند، بنابراین تیم‌های کوچک‌تر که رابطه با «برنامه‌های مورد اعتماد» ندارند، باید به نسخه منعطف‌تر Fable 5.1 تکیه کنند.

نقاط ضعف احتمالی یا سوالات بی‌پاسخ

مسدود کردن تولید اکسپلویت ممکن است کاربران تیم قرمز (red-team) را که برای تست دفاع خود به کدهای حمله واقعی نیاز دارند، ناامید کند. دروازه «برنامه مورد اعتماد» می‌تواند یک بازار لایه‌بندی شده برای هوش مصنوعی ایجاد کند که در آن فقط سازمان‌های با بودجه بالا به امن‌ترین و پرظرفیت‌ترین مدل دسترسی دارند. اگرچه قیمت خواندن از حافظه پنهان کاهش یافته است، اما Anthropic مدل کامل هزینه‌ها را فاش نکرده و این موضوع توسعه‌دهندگان را در مورد میزان صرفه‌جویی خالص در حجم کارهای بسیار بزرگ، نامطمئن گذاشته است.

آنچه باید در ادامه دنبال کرد

نرخ پذیرش نشان خواهد داد که آیا وعده‌های کاهش هزینه و امنیت به بهره‌وری واقعی در دنیای واقعی تبدیل می‌شوند یا خیر. اگر توسعه‌دهندگان پنجره ۱ میلیون توکنی را برای پایگاه‌های کد بزرگ ترجیح دهند، ممکن است Anthropic برای باز کردن محدودیت‌های حفاظتی سطح Mythos به مخاطبان گسترده‌تر، تحت فشار قرار گیرد. میزان کاهش هشدارهای مثبت کاذب و تأثیر آن بر خطوط لوله اسکن آسیب‌پذیری را دنبال کنید تا متوجه شوید وضعیت امنیتی جدید در برابر استفاده‌های سنگین از حملات چگونه عمل می‌کند.

نتیجه‌گیری: هدف Claude Fable 5.1 و Claude Mythos 5.1 کمتر شکستن رکورد بنچمارک‌ها و بیشتر کاهش هزینه‌های جریان‌های کاری هوش مصنوعی طولانی‌مدت، همزمان با تقویت شبکه‌های ایمنی برای حساس‌ترین کاربردها است.