Anthropic در تاریخ ۱ سپتامبر، Claude Fable 5.1 و Claude Mythos 5.1 را عرضه کرد. هر دو مدل اکنون تا ۱ میلیون توکن در پنجره بافت (context) را میپذیرند، میتوانند تا ۱۲۸ هزار توکن خروجی بدهند و عمق استدلال خود را بهصورت آنی تنظیم میکنند—آن هم در حالی که هزینههای هر فراخوانی را کاهش دادهاند. این ارتقاءها نه فقط برای کسب امتیازات بالاتر در بنچمارکها، بلکه با هدف کدنویسی کمهزینهتر و قابلاعتمادتر به کمک هوش مصنوعی و انجام تحقیقات حساس طراحی شدهاند.
چرا نسخههای جدید اهمیت دارند
نسل قبلی Claude پنجرههای بافت را به چند هزار توکن محدود میکرد که توسعهدهندگان را مجبور میکرد کدها یا دادهها را بهصورت دستی تقسیم کنند. کاربران همچنین مجبور بودند عمق استدلال را بهصورت دستی تنظیم کنند که باعث میشد یک پرامپت ساده به بازی آزمون و خطا تبدیل شود. هزینههای خواندن از حافظه پنهان (cache-read) باعث میشد جلسات طولانی و فراخوانیهای مکرر ابزارها گران تمام شود، و تیمهای امنیتی نیز از سیل هشدارهای مثبت کاذب (false-positive) که بررسی کدها را کند میکرد، شکایت داشتند.
Claude Fable 5.1 و Claude Mythos 5.1 مستقیماً به سراغ این نقاط ضعف میروند. آنها از یک مغز مرکزی یکسان استفاده میکنند، اما Anthropic برای هر مدل با توجه به مخاطبان هدف، محدودیتهای حفاظتی (guardrails) متفاوتی را اعمال کرده است.
تغییرات در واقع چه کاری انجام میدهند
- کاهش هزینهها – Anthropic قیمت خواندن از حافظه پنهان را کاهش داد، بنابراین جلسات طولانی و تکراری کدنویسی و فراخوانیهای مکرر ابزارها اکنون بهطور محسوسی ارزانتر تمام میشوند؛ این یک عامل تعیینکننده برای استارتاپها و تیمهای توسعه داخلی است.
- تفکر تطبیقی – مدل بهصورت آنی تصمیم میگیرد که یک وظیفه به چه میزان استدلال نیاز دارد. کاربران دیگر نیازی به تغییر دستی «سطوح تلاش» یا حدس زدن میزان نیاز به پرامپتنویسی زنجیره تفکر (chain-of-thought) ندارند.
- پیامهای محدود به هر نوبت (Turn-scoped) – دستورالعملهای سطح سیستم فقط برای یک تبادل واحد اعمال میشوند و از آلوده شدن مراحل بعدی توسط دستورالعملهای قدیمی جلوگیری میکنند.
- بهبودهای امنیتی – کاربران Claude Code گزارش دادهاند که هشدارهای مثبت کاذب در حوزه امنیت سایبری حدود ۶۰ درصد کاهش یافته است که باعث صرفهجویی در زمان برای پیگیری هشدارهای خیالی میشود.
- تشخیص آسیبپذیری – Fable 5.1 نقصهای نرمافزاری را شناسایی میکند اما از تولید کدهای اکسپلویت (exploit code) منع شده است تا بازرسان بدون باز کردن راه برای بازیگران مخرب، بهرهوری خود را حفظ کنند.
- تمرکز بر تحقیقات حساس – Mythos 5.1 در برنامههای مورد اعتماد در حوزههای امنیت سایبری و علوم زیستی خدمترسانی میکند. Anthropic آن را در وظایفی مانند طراحی رمز (cipher design) تحت تستهای فشار قرار میدهد و سپس یافتهها را به مدل عمومی Fable بازمیگرداند.
چه کسانی سود میبرند و چه کسانی ممکن است نادیده گرفته شوند
توسعهدهندگانی که دستیارهای IDE، خطوط لوله CI یا باتهای سفارشی میسازند، در هزینهها صرفهجویی کرده و با حواسپرتیهای امنیتی کمتری مواجه خواهند شد. تحلیلگران امنیتی و محققان بیوتکنولوژی که معیارهای اعتماد Anthropic را دارا هستند، میتوانند از محدودیتهای حفاظتی سختگیرانهتر Mythos 5.1 برای حجم کارهای حساس استفاده کنند. نکته منفی اینجاست: Mythos برای عموم مردم بسته میماند، بنابراین تیمهای کوچکتر که رابطه با «برنامههای مورد اعتماد» ندارند، باید به نسخه منعطفتر Fable 5.1 تکیه کنند.
نقاط ضعف احتمالی یا سوالات بیپاسخ
مسدود کردن تولید اکسپلویت ممکن است کاربران تیم قرمز (red-team) را که برای تست دفاع خود به کدهای حمله واقعی نیاز دارند، ناامید کند. دروازه «برنامه مورد اعتماد» میتواند یک بازار لایهبندی شده برای هوش مصنوعی ایجاد کند که در آن فقط سازمانهای با بودجه بالا به امنترین و پرظرفیتترین مدل دسترسی دارند. اگرچه قیمت خواندن از حافظه پنهان کاهش یافته است، اما Anthropic مدل کامل هزینهها را فاش نکرده و این موضوع توسعهدهندگان را در مورد میزان صرفهجویی خالص در حجم کارهای بسیار بزرگ، نامطمئن گذاشته است.
آنچه باید در ادامه دنبال کرد
نرخ پذیرش نشان خواهد داد که آیا وعدههای کاهش هزینه و امنیت به بهرهوری واقعی در دنیای واقعی تبدیل میشوند یا خیر. اگر توسعهدهندگان پنجره ۱ میلیون توکنی را برای پایگاههای کد بزرگ ترجیح دهند، ممکن است Anthropic برای باز کردن محدودیتهای حفاظتی سطح Mythos به مخاطبان گستردهتر، تحت فشار قرار گیرد. میزان کاهش هشدارهای مثبت کاذب و تأثیر آن بر خطوط لوله اسکن آسیبپذیری را دنبال کنید تا متوجه شوید وضعیت امنیتی جدید در برابر استفادههای سنگین از حملات چگونه عمل میکند.
نتیجهگیری: هدف Claude Fable 5.1 و Claude Mythos 5.1 کمتر شکستن رکورد بنچمارکها و بیشتر کاهش هزینههای جریانهای کاری هوش مصنوعی طولانیمدت، همزمان با تقویت شبکههای ایمنی برای حساسترین کاربردها است.
