مدل Opus 5 شرکت Anthropic در برابر تزریق دستور (Prompt Injection) در مرورگر به نرخ موفقیت صفر درصد دست یافت
شرکت Anthropic با عرضه Opus 5، به پیشرفت عظیمی در امنیت هوش مصنوعی دست یافته است که میتواند یکی از پایداریترین آسیبپذیریها در عوامل خودگردان (autonomous agents) را حل کند. این مدل با پیادهسازی یک سیستم دفاعی دو لایه، مصونیت تقریباً کامل در برابر حملات تزریق دستور (prompt injection) مبتنی بر مرورگر را نشان داده است.
بحران تزریق دستور در عوامل هوش مصنوعی
تزریق دستور همچنان «پاشنه آشیل» عصر فعلی هوش مصنوعی است. این آسیبپذیری زمانی رخ میدهد که یک مهاجم دستورالعملهای مخرب را در یک صفحه وب — اغلب از طریق متن نامرئی — پنهان میکند که یک عامل هوش مصنوعی هنگام مرور صفحه آنها را میخواند. پس از پردازش، این دستورالعملها میتوانند مدل را به کنترل خود درآورده و آن را مجبور به دور زدن پروتکلهای ایمنی یا اجرای اقدامات غیرمجاز کنند. در حالی که پیشگامان این صنعت مانند OpenAI پیش از این پیشنهاد کرده بودند که تزریق دستور ممکن است یک نقص ذاتی و غیرقابل حل در مدلهای زبانی بزرگ (LLMs) باشد، دادههای اخیر Anthropic این دیدگاه بدبینانه را به چالش میکشد.
دستیابی به معیار صفر درصد
طبق کارت سیستم (system card) Anthropic، مدل Opus 5 در ۱۲۹ سناریوی آزمایشی مختلف که بهطور اختصاصی برای عوامل مرورگر طراحی شده بودند، به نرخ موفقیت خیرهکننده ۰٪ در حملات دست یافت. این یک جهش بزرگ نسبت به نسخههای قبلی است. در آزمایشهای عمومی تزریق دستور که توسط شرکت امنیتی Gray Swan انجام شد، Opus 5 بهبود چشمگیری نسبت به نسخه پیشین خود نشان داد؛ پس از ۱۵ تلاش، نرخ موفقیت مهاجم از ۵.۵٪ (که در Opus 4.8 مشاهده شده بود) به تنها ۲.۰٪ کاهش یافت.
این عملکرد، Opus 5 را در صدر معیار Gray Swan IPI قرار میدهد و از سایر مدلهای سطح بالا مانند Mythos 5 (۲.۶٪) و Fable 5 (۲.۸٪) پیشی میگیرد.
فرمول اصلی: Auto Mode و دفاع دو لایه
این پیشرفت صرفاً به دلیل هوش مدل نیست، بلکه به دلیل ادغام آن با نرمافزارهای تخصصی است. نرخ موفقیت «صفر درصد» بهطور خاص با استفاده از Auto Mode در محصولاتی مانند Claude Cowork مرتبط است. Anthropic از یک معماری دفاعی پیچیده دو لایه برای ایمنسازی عامل استفاده میکند:
- اسکن پیشپردازش (Pre-processing Scan): یک لایه اختصاصی، تمام دادههای ورودی را برای یافتن دستورالعملهای پنهان یا فریبنده، پیش از آنکه مدل اصلی LLM متن را پردازش کند، اسکن میکند.
- مسدودسازی اجرا (Execution Blocking): یک لایه ثانویه، اقدامات برنامهریزی شده توسط عامل را نظارت کرده و هرگونه دستور خطرناک را پیش از اجرا در محیط مرورگر، مسدود میکند.
جالب اینجاست که دادهها نشان میدهند مدل به تنهایی یک راهکار قطعی نیست. بدون این لایههای نرمافزاری محافظ، میزان آسیبپذیری Opus 5 در سطح ۳.۷٪ قرار دارد. در واقع، مدل تخصصی Sonnet 5 در حالت ایزوله با نرخ موفقیت ۰.۹۳٪، عملکرد کمی بهتر دارد. این همافزایی (synergy) بین مدل اصلی و پشته نرمافزاری دفاعی است که آستانه امنیت را به نزدیکی کمال میرساند.
چرا این موضوع برای آینده هوش مصنوعی اهمیت دارد
برای توسعهدهندگان و بنیانگذارانی که در حال ساخت عوامل هوش مصنوعی خودگردان هستند، این تحول یک تغییر پارادایم است. اگر بتوان تزریق دستور را از طریق لایههای معماری (به جای صرفاً آموزش مدل) خنثی کرد، مسیر به سوی جریانهای کاری «عاملی» (agentic) و قابل اعتماد — که در آن هوش مصنوعی ایمیلها، مرورگرها و دادههای حساس را مدیریت میکند — بسیار ایمنتر میشود. Anthropic نقشهای ارائه کرده است که نشان میدهد چگونه صنعت میتواند از روایت «غیرقابل حل بودن» فراتر رفته و به سمت خودمختاری هوش مصنوعیِ قدرتمند و آماده برای تولید حرکت کند.
نکات کلیدی
- امنیت پیشرو در صنعت: مدل Opus 5 هنگام استفاده از Auto Mode، در ۱۲۹ سناریوی تزریق دستور مبتنی بر مرورگر به نرخ موفقیت ۰٪ دست یافت.
- دفاع در عمق (Defense-in-Depth): امنیت از طریق یک رویکرد دو لایه شامل اسکن دادههای پیشپردازش و مسدودسازی پیشگیرانه اقدامات حاصل شده است.
- تسلط بر معیارها: Opus 5 در معیار Gray Swan IPI پیشتاز است و نرخ موفقیت مهاجم را در مقایسه با نسخههای قبلی مدل بهطور قابل توجهی کاهش داده است.
