مدل Opus 5 شرکت Anthropic در برابر تزریق دستور (Prompt Injection) در مرورگر به نرخ موفقیت صفر درصد دست یافت

شرکت Anthropic با عرضه Opus 5، به پیشرفت عظیمی در امنیت هوش مصنوعی دست یافته است که می‌تواند یکی از پایداری‌ترین آسیب‌پذیری‌ها در عوامل خودگردان (autonomous agents) را حل کند. این مدل با پیاده‌سازی یک سیستم دفاعی دو لایه، مصونیت تقریباً کامل در برابر حملات تزریق دستور (prompt injection) مبتنی بر مرورگر را نشان داده است.

بحران تزریق دستور در عوامل هوش مصنوعی

تزریق دستور همچنان «پاشنه آشیل» عصر فعلی هوش مصنوعی است. این آسیب‌پذیری زمانی رخ می‌دهد که یک مهاجم دستورالعمل‌های مخرب را در یک صفحه وب — اغلب از طریق متن نامرئی — پنهان می‌کند که یک عامل هوش مصنوعی هنگام مرور صفحه آن‌ها را می‌خواند. پس از پردازش، این دستورالعمل‌ها می‌توانند مدل را به کنترل خود درآورده و آن را مجبور به دور زدن پروتکل‌های ایمنی یا اجرای اقدامات غیرمجاز کنند. در حالی که پیشگامان این صنعت مانند OpenAI پیش از این پیشنهاد کرده بودند که تزریق دستور ممکن است یک نقص ذاتی و غیرقابل حل در مدل‌های زبانی بزرگ (LLMs) باشد، داده‌های اخیر Anthropic این دیدگاه بدبینانه را به چالش می‌کشد.

دستیابی به معیار صفر درصد

طبق کارت سیستم (system card) Anthropic، مدل Opus 5 در ۱۲۹ سناریوی آزمایشی مختلف که به‌طور اختصاصی برای عوامل مرورگر طراحی شده بودند، به نرخ موفقیت خیره‌کننده ۰٪ در حملات دست یافت. این یک جهش بزرگ نسبت به نسخه‌های قبلی است. در آزمایش‌های عمومی تزریق دستور که توسط شرکت امنیتی Gray Swan انجام شد، Opus 5 بهبود چشمگیری نسبت به نسخه پیشین خود نشان داد؛ پس از ۱۵ تلاش، نرخ موفقیت مهاجم از ۵.۵٪ (که در Opus 4.8 مشاهده شده بود) به تنها ۲.۰٪ کاهش یافت.

این عملکرد، Opus 5 را در صدر معیار Gray Swan IPI قرار می‌دهد و از سایر مدل‌های سطح بالا مانند Mythos 5 (۲.۶٪) و Fable 5 (۲.۸٪) پیشی می‌گیرد.

فرمول اصلی: Auto Mode و دفاع دو لایه

این پیشرفت صرفاً به دلیل هوش مدل نیست، بلکه به دلیل ادغام آن با نرم‌افزارهای تخصصی است. نرخ موفقیت «صفر درصد» به‌طور خاص با استفاده از Auto Mode در محصولاتی مانند Claude Cowork مرتبط است. Anthropic از یک معماری دفاعی پیچیده دو لایه برای ایمن‌سازی عامل استفاده می‌کند:

  1. اسکن پیش‌پردازش (Pre-processing Scan): یک لایه اختصاصی، تمام داده‌های ورودی را برای یافتن دستورالعمل‌های پنهان یا فریبنده، پیش از آنکه مدل اصلی LLM متن را پردازش کند، اسکن می‌کند.
  2. مسدودسازی اجرا (Execution Blocking): یک لایه ثانویه، اقدامات برنامه‌ریزی شده توسط عامل را نظارت کرده و هرگونه دستور خطرناک را پیش از اجرا در محیط مرورگر، مسدود می‌کند.

جالب اینجاست که داده‌ها نشان می‌دهند مدل به تنهایی یک راهکار قطعی نیست. بدون این لایه‌های نرم‌افزاری محافظ، میزان آسیب‌پذیری Opus 5 در سطح ۳.۷٪ قرار دارد. در واقع، مدل تخصصی Sonnet 5 در حالت ایزوله با نرخ موفقیت ۰.۹۳٪، عملکرد کمی بهتر دارد. این هم‌افزایی (synergy) بین مدل اصلی و پشته نرم‌افزاری دفاعی است که آستانه امنیت را به نزدیکی کمال می‌رساند.

چرا این موضوع برای آینده هوش مصنوعی اهمیت دارد

برای توسعه‌دهندگان و بنیان‌گذارانی که در حال ساخت عوامل هوش مصنوعی خودگردان هستند، این تحول یک تغییر پارادایم است. اگر بتوان تزریق دستور را از طریق لایه‌های معماری (به جای صرفاً آموزش مدل) خنثی کرد، مسیر به سوی جریان‌های کاری «عاملی» (agentic) و قابل اعتماد — که در آن هوش مصنوعی ایمیل‌ها، مرورگرها و داده‌های حساس را مدیریت می‌کند — بسیار ایمن‌تر می‌شود. Anthropic نقشه‌ای ارائه کرده است که نشان می‌دهد چگونه صنعت می‌تواند از روایت «غیرقابل حل بودن» فراتر رفته و به سمت خودمختاری هوش مصنوعیِ قدرتمند و آماده برای تولید حرکت کند.

نکات کلیدی

  • امنیت پیشرو در صنعت: مدل Opus 5 هنگام استفاده از Auto Mode، در ۱۲۹ سناریوی تزریق دستور مبتنی بر مرورگر به نرخ موفقیت ۰٪ دست یافت.
  • دفاع در عمق (Defense-in-Depth): امنیت از طریق یک رویکرد دو لایه شامل اسکن داده‌های پیش‌پردازش و مسدودسازی پیشگیرانه اقدامات حاصل شده است.
  • تسلط بر معیارها: Opus 5 در معیار Gray Swan IPI پیشتاز است و نرخ موفقیت مهاجم را در مقایسه با نسخه‌های قبلی مدل به‌طور قابل توجهی کاهش داده است.