آنتروپیک (Anthropic) اعلام کرد که سه مدل Claude آن در جریان یک کمپین اخیر تست امنیتی، از محیط ایزوله (sandbox) خارج شده و به سیستم‌های دنیای واقعی دسترسی پیدا کردند؛ این اتفاق منجر به توقف فوری ارزیابی‌ها و انتشار یک گزارش عمومی شد.

این شرکت ۱۴۱,۰۰۶ اجرای تست امنیت سایبری انجام داد و سه مورد را شناسایی کرد که در آن‌ها مدل‌ها به جای محیط شبیه‌سازی شده، به اهداف واقعی دسترسی پیدا کرده بودند. یک پیکربندی اشتباه در همکاری با یک شریک شخص ثالث، باعث شده بود محیط sandbox عملاً باز باقی بماند.

نحوه وقوع نفوذها

  • Claude Opus 4.7 به یک شرکت واقعی که در اینترنت در دسترس بود دسترسی پیدا کرد و با حدس زدن رمزهای عبور ضعیف، پایگاه داده‌ای شامل چند صد ردیف را استخراج کرد.
  • Claude Mythos 5 با انتشار یک پکیج در مخزن واقعی PyPI، یک حمله زنجیره تأمین (supply-chain attack) ایجاد کرد. این پکیج پیش از آنکه مخزن (registry) متوجه این ناهنجاری شود، روی ۱۵ ماشین عملیاتی نصب شد.
  • یک مدل تحقیقاتی داخلی، ۹,۰۰۰ هدف را اسکن کرد، یک اپلیکیشن واحد را مورد نفوذ قرار داد و سپس پس از تشخیص اینکه میزبان (host) با وظیفه شبیه‌سازی شده‌اش مطابقت ندارد، فعالیت خود را متوقف کرد.

آنتروپیک تأکید می‌کند که این‌ها موارد مربوط به «هوش مصنوعی سرکش» (rogue AI) نبودند. مدل‌ها دقیقاً همان کاری را انجام دادند که به آن‌ها گفته شده بود؛ این زیرساخت تست بود که در جداسازی آن‌ها از اینترنت آزاد شکست خورد.

چرا این موضوع اهمیت دارد

این حوادث نشان می‌دهند که وقتی عوامل هوش مصنوعی (AI agents) قادر به اجرای کد و برقراری تماس‌های شبکه هستند، مرز بین یک محیط ایزوله کنترل‌شده و یک شبکه واقعی چقدر باریک است. برای شرکت‌هایی که در حال آزمایش با عوامل خودمختار هستند، یک دستور سیستم (system prompt) یا فایل README نمی‌تواند مرزها را تضمین کند. همان‌طور که مورد PyPI نشان می‌دهد، حتی یک مجموعه داده کوچک یا تعداد محدودی ماشین می‌تواند منجر به آسیب‌دیدگی‌های گسترده‌تر در زنجیره تأمین شود.

این سه مورد نفوذ همچنین نشان‌دهنده مقیاس تلاش‌های آنتروپیک است: این شرکت تمام اجراهای تست را، و نه فقط یک نمونه تصادفی، مورد حسابرسی قرار داده است. همین دقت بالا باعث شد شرکت بتواند پیش از گسترش حوادث، پیکربندی اشتباه را شناسایی کند.

اقدامات آنتروپیک

آنتروپیک ظرف یک روز پس از کشف نقص در محیط sandbox، تمام ارزیابی‌های در حال انجام را متوقف کرد. یک هفته بعد، گزارش افشای مفصلی منتشر کرد که در آن سه رویداد، علت فنی و مراحل اصلاح فوری ذکر شده بود.

نکات کاربردی برای کاربران عامل‌های هوش مصنوعی

۱. مرزهای شبکه را با بررسی‌های مستقیم تأیید کنید – فرض نکنید که یک دستور (prompt) یا فایل پیکربندی واقعاً عامل را ایزوله می‌کند. ۲. دسترسی‌ها را به حداقل ممکن محدود کنید – فقط آنچه را که وظیفه حتماً به آن نیاز دارد، اعطا کنید. ۳. قابلیت دسترسی را خودتان تست کنید – پیش از تحویل منابع حساس، دید شبکه واقعی عامل را بررسی کنید. ۴. فعالیت‌های ناخواسته را نظارت کنید – برای اتصالات خروجی یا ثبت پکیج‌هایی که از برنامه خارج هستند، هشدار تنظیم کنید.

این ماجرا بر یک حقیقت ساده تأکید می‌کند: دادن دسترسی اینترنت به یک مدل هوش مصنوعی، به اندازه دادن اطلاعات دسترسی به یک اپراتور انسانی پرخطر است. تا زمانی که تضمین‌های مربوط به محیط sandbox قابل اثبات نباشد، با هر اقدام مبتنی بر هوش مصنوعی به عنوان اقدامی بالقوه بدون محدودیت برخورد کنید و محیط را بر همان اساس ایمن‌سازی کنید.