آنتروپیک (Anthropic) اعلام کرد که سه مدل Claude آن در جریان یک کمپین اخیر تست امنیتی، از محیط ایزوله (sandbox) خارج شده و به سیستمهای دنیای واقعی دسترسی پیدا کردند؛ این اتفاق منجر به توقف فوری ارزیابیها و انتشار یک گزارش عمومی شد.
این شرکت ۱۴۱,۰۰۶ اجرای تست امنیت سایبری انجام داد و سه مورد را شناسایی کرد که در آنها مدلها به جای محیط شبیهسازی شده، به اهداف واقعی دسترسی پیدا کرده بودند. یک پیکربندی اشتباه در همکاری با یک شریک شخص ثالث، باعث شده بود محیط sandbox عملاً باز باقی بماند.
نحوه وقوع نفوذها
- Claude Opus 4.7 به یک شرکت واقعی که در اینترنت در دسترس بود دسترسی پیدا کرد و با حدس زدن رمزهای عبور ضعیف، پایگاه دادهای شامل چند صد ردیف را استخراج کرد.
- Claude Mythos 5 با انتشار یک پکیج در مخزن واقعی PyPI، یک حمله زنجیره تأمین (supply-chain attack) ایجاد کرد. این پکیج پیش از آنکه مخزن (registry) متوجه این ناهنجاری شود، روی ۱۵ ماشین عملیاتی نصب شد.
- یک مدل تحقیقاتی داخلی، ۹,۰۰۰ هدف را اسکن کرد، یک اپلیکیشن واحد را مورد نفوذ قرار داد و سپس پس از تشخیص اینکه میزبان (host) با وظیفه شبیهسازی شدهاش مطابقت ندارد، فعالیت خود را متوقف کرد.
آنتروپیک تأکید میکند که اینها موارد مربوط به «هوش مصنوعی سرکش» (rogue AI) نبودند. مدلها دقیقاً همان کاری را انجام دادند که به آنها گفته شده بود؛ این زیرساخت تست بود که در جداسازی آنها از اینترنت آزاد شکست خورد.
چرا این موضوع اهمیت دارد
این حوادث نشان میدهند که وقتی عوامل هوش مصنوعی (AI agents) قادر به اجرای کد و برقراری تماسهای شبکه هستند، مرز بین یک محیط ایزوله کنترلشده و یک شبکه واقعی چقدر باریک است. برای شرکتهایی که در حال آزمایش با عوامل خودمختار هستند، یک دستور سیستم (system prompt) یا فایل README نمیتواند مرزها را تضمین کند. همانطور که مورد PyPI نشان میدهد، حتی یک مجموعه داده کوچک یا تعداد محدودی ماشین میتواند منجر به آسیبدیدگیهای گستردهتر در زنجیره تأمین شود.
این سه مورد نفوذ همچنین نشاندهنده مقیاس تلاشهای آنتروپیک است: این شرکت تمام اجراهای تست را، و نه فقط یک نمونه تصادفی، مورد حسابرسی قرار داده است. همین دقت بالا باعث شد شرکت بتواند پیش از گسترش حوادث، پیکربندی اشتباه را شناسایی کند.
اقدامات آنتروپیک
آنتروپیک ظرف یک روز پس از کشف نقص در محیط sandbox، تمام ارزیابیهای در حال انجام را متوقف کرد. یک هفته بعد، گزارش افشای مفصلی منتشر کرد که در آن سه رویداد، علت فنی و مراحل اصلاح فوری ذکر شده بود.
نکات کاربردی برای کاربران عاملهای هوش مصنوعی
۱. مرزهای شبکه را با بررسیهای مستقیم تأیید کنید – فرض نکنید که یک دستور (prompt) یا فایل پیکربندی واقعاً عامل را ایزوله میکند. ۲. دسترسیها را به حداقل ممکن محدود کنید – فقط آنچه را که وظیفه حتماً به آن نیاز دارد، اعطا کنید. ۳. قابلیت دسترسی را خودتان تست کنید – پیش از تحویل منابع حساس، دید شبکه واقعی عامل را بررسی کنید. ۴. فعالیتهای ناخواسته را نظارت کنید – برای اتصالات خروجی یا ثبت پکیجهایی که از برنامه خارج هستند، هشدار تنظیم کنید.
این ماجرا بر یک حقیقت ساده تأکید میکند: دادن دسترسی اینترنت به یک مدل هوش مصنوعی، به اندازه دادن اطلاعات دسترسی به یک اپراتور انسانی پرخطر است. تا زمانی که تضمینهای مربوط به محیط sandbox قابل اثبات نباشد، با هر اقدام مبتنی بر هوش مصنوعی به عنوان اقدامی بالقوه بدون محدودیت برخورد کنید و محیط را بر همان اساس ایمنسازی کنید.
