Anthropic و OpenAI هر کدام یک مسیر تحقیقاتی جدید را باز کردهاند که به تیمهای امنیتی تأییدشده اجازه میدهد با مدلهای هوش مصنوعی که اکثر فیلترهای ایمنی آنها حذف شده است، کار کنند. «Cyber Verification Program» شرکت Anthropic و «Trusted Access for Cyber» شرکت OpenAI، دسترسی مستقیم به مدلهای زبانی قدرتمندی را فراهم میکنند که میتوانند کدها، پرامپتها و دستورالعملهای بدون محدودیت تولید کنند. این اقدام از این جهت اهمیت دارد که یک شکاف آشکار در زنجیره تأمین هوش مصنوعی ایجاد میکند: تعداد محدودی از افراد داخلی میتوانند نسخههای ضعیفتر را بررسی کنند، در حالی که بقیه جهان پشت حفاظهای قویتر باقی میمانند.
چرا این برنامهها پدید آمدند
هر دو شرکت میگویند هدف از این ابتکارات، تسریع در کشف آسیبپذیریهایی است که میتوان از آنها علیه خدماتشان به عنوان ابزار استفاده کرد. آنها با در اختیار گذاشتن یک محیط آزمایشی (sandbox) با محدودیتهای کمتر برای گروه کنترلشدهای از متخصصان، امیدوارند بردارهای حمله را پیش از آنکه بازیگران مخرب آنها را پیدا کنند، شناسایی کنند. این رویکرد مشابه امنیت سنتی نرمافزار است که در آن توسعهدهندگان نسخههای مخصوص «پاداش کشف باگ» (bug-bounty) را برای مخاطبان منتخب منتشر میکنند.
محاسبات جدید ریسک برای مدافعان
جنبه دیگر ماجرا، یک مدل دسترسی دو سطحی است که هر سازمان را مجبور میکند مرزی بین «محقق» و «هکر» ترسیم کند. این مرز اکنون به یک سطح حمله بالقوه تبدیل میشود. اگر مهاجم بتواند اعتبارنامهها را سرقت کند، از دسترسی یک فرد داخلی سوءاستفاده کند یا فرآیند تأیید صلاحیت را فریب دهد، میتواند از حفاظهایی که از اکثر کاربران محافظت میکنند، عبور کند. پس از ورود، میتوان مدل بدون محدودیت را وادار به انجام کارهای زیر کرد:
- تولید اسکریپتهای فیشینگ که از شناسایی فرار میکنند
- طراحی اکسپلویتهای روز صفر (zero-day) با قطعهکدهای دقیق
- تولید پرامپتهای مهندسی اجتماعی متقاعدکننده که برای اهداف خاص طراحی شدهاند
تیمهای امنیتی که دفاع خود را بر این فرض بنا کردهاند که خروجیهای هوش مصنوعی همیشه فیلتر میشوند، باید در این پیشفرض تجدیدنظر کنند.
مدافعان چگونه میتوانند پاسخ دهند
- با این برنامهها به عنوان یک بردار تهدید برخورد کنید. فرض کنید مهاجمان سعی خواهند کرد به خط لوله تأیید صلاحیت نفوذ کنند؛ بنابراین الگوهای ورود غیرعادی به پلتفرمهای هوش مصنوعی را زیر نظر بگیرید.
- تشخیص را فراتر از فضای ابری گسترش دهید. در ترافیک خروجی، بهویژه از حسابهای دارای دسترسی ویژه، به دنبال کد یا متن تولید شده توسط هوش مصنوعی باشید.
- کنترلهای سیاستی را به صورت ساختاری اعمال کنید. قوانین سختگیرانه «حداقل سطح دسترسی» (least-privilege) را برای هرگونه استفاده داخلی از سرویسهای هوش مصنوعی خارجی اعمال کنید و محیطهایی را که ممکن است از طریق یک اعتبارنامه لو رفته قابل دسترسی باشند، بخشبندی کنید.
- با ارائهدهندگان همکاری کنید. با کانالهای ارتباطی امنیتی Anthropic و OpenAI در ارتباط باشید تا درباره تغییرات در معیارهای دسترسی یا سوءاستفادههای کشفشده، هشدار دریافت کنید.
دیدگاه مخالف
طرفداران استدلال میکنند که بدون یک کانال امن برای بررسیهای عمیق، آسیبپذیریها پنهان خواهند ماند تا زمانی که در دنیای واقعی مورد سوءاستفاده قرار گیرند. بنابراین، این برنامهها میتوانند با شناسایی زودهنگام نقصها، سطح حمله کلی را کاهش دهند. تقابل این موضوع در این است که یک سطح «کمتر محافظتشده»، راه را برای سوءاستفادههای فرصتطلبانه باز میکند.
چه چیزهایی را باید زیر نظر داشت
- بهروزرسانیهای فرآیند تأیید صلاحیت توسط هر یک از شرکتها
- گزارشهای مربوط به سوءاستفاده ناشی از این برنامهها
- تغییرات در سطح صنعت در نحوه فهرستگذاری سطوح حمله مرتبط با هوش مصنوعی
خلاصه کلام: مسیرهای تحقیقاتی جدید ابزارهای قدرتمندی را در اختیار محققان امنیتی قرار میدهند، اما همین ابزارها را در اختیار هر کسی که بتواند از دروازهها عبور کند نیز قرار میدهند. تیمهای دفاعی باید با این برنامهها هم به عنوان منبعی برای کسب بینش و هم به عنوان مسیری تازه برای حمله برخورد کنند.
