Anthropic و OpenAI هر کدام یک مسیر تحقیقاتی جدید را باز کرده‌اند که به تیم‌های امنیتی تأییدشده اجازه می‌دهد با مدل‌های هوش مصنوعی که اکثر فیلترهای ایمنی آن‌ها حذف شده است، کار کنند. «Cyber Verification Program» شرکت Anthropic و «Trusted Access for Cyber» شرکت OpenAI، دسترسی مستقیم به مدل‌های زبانی قدرتمندی را فراهم می‌کنند که می‌توانند کدها، پرامپت‌ها و دستورالعمل‌های بدون محدودیت تولید کنند. این اقدام از این جهت اهمیت دارد که یک شکاف آشکار در زنجیره تأمین هوش مصنوعی ایجاد می‌کند: تعداد محدودی از افراد داخلی می‌توانند نسخه‌های ضعیف‌تر را بررسی کنند، در حالی که بقیه جهان پشت حفاظ‌های قوی‌تر باقی می‌مانند.

چرا این برنامه‌ها پدید آمدند

هر دو شرکت می‌گویند هدف از این ابتکارات، تسریع در کشف آسیب‌پذیری‌هایی است که می‌توان از آن‌ها علیه خدماتشان به عنوان ابزار استفاده کرد. آن‌ها با در اختیار گذاشتن یک محیط آزمایشی (sandbox) با محدودیت‌های کمتر برای گروه کنترل‌شده‌ای از متخصصان، امیدوارند بردارهای حمله را پیش از آنکه بازیگران مخرب آن‌ها را پیدا کنند، شناسایی کنند. این رویکرد مشابه امنیت سنتی نرم‌افزار است که در آن توسعه‌دهندگان نسخه‌های مخصوص «پاداش کشف باگ» (bug-bounty) را برای مخاطبان منتخب منتشر می‌کنند.

محاسبات جدید ریسک برای مدافعان

جنبه دیگر ماجرا، یک مدل دسترسی دو سطحی است که هر سازمان را مجبور می‌کند مرزی بین «محقق» و «هکر» ترسیم کند. این مرز اکنون به یک سطح حمله بالقوه تبدیل می‌شود. اگر مهاجم بتواند اعتبارنامه‌ها را سرقت کند، از دسترسی یک فرد داخلی سوءاستفاده کند یا فرآیند تأیید صلاحیت را فریب دهد، می‌تواند از حفاظ‌هایی که از اکثر کاربران محافظت می‌کنند، عبور کند. پس از ورود، می‌توان مدل بدون محدودیت را وادار به انجام کارهای زیر کرد:

  • تولید اسکریپت‌های فیشینگ که از شناسایی فرار می‌کنند
  • طراحی اکسپلویت‌های روز صفر (zero-day) با قطعه‌کدهای دقیق
  • تولید پرامپت‌های مهندسی اجتماعی متقاعدکننده که برای اهداف خاص طراحی شده‌اند

تیم‌های امنیتی که دفاع خود را بر این فرض بنا کرده‌اند که خروجی‌های هوش مصنوعی همیشه فیلتر می‌شوند، باید در این پیش‌فرض تجدیدنظر کنند.

مدافعان چگونه می‌توانند پاسخ دهند

  • با این برنامه‌ها به عنوان یک بردار تهدید برخورد کنید. فرض کنید مهاجمان سعی خواهند کرد به خط لوله تأیید صلاحیت نفوذ کنند؛ بنابراین الگوهای ورود غیرعادی به پلتفرم‌های هوش مصنوعی را زیر نظر بگیرید.
  • تشخیص را فراتر از فضای ابری گسترش دهید. در ترافیک خروجی، به‌ویژه از حساب‌های دارای دسترسی ویژه، به دنبال کد یا متن تولید شده توسط هوش مصنوعی باشید.
  • کنترل‌های سیاستی را به صورت ساختاری اعمال کنید. قوانین سخت‌گیرانه «حداقل سطح دسترسی» (least-privilege) را برای هرگونه استفاده داخلی از سرویس‌های هوش مصنوعی خارجی اعمال کنید و محیط‌هایی را که ممکن است از طریق یک اعتبارنامه لو رفته قابل دسترسی باشند، بخش‌بندی کنید.
  • با ارائه‌دهندگان همکاری کنید. با کانال‌های ارتباطی امنیتی Anthropic و OpenAI در ارتباط باشید تا درباره تغییرات در معیارهای دسترسی یا سوءاستفاده‌های کشف‌شده، هشدار دریافت کنید.

دیدگاه مخالف

طرفداران استدلال می‌کنند که بدون یک کانال امن برای بررسی‌های عمیق، آسیب‌پذیری‌ها پنهان خواهند ماند تا زمانی که در دنیای واقعی مورد سوءاستفاده قرار گیرند. بنابراین، این برنامه‌ها می‌توانند با شناسایی زودهنگام نقص‌ها، سطح حمله کلی را کاهش دهند. تقابل این موضوع در این است که یک سطح «کمتر محافظت‌شده»، راه را برای سوءاستفاده‌های فرصت‌طلبانه باز می‌کند.

چه چیزهایی را باید زیر نظر داشت

  • به‌روزرسانی‌های فرآیند تأیید صلاحیت توسط هر یک از شرکت‌ها
  • گزارش‌های مربوط به سوءاستفاده ناشی از این برنامه‌ها
  • تغییرات در سطح صنعت در نحوه فهرست‌گذاری سطوح حمله مرتبط با هوش مصنوعی

خلاصه کلام: مسیرهای تحقیقاتی جدید ابزارهای قدرتمندی را در اختیار محققان امنیتی قرار می‌دهند، اما همین ابزارها را در اختیار هر کسی که بتواند از دروازه‌ها عبور کند نیز قرار می‌دهند. تیم‌های دفاعی باید با این برنامه‌ها هم به عنوان منبعی برای کسب بینش و هم به عنوان مسیری تازه برای حمله برخورد کنند.