تصور کنید شما یک مهندس ارشد امنیت اپلیکیشن در یک شرکت خدمات مالی هستید. شما قطعه کدی از یک کد احراز هویت توسعه‌یافته در داخل شرکت را به یک مدل هوش مصنوعی پیشرو می‌دهید و از آن می‌خواهید نقص‌های منطقی را شناسایی کند. به جای تحلیل، با یک سخنرانی روبرو می‌شوید. مدل با این استدلال که ممکن است از این اطلاعات برای «سوءاستفاده از یک سیستم» استفاده کنید، از انجام کار خودداری می‌کند. شما یک مجرم نیستید؛ شما همان کسی هستید که برای متوقف کردن مجرمان استخدام شده‌اید. با این حال، سیستم حفاظتی (guardrail) با هر دو نقش به شکلی غیرقابل تشخیص برخورد می‌کند.

این سناریو در حال تبدیل شدن به یک روال عادی است. در حالی که آزمایشگاه‌های بزرگ هوش مصنوعی پروتکل‌های ایمنی را برای جلوگیری از سوءاستفاده‌های مخرب تشدید می‌کنند، مستقیماً با جریان‌های کاری متخصصان مشروع امنیت سایبری برخورد می‌کنند. نتیجه یک پارادوکس رو به رشد است: ابزارهایی که به عنوان تقویت‌کننده مهندسی نرم‌افزار تبلیغ می‌شوند، از متخصصانی که از زیرساخت‌های حیاتی محافظت می‌کنند، دریغ می‌شوند.

اصطکاک میان ایمنی (Safety) و امنیت (Security)

توسعه‌دهندگان بزرگ هوش مصنوعی جامعه امنیت سایبری را کاملاً نادیده نگرفته‌اند. OpenAI برنامه‌ای به نام Trusted Access for Cyber را اجرا می‌کند. Anthropic نیز یک Cyber Verification Program دارد. هر دو طراحی شده‌اند تا به کاربران تاییدشده اجازه دهند از برخی مکانیسم‌های امتناع عبور کنند تا بتوانند تحقیقات مشروع انجام دهند. در تئوری، این دروازه‌ها بازیگران خوب را از بازیگران بد جدا می‌کنند.

در عمل، بسیاری از محققان امنیت تهاجمی و مدافعان شبکه، آن‌ها را به عنوان مانع‌های بوروکراتیک تجربه می‌کنند. فرآیندهای تایید می‌توانند مبهم باشند. زمان‌بندی‌های تأیید نامشخص است. حتی پس از پذیرش، محققان گزارش می‌دهند که دسترسی سطح بالا همیشه در نسخه‌های مختلف مدل یا رشته‌های گفتگو به طور قابل اعتماد عمل نمی‌کند. برای تیم‌هایی که برای وصله کردن (patch) آسیب‌پذیری‌ها در شرایط حمله فعال مسابقه می‌دهند، این اصطکاک اهمیت دارد.

تنش بین واشینگتن و سیلیکون ولی زمانی به یک نقطه اوج قابل توجه رسید که دولت ایالات متحده کنترل‌های صادراتی را بر مدل‌های Mythos و Fable شرکت Anthropic اعمال کرد. این محدودیت‌ها پس از گزارش‌هایی اعمال شد که نشان می‌داد افراد از حفاظ‌های ایمنی مدل‌ها برای تسهیل حملات سایبری استفاده کرده‌اند. رگولاتورها به سرعت اقدام کردند تا با این سیستم‌ها به عنوان کالاهای صادراتی منحصراً خطرناک برخورد کنند. این کنترل‌ها از آن زمان لغو یا اصلاح شده‌اند، اما این واقعه سیگنال واضحی فرستاد: مدل‌های هوش مصنوعی با قابلیت بالا، بیش از آنکه ابزارهای فنی همه‌منظوره تلقی شوند، به طور فزاینده‌ای به عنوان ابزارهای احتمالی آخرالزمانی دیده می‌شوند. برای مدافعانی که به آن‌ها متکی هستند، این دیدگاه به بازرسی‌های سنگین‌تر، دسترسی کندتر و سوءظنی زیربنایی تبدیل می‌شود که تحقیقات امنیتی صرفاً نام دیگری برای هک کردن است.

چرا دفاع و تهاجم جدایی‌ناپذیر هستند

هسته اصلی این تضاد، اداری نیست؛ بلکه فنی است. همان قابلیت‌هایی که برای دفاع از یک شبکه مورد نیاز است، تقریباً با قابلیت‌های مورد نیاز برای حمله به آن یکسان است.

Chris Anley، دانشمند ارشد در NCC Group، از یک آنالوژی ساده استفاده می‌کند: هوش مصنوعی یک چکش است. شما می‌توانید از آن برای ساختن یک خانه یا شکستن یک پنجره استفاده کنید. خودِ ابزار تفاوت این دو را نمی‌داند. در امنیت سایبری، این دوگانگی اجتناب‌ناپذیر است. وقتی یک متخصص از مدل می‌خواهد که «این کد را اصلاح کن»، این درخواست یک اقدام دفاعی را فعال می‌کند. اما فرآیند استدلالی که اصلاح را تولید می‌کند — شناسایی توابع ناامن، ردیابی ورودی‌های غیرقابل اعتماد، ترسیم جریان‌های اجرا — ناگزیر نشان می‌دهد که چگونه می‌توان آسیب‌پذیری را فعال کرد. این توضیح به عنوان نقشه‌راهی برای سوءاستفاده عمل می‌کند.

از آنجایی که تیم‌های ایمنی هوش مصنوعی اغلب مدل‌ها را طوری آموزش می‌دهند که از هر درخواستی که بوی سوءاستفاده می‌دهد خودداری کنند، این سیستم‌ها اغلب دچار اصلاح بیش از حد (overcorrect) می‌شوند. محققی که می‌پرسد چگونه ورودی کاربر را پاکسازی (sanitize) کند، پاسخی دریافت می‌کند. محققی که می‌پرسد چگونه یک