تصور کنید شما یک مهندس ارشد امنیت اپلیکیشن در یک شرکت خدمات مالی هستید. شما قطعه کدی از یک کد احراز هویت توسعهیافته در داخل شرکت را به یک مدل هوش مصنوعی پیشرو میدهید و از آن میخواهید نقصهای منطقی را شناسایی کند. به جای تحلیل، با یک سخنرانی روبرو میشوید. مدل با این استدلال که ممکن است از این اطلاعات برای «سوءاستفاده از یک سیستم» استفاده کنید، از انجام کار خودداری میکند. شما یک مجرم نیستید؛ شما همان کسی هستید که برای متوقف کردن مجرمان استخدام شدهاید. با این حال، سیستم حفاظتی (guardrail) با هر دو نقش به شکلی غیرقابل تشخیص برخورد میکند.
این سناریو در حال تبدیل شدن به یک روال عادی است. در حالی که آزمایشگاههای بزرگ هوش مصنوعی پروتکلهای ایمنی را برای جلوگیری از سوءاستفادههای مخرب تشدید میکنند، مستقیماً با جریانهای کاری متخصصان مشروع امنیت سایبری برخورد میکنند. نتیجه یک پارادوکس رو به رشد است: ابزارهایی که به عنوان تقویتکننده مهندسی نرمافزار تبلیغ میشوند، از متخصصانی که از زیرساختهای حیاتی محافظت میکنند، دریغ میشوند.
اصطکاک میان ایمنی (Safety) و امنیت (Security)
توسعهدهندگان بزرگ هوش مصنوعی جامعه امنیت سایبری را کاملاً نادیده نگرفتهاند. OpenAI برنامهای به نام Trusted Access for Cyber را اجرا میکند. Anthropic نیز یک Cyber Verification Program دارد. هر دو طراحی شدهاند تا به کاربران تاییدشده اجازه دهند از برخی مکانیسمهای امتناع عبور کنند تا بتوانند تحقیقات مشروع انجام دهند. در تئوری، این دروازهها بازیگران خوب را از بازیگران بد جدا میکنند.
در عمل، بسیاری از محققان امنیت تهاجمی و مدافعان شبکه، آنها را به عنوان مانعهای بوروکراتیک تجربه میکنند. فرآیندهای تایید میتوانند مبهم باشند. زمانبندیهای تأیید نامشخص است. حتی پس از پذیرش، محققان گزارش میدهند که دسترسی سطح بالا همیشه در نسخههای مختلف مدل یا رشتههای گفتگو به طور قابل اعتماد عمل نمیکند. برای تیمهایی که برای وصله کردن (patch) آسیبپذیریها در شرایط حمله فعال مسابقه میدهند، این اصطکاک اهمیت دارد.
تنش بین واشینگتن و سیلیکون ولی زمانی به یک نقطه اوج قابل توجه رسید که دولت ایالات متحده کنترلهای صادراتی را بر مدلهای Mythos و Fable شرکت Anthropic اعمال کرد. این محدودیتها پس از گزارشهایی اعمال شد که نشان میداد افراد از حفاظهای ایمنی مدلها برای تسهیل حملات سایبری استفاده کردهاند. رگولاتورها به سرعت اقدام کردند تا با این سیستمها به عنوان کالاهای صادراتی منحصراً خطرناک برخورد کنند. این کنترلها از آن زمان لغو یا اصلاح شدهاند، اما این واقعه سیگنال واضحی فرستاد: مدلهای هوش مصنوعی با قابلیت بالا، بیش از آنکه ابزارهای فنی همهمنظوره تلقی شوند، به طور فزایندهای به عنوان ابزارهای احتمالی آخرالزمانی دیده میشوند. برای مدافعانی که به آنها متکی هستند، این دیدگاه به بازرسیهای سنگینتر، دسترسی کندتر و سوءظنی زیربنایی تبدیل میشود که تحقیقات امنیتی صرفاً نام دیگری برای هک کردن است.
چرا دفاع و تهاجم جداییناپذیر هستند
هسته اصلی این تضاد، اداری نیست؛ بلکه فنی است. همان قابلیتهایی که برای دفاع از یک شبکه مورد نیاز است، تقریباً با قابلیتهای مورد نیاز برای حمله به آن یکسان است.
Chris Anley، دانشمند ارشد در NCC Group، از یک آنالوژی ساده استفاده میکند: هوش مصنوعی یک چکش است. شما میتوانید از آن برای ساختن یک خانه یا شکستن یک پنجره استفاده کنید. خودِ ابزار تفاوت این دو را نمیداند. در امنیت سایبری، این دوگانگی اجتنابناپذیر است. وقتی یک متخصص از مدل میخواهد که «این کد را اصلاح کن»، این درخواست یک اقدام دفاعی را فعال میکند. اما فرآیند استدلالی که اصلاح را تولید میکند — شناسایی توابع ناامن، ردیابی ورودیهای غیرقابل اعتماد، ترسیم جریانهای اجرا — ناگزیر نشان میدهد که چگونه میتوان آسیبپذیری را فعال کرد. این توضیح به عنوان نقشهراهی برای سوءاستفاده عمل میکند.
از آنجایی که تیمهای ایمنی هوش مصنوعی اغلب مدلها را طوری آموزش میدهند که از هر درخواستی که بوی سوءاستفاده میدهد خودداری کنند، این سیستمها اغلب دچار اصلاح بیش از حد (overcorrect) میشوند. محققی که میپرسد چگونه ورودی کاربر را پاکسازی (sanitize) کند، پاسخی دریافت میکند. محققی که میپرسد چگونه یک
