گزارش سوءاستفاده Anthropic نشان می‌دهد که بازیگران مخرب، Claude را به ابزاری برای تولید انبوه پیام‌های اسپم، فعالیت‌های سیاسی و نوشتن بدافزار تبدیل کرده‌اند. بین ماه‌های دسامبر و اوت، گروهی از این مدل برای تولید ۲ میلیون پیام از طریق ۴۷۰۰ هویت جعلی در اپلیکیشن‌های دوستیابی، تقلید لحن یک فعال برای فریب مخاطبان، و نوشتن کد برای نظارت و تسلیحات استفاده کردند.

چرا این گزارش اهمیت دارد

متن‌های تولید شده توسط هوش مصنوعی زمانی صرفاً موضوعی برای کنجکاوی آماتورها بود. داده‌های جدید ثابت می‌کنند که این فناوری به قدری ارزان است که می‌تواند کارهای تکراری را که زمانی مانع از سوءاستفاده در مقیاس بزرگ می‌شد، خودکار کند. ساخت و نگهداری هزاران هویت ساختگی، یا بازنویسی کدهای مخرب پس از شناسایی توسط ابزارهای امنیتی، پیش از این نیازمند تیم‌های انسانی بود. Claude این موانع را به چند کلیک کاهش داده و یک کار دشوار و دستی را به یک فرآیند تکرارپذیر تبدیل کرده است.

ابعاد مشکل

  • اسپم: ۴۷۰۰ هویت جعلی، ۲ میلیون پیام تبلیغاتی شخصی‌سازی‌شده ارسال کردند که فیلتر کردن آن‌ها دشوار است.
  • جعل هویت: سبک نوشتاری یک فعال کپی شد و به مهاجمان اجازه داد تا درخواست‌های متقاعدکننده‌ای را برای شبکه ارتباطی آن فعال ارسال کنند.
  • بدافزار و نظارت: کاربران اسکریپت‌های تولید شده توسط Claude را برای دور زدن سیستم‌های شناسایی استخراج کرده و پس از هر بار مسدود شدن، دوباره آن‌ها را به کار می‌گرفتند.

تغییر اصلی از پیام‌های مخربِ پراکنده به عملیات‌های مداوم و در مقیاس بزرگ است.

پاسخ Anthropic

Anthropic حساب‌های متخلف را مسدود و فعالیت‌های شناسایی‌شده را متوقف کرد. این اقدام جریان مستقیم پیام‌ها از سوی آن کاربران را متوقف کرد، اما کدها یا ربات‌هایی را که پیش از آن در فضای عمومی منتشر شده بودند، از بین نبرد. زمانی که یک ابزار بسته‌بندی و توزیع می‌شود، کنترل ارائه‌دهنده بر آن پایان می‌یابد.

آنچه این گزارش درباره ایمنی هوش مصنوعی می‌گوید

این گزارش باعث می‌شود در نحوه مدیریت درخواست‌های «خطرناک» تجدیدنظر شود. لیست‌های ایستا از دستورات (prompts) ممنوعه دیگر کارساز نیستند. یادداشت‌های داخلی Anthropic خواستار موارد زیر است:

  • نظارت مستمر بر الگوهای استفاده، به جای بررسی‌های موردی و گذرا.
  • کنترل‌های دسترسی سخت‌گیرانه‌تر برای محدود کردن افرادی که می‌توانند مدل را در مقیاس بزرگ اجرا کنند.
  • تحلیلگران انسانی برای شناسایی خوشه‌هایی از درخواست‌های کوچک و ظاهراً بی‌خطر که در کنار هم یک تهدید بزرگتر را تشکیل می‌دهند.

چالش پیش روی مدیران

تدابیر امنیتی سخت‌گیرانه‌تر می‌تواند مانع تحقیقات مشروع، نمونه‌سازی سریع و ویژگی‌های مشتری‌محور شود که به خروجی‌های منعطف هوش مصنوعی متکی هستند. سیاست‌های سهل‌گیرانه‌تر نیز اجازه می‌دهد سوءاستفاده‌ها بدون کنترل گسترش یابند که این امر خطر آسیب به برند، نظارت‌های قانونی و آسیب‌های دنیای واقعی را به همراه دارد. تصمیم‌گیرندگان باید بین افزایش بهره‌وری و هزینه سوءاستفاده‌های احتمالی تعادل برقرار کنند.

نگاه به آینده

اگر این روند ادامه یابد، ایمنی هوش مصنوعی از یک دغدغه آزمایشگاهی به یک دغدغه عملیاتی تبدیل خواهد شد. شرکت‌ها به تیم‌های اختصاصی نیاز خواهند داشت که با سوءاستفاده از مدل، مانند هر حادثه امنیتی دیگری برخورد کنند؛ یعنی نظارت بر گزارش‌ها (logs)، به‌روزرسانی کنترل‌ها و پاسخگویی به رخنه‌ها در لحظه. گزارش سوءاستفاده از Claude هشدار می‌دهد که ابزارهایی که برای کمک طراحی شده‌اند، در مقیاس بزرگ می‌توانند به همان سلاح‌هایی تبدیل شوند که قرار بود جایگزین آن‌ها باشند.