چرا OpenAI به یک مهاجم هوش مصنوعی روی آورد

تمرینات سنتی تیم قرمز (red-team) مهندسان امنیت را مجبور می‌کند تا مدل‌ها را به صورت دستی بررسی کنند؛ فرآیندی کند و پرهزینه که محدود به تخیل انسان است. OpenAI با معرفی GPT-Red به این چالش پاسخ داد؛ یک سیستم self-play که یک مدل مهاجم را در برابر یک مدل هم‌نوعِ مدافع قرار می‌دهد. هر دور حمله، داده‌های جدیدی را به مدافع می‌رساند؛ مهاجم از هر شکست درس می‌گیرد و یک حلقه تکاملی ایجاد می‌کند که الگوهای سوءاستفاده‌ای را آشکار می‌سازد که هیچ انسانی به فکر امتحان کردن آن‌ها نخواهد بود.

ارقام مهم

  • موفقیت حمله: GPT-Red در ۸۴٪ از موارد آزمایشی موفق بود، در حالی که این میزان برای تیم‌های قرمز انسانی تنها ۱۳٪ بود.
  • مقاوم‌سازی مدل: OpenAI بینش‌های به‌دست‌آمده از GPT-Red را مستقیماً وارد خط لوله آموزش (training pipeline) کرد؛ اکنون GPT-5.6 Sol شش برابر کمتر از مدل پرچمداری که چهار ماه قبل عرضه شده بود، در برابر حملات prompt-injection شکست می‌خورد.
  • ریسک باقی‌مانده: حتی با وجود دفاع‌های جدید، حدود ۳.۸٪ از تزریق‌های «قوی‌تر» همچنان موفق می‌شوند عبور کنند؛ نرخ شکستی که با Claude Opus 4.5 قابل مقایسه است.

یک نمایش زنده قدرت این سیستم را نشان داد: GPT-Red یک دستگاه فروش خودکار تحت کنترل هوش مصنوعی را در دفتر OpenAI دستکاری کرد، قیمت کالاها را تغییر داد و سفارش‌ها را بدون هیچ مداخله انسانی لغو کرد.

این بهبود چه معنایی برای کاربران دارد

OpenAI می‌گوید GPT-5.6 Sol همان سرعت استدلال و کیفیت پاسخ‌دهی مدل قبلی خود را حفظ کرده است و بدین ترتیب از توازن همیشگی میان «ایمنی و کارایی» (safety-utility tradeoff) که در آن تدابیر امنیتی سخت‌گیرانه باعث کاهش کارایی می‌شود، عبور کرده است.

محدودیت‌های یک تیم قرمز خودکار

خودکارسازی تمام ریسک‌ها را از بین نمی‌برد. نرخ موفقیت ۳.۸ درصدی برای تزریق‌های با قدرت بالا نشان می‌دهد که حتی یک سیستم پیچیده self-play نیز شکاف‌هایی را باقی می‌گذارد.

آنچه باید در آینده زیر نظر داشت

  • ارتقاهای تکرارشونده: حلقه self-play به تکامل خود ادامه خواهد داد.

خلاصه کلام

GPT-Red ثابت می‌کند که یک هوش مصنوعی می‌تواند در یافتن نقص‌های هم‌نوع خود، از انسان‌ها پیشی بگیرد و باعث کاهش شش برابریِ قابل اندازه‌گیری در شکست‌های ناشی از prompt-injection برای GPT-5.6 شود. این پیشرفت شکاف بین ایمنی و کارایی را کاهش می‌دهد، اما همچنان یک ریسک باقی‌مانده‌ی کوچک و واقعی وجود دارد. فصل بعدی بستگی به این دارد که OpenAI چگونه بینش‌های تیم قرمز خودکار را با نظارت‌های خارجی ترکیب کند تا از رقبایی که خود نیز به طور فزاینده‌ای به هوش مصنوعی روی می‌آورند، پیشی بگیرد.