OpenAI امروز GPT-Red را عرضه کرد، یک مدل زبانی بزرگ که به عنوان یک هکر خودکار تیم قرمز (red-team) عمل می‌کند. این سیستم در حال مقاوم‌سازی آخرین مدل شرکت، یعنی GPT-5.6 است و نرخ موفقیت حملات شبیه‌سازی شده را از بیش از ۹۰٪ به کمتر از ۲۳٪ کاهش داده است.

چگونه GPT-Red کار تیم قرمز را خودکار می‌کند

تست تیم قرمز — تلاش عمدی برای شکستن یا ربودن یک سیستم — به‌طور سنتی بر متخصصان امنیت متکی بوده است. با یادگیری LLMها در مرور وب، اجرای کد و فراخوانی سرویس‌های شخص ثالث، روش‌های سوءاستفاده از آن‌ها سریع‌تر از آن چیزی که یک تیم انسانی بتواند بررسی کند، افزایش می‌یابد.

OpenAI با یک «حلقه خود-بازی» (self-play loop) به این مسئله پاسخ داد که در آن یک نسخه از مدل را در یک محیط شبیه‌سازی شده که محققان آن را dojo می‌نامند، در مقابل نسخه دیگری قرار می‌دهد. در این محیط ایزوله (sandbox)، GPT-Red نقش مهاجم را بر عهده می‌گیرد، در حالی که یک یا چند مدل مدافع سعی در مقاومت دارند. این دو طرف دورهای بی‌شماری را طی می‌کنند؛ هر تکرار، مهاجم را مجبور می‌کند تا نقص‌های ظریف‌تر را کشف کند و مدافع را وادار می‌کند تا دفاع‌های جدیدی بیاموزد. OpenAI این فرآیند را در خط لوله آموزشی (training pipeline) که منجر به تولید GPT-5.6 شده، گنجانده است؛ مدلی که شرکت آن را به عنوان مستحکم‌ترین نسخه منتشر شده خود معرفی می‌کند.

کلاس جدیدی از حملات: زنجیره تفکر جعلی

اجرای خود-بازی، یک حمله خیره‌کننده به نام «زنجیره تفکر جعلی» (fake chain of thought) را آشکار کرد. LLMها اغلب یک ردپای استدلال گام‌به‌گام — یعنی «زنجیره تفکر» — ارائه می‌دهند که پاسخ نهایی را هدایت می‌کند. GPT-Red یاد گرفته است که ورودی‌های نادرست را در آن ردپا وارد کند و باعث شود مدل تصور کند که پیش‌فرض‌های غلط را قبلاً تأیید کرده است. برای مثال، مهاجم می‌تواند مدل را متقاعد کند که عبارت «1 + 1 = 3» بررسی شده است، که باعث می‌شود سیستم خروجی‌هایی را بر اساس نتیجه ساختگی تولید کند.

این حمله محدود به مولدهای متن خالص نیست. در آزمایشی علیه «Vendy»، یک عامل (agent) به سبک دستگاه فروش خودکار که توسط یک آزمایشگاه خارجی ساخته شده است، GPT-Red فیلدهای قیمت را دستکاری کرد و سفارش‌ها را لغو نمود، که ثابت کرد این تکنیک علیه عامل‌های تخصصی که بر اساس دستورات کاربر عمل می‌کنند، کارایی دارد.

بهبود امنیت قابل اندازه‌گیری

OpenAI آماری را منتشر کرد که تأثیر آموزش در برابر GPT-Red را نشان می‌دهد. هنگامی که قوی‌ترین حملات تولید شده توسط مدل جدید علیه GPT-5 (نسخه عرضه شده در ماه اوت) اجرا شد، بیش از ۹۰٪ موفقیت‌آمیز بودند. همان حملات در برابر GPT-5.6 در کمتر از ۲۳٪ موارد موفق بودند.

در آزمایشی در سال ۲۰۲۵ که GPT-Red را در مقابل تیم‌های قرمز انسانی قرار داد، هوش مصنوعی با کارایی بیشتری نسبت به انسان‌ها، انواع حملات را کشف و اصلاح کرد؛ این امر نشان می‌دهد که یک مدل خصمانه (adversarial model) می‌تواند بخش وسیع‌تری از فضای آسیب‌پذیری را در زمان کمتری بررسی کند.

محدودیت‌ها و نیاز مداوم به تخصص انسانی

GPT-Red جایگزین تحلیلگران امنیتی انسانی نمی‌شود. این مدل هنوز در برابر حملات گفتگویی چندمرحله‌ای (که در آن مهاجم یک روایت را طی چندین تبادل برقرار می‌کند) و همچنین در برابر تزریق‌های دستور تصویری (visual prompt injections) که متن‌های مخرب را در داخل تصاویر پنهان می‌کنند، دچار مشکل می‌شود. OpenAI قصد دارد از این مدل به عنوان یک کاوشگر خط اول استفاده کند تا ایده‌های حمله نویدبخش را برای بررسی و گسترش توسط متخصصان انسانی شناسایی کند.

این ابزار اختصاصی باقی مانده است، بنابراین محققان خارجی نمی‌توانند مستقیماً قابلیت‌های آن را آزمایش کنند یا بهبودهای گزارش شده را تأیید نمایند.