OpenAI امروز GPT-Red را عرضه کرد، یک مدل زبانی بزرگ که به عنوان یک هکر خودکار تیم قرمز (red-team) عمل میکند. این سیستم در حال مقاومسازی آخرین مدل شرکت، یعنی GPT-5.6 است و نرخ موفقیت حملات شبیهسازی شده را از بیش از ۹۰٪ به کمتر از ۲۳٪ کاهش داده است.
چگونه GPT-Red کار تیم قرمز را خودکار میکند
تست تیم قرمز — تلاش عمدی برای شکستن یا ربودن یک سیستم — بهطور سنتی بر متخصصان امنیت متکی بوده است. با یادگیری LLMها در مرور وب، اجرای کد و فراخوانی سرویسهای شخص ثالث، روشهای سوءاستفاده از آنها سریعتر از آن چیزی که یک تیم انسانی بتواند بررسی کند، افزایش مییابد.
OpenAI با یک «حلقه خود-بازی» (self-play loop) به این مسئله پاسخ داد که در آن یک نسخه از مدل را در یک محیط شبیهسازی شده که محققان آن را dojo مینامند، در مقابل نسخه دیگری قرار میدهد. در این محیط ایزوله (sandbox)، GPT-Red نقش مهاجم را بر عهده میگیرد، در حالی که یک یا چند مدل مدافع سعی در مقاومت دارند. این دو طرف دورهای بیشماری را طی میکنند؛ هر تکرار، مهاجم را مجبور میکند تا نقصهای ظریفتر را کشف کند و مدافع را وادار میکند تا دفاعهای جدیدی بیاموزد. OpenAI این فرآیند را در خط لوله آموزشی (training pipeline) که منجر به تولید GPT-5.6 شده، گنجانده است؛ مدلی که شرکت آن را به عنوان مستحکمترین نسخه منتشر شده خود معرفی میکند.
کلاس جدیدی از حملات: زنجیره تفکر جعلی
اجرای خود-بازی، یک حمله خیرهکننده به نام «زنجیره تفکر جعلی» (fake chain of thought) را آشکار کرد. LLMها اغلب یک ردپای استدلال گامبهگام — یعنی «زنجیره تفکر» — ارائه میدهند که پاسخ نهایی را هدایت میکند. GPT-Red یاد گرفته است که ورودیهای نادرست را در آن ردپا وارد کند و باعث شود مدل تصور کند که پیشفرضهای غلط را قبلاً تأیید کرده است. برای مثال، مهاجم میتواند مدل را متقاعد کند که عبارت «1 + 1 = 3» بررسی شده است، که باعث میشود سیستم خروجیهایی را بر اساس نتیجه ساختگی تولید کند.
این حمله محدود به مولدهای متن خالص نیست. در آزمایشی علیه «Vendy»، یک عامل (agent) به سبک دستگاه فروش خودکار که توسط یک آزمایشگاه خارجی ساخته شده است، GPT-Red فیلدهای قیمت را دستکاری کرد و سفارشها را لغو نمود، که ثابت کرد این تکنیک علیه عاملهای تخصصی که بر اساس دستورات کاربر عمل میکنند، کارایی دارد.
بهبود امنیت قابل اندازهگیری
OpenAI آماری را منتشر کرد که تأثیر آموزش در برابر GPT-Red را نشان میدهد. هنگامی که قویترین حملات تولید شده توسط مدل جدید علیه GPT-5 (نسخه عرضه شده در ماه اوت) اجرا شد، بیش از ۹۰٪ موفقیتآمیز بودند. همان حملات در برابر GPT-5.6 در کمتر از ۲۳٪ موارد موفق بودند.
در آزمایشی در سال ۲۰۲۵ که GPT-Red را در مقابل تیمهای قرمز انسانی قرار داد، هوش مصنوعی با کارایی بیشتری نسبت به انسانها، انواع حملات را کشف و اصلاح کرد؛ این امر نشان میدهد که یک مدل خصمانه (adversarial model) میتواند بخش وسیعتری از فضای آسیبپذیری را در زمان کمتری بررسی کند.
محدودیتها و نیاز مداوم به تخصص انسانی
GPT-Red جایگزین تحلیلگران امنیتی انسانی نمیشود. این مدل هنوز در برابر حملات گفتگویی چندمرحلهای (که در آن مهاجم یک روایت را طی چندین تبادل برقرار میکند) و همچنین در برابر تزریقهای دستور تصویری (visual prompt injections) که متنهای مخرب را در داخل تصاویر پنهان میکنند، دچار مشکل میشود. OpenAI قصد دارد از این مدل به عنوان یک کاوشگر خط اول استفاده کند تا ایدههای حمله نویدبخش را برای بررسی و گسترش توسط متخصصان انسانی شناسایی کند.
این ابزار اختصاصی باقی مانده است، بنابراین محققان خارجی نمیتوانند مستقیماً قابلیتهای آن را آزمایش کنند یا بهبودهای گزارش شده را تأیید نمایند.
