Чому OpenAI звернулася до ШІ-атакувальника

Традиційні вправи red-team змушують інженерів із безпеки перевіряти моделі вручну — це повільний і дорогий процес, обмежений людською уявою. OpenAI відповіла системою GPT-Red — механізмом self-play, який протиставляє модель-атакувальника моделі-захиснику. Кожен раунд атаки надає захиснику нові дані; атакувальник вчиться на кожній невдачі, створюючи еволюційний цикл, який виявляє такі патерни експлуатації, про які людина б навіть не подумала.

Цифри, які мають значення

  • Успішність атак: GPT-Red успішно пройшла 84 % тестових випадків, порівняно з 13 % у людей-red-teamers.
  • Посилення моделей: OpenAI впровадила висновки GPT-Red безпосередньо в конвеєр навчання, і тепер GPT-5.6 Sol демонструє у шість разів менше збоїв через prompt-injection, ніж флагманська модель, випущена чотири місяці тому.
  • Залишковий ризик: Навіть із новими методами захисту близько 3,8 % «сильніших» ін'єкцій все одно проходять — цей рівень невдач порівнянний із Claude Opus 4.5.

Жива демонстрація підкреслила потужність системи: GPT-Red маніпулювала керованим ШІ торговим автоматом в офісі OpenAI, змінюючи ціни на товари та скасовуючи замовлення без будь-якого втручання людини.

Що це покращення означає для користувачів

В OpenAI заявляють, що GPT-5.6 Sol зберігає таку ж швидкість міркування та якість відповідей, як і її попередниця, долаючи давній компроміс між безпекою та корисністю, коли жорсткіші заходи захисту знижують ефективність системи.

Обмеження автоматизованого red team

Автоматизація не усуває всі ризики. 3,8 % успішних високоефективних ін'єкцій свідчать про те, що навіть складна система self-play залишає прогалини.

На що варто звернути увагу далі

  • Ітеративні оновлення: Цикл self-play продовжуватиме розвиватися.

Підсумок

GPT-Red доводить, що ШІ може перевершити людей у пошуку недоліків у собі подібних, забезпечивши вимірюване шестикратне зниження збоїв через prompt-injection для GPT-5.6. Цей прорив звужує розрив між безпекою та корисністю, проте невеликий реальний залишковий ризик зберігається. Наступний етап залежатиме від того, як OpenAI поєднає результати автоматизованого red-team із зовнішнім аудитом, щоб залишатися на крок попереду супротивників, які самі дедалі частіше звертаються до ШІ.