Сегодня OpenAI запустила GPT-Red — большую языковую модель, которая выступает в роли автоматизированного хакера для проведения атак red-team. Система уже укрепляет защиту новейшей модели компании GPT-5.6, резко снижая вероятность успеха симулированных атак с более чем 90 % до менее чем 23 %.
Как GPT-Red автоматизирует работу red-team
Тестирование методом red-team — намеренные попытки взломать или захватить контроль над системой — традиционно опиралось на экспертов по безопасности. По мере того как LLM учатся просматривать веб-страницы, запускать код и обращаться к сторонним сервисам, способы их неправомерного использования множатся быстрее, чем человеческая команда успевает их изучить.
OpenAI ответила внедрением «цикла самоигры» (self-play loop), в котором одна копия модели противостоит другой внутри симулированной среды, которую исследователи называют «додзё» (dojo). В этой «песочнице» GPT-Red берет на себя роль атакующего, в то время как одна или несколько моделей-защитников пытаются оказать сопротивление. Стороны проводят бесчисленное количество раундов; каждая итерация заставляет атакующего находить всё более тонкие уязвимости, а защитника — осваивать новые методы обороны. OpenAI интегрировала этот процесс в конвейер обучения, на котором была создана GPT-5.6, которую компания называет своим самым устойчивым релизом на данный момент.
Новый класс атак: поддельная цепочка рассуждений
В ходе циклов самоигры была обнаружена поразительная атака типа «поддельная цепочка рассуждений» (fake chain of thought). LLM часто выдают пошаговый процесс рассуждения — «цепочку мыслей» (chain of thought), — который ведет к окончательному ответу. GPT-Red научилась вставлять в эту цепочку ложные записи, заставляя модель верить, что она уже проверила неверные предпосылки. Например, атакующий может убедить модель в том, что утверждение «1 + 1 = 3» уже было проверено, что побуждает систему выдавать ответы, основанные на сфабрикованном результате.
Атака не ограничивается только текстовыми генераторами. В ходе теста против Vendy — агента в стиле торгового автомата, созданного сторонней лабораторией, — GPT-Red манипулировала полями цен и отменяла заказы, доказав, что этот метод работает и против специализированных агентов, действующих по командам пользователя.
Измеримое повышение уровня безопасности
OpenAI опубликовала данные, демонстрирующие эффект обучения с использованием GPT-Red. Когда самые мощные атаки, созданные новой моделью, применялись к GPT-5 (выпущенной в августе), более 90 % из них были успешными. Те же самые атаки против GPT-5.6 проходили успешно менее чем в 23 % случаев.
В эксперименте 2025 года, в котором GPT-Red противостояла специалистам red-team, ИИ обнаруживал и совершенствовал варианты атак эффективнее людей. Это говорит о том, что состязательная модель способна исследовать более широкий спектр уязвимостей за меньшее время.
Ограничения и сохраняющаяся потребность в экспертных знаниях человека
GPT-Red не заменяет аналитиков по безопасности. Она всё еще пасует перед многоходовыми диалоговыми атаками, где атакующий выстраивает повествование в течение нескольких реплик, а также перед визуальными инъекциями промптов, которые скрывают вредоносный текст внутри изображений. OpenAI планирует использовать модель в качестве инструмента первичного зондирования, выявляя перспективные идеи для атак, которые затем эксперты-люди смогут исследовать и развивать.
Инструмент остается проприетарным, поэтому внешние исследователи не могут напрямую протестировать его возможности или проверить заявленные результаты.
