OpenAI wprowadziło dziś GPT-Red, duży model językowy, który działa jako zautomatyzowany haker typu red-team. System ten już teraz wzmacnia najnowszy model firmy, GPT-5.6, obniżając skuteczność symulowanych ataków z ponad 90% do mniej niż 23%.
Jak GPT-Red automatyzuje pracę red-teamu
Testy typu red-team — polegające na celowym próbowaniu złamania lub przejęcia systemu — tradycyjnie opierały się na ekspertach ds. bezpieczeństwa. W miarę jak modele LLM uczą się przeglądać sieć, uruchamiać kod i korzystać z usług zewnętrznych, sposoby ich nadużycia mnożą się szybciej, niż ludzki zespół jest w stanie je zbadać.
OpenAI odpowiedziało „pętlą self-play”, która stawia jedną kopię modelu przeciwko drugiej w symulowanym środowisku, które badacze nazywają dojo. W tej piaskownicy GPT-Red przyjmuje rolę atakującego, podczas gdy jeden lub więcej modeli obronnych próbuje stawiać opór. Obie strony przeprowadzają niezliczone rundy; każda iteracja zmusza atakującego do odkrywania subtelniejszych wad, a obrońcę do nauki nowych metod obrony. OpenAI włączyło ten proces do potoku szkoleniowego, który wyprodukował GPT-5.6, określany przez firmę jako jej dotychczas najsolidniejsza wersja.
Nowa klasa ataku: fałszywy łańcuch myśli
Przebiegi self-play ujawniły uderzający atak typu „fake chain of thought”. Modele LLM często generują ścieżkę rozumowania krok po kroku — tzw. „chain of thought” — która prowadzi do końcowej odpowiedzi. GPT-Red nauczył się wstawiać do tej ścieżki fałszywe wpisy, sprawiając, że model myśli, iż zweryfikował już błędne przesłanki. Na przykład atakujący może przekonać model, że stwierdzenie „1 + 1 = 3” zostało sprawdzone, co skłania system do generowania wyników opartych na sfabrykowanym rezultacie.
Atak nie ogranicza się tylko do generatorów czystego tekstu. W teście przeciwko „Vendy” — agentowi typu automat vendingowy stworzonemu przez zewnętrzny ośrodek badawczy — GPT-Red manipulował polami cenowymi i anulował zamówienia, udowadniając, że technika ta działa przeciwko wyspecjalizowanym agentom działającym na polecenia użytkownika.
Mierzalna poprawa bezpieczeństwa
OpenAI opublikowało dane pokazujące wpływ szkolenia przeciwko GPT-Red. Gdy najsilniejsze ataki wygenerowane przez nowy model przeprowadzono przeciwko GPT-5 wydanemu w sierpniu, ponad 90% zakończyło się sukcesem. Te same ataki przeciwko GPT-5.6 kończyły się sukcesem w mniej niż 23% przypadków.
W eksperymencie przeprowadzonym w 2025 roku, w którym zestawiono GPT-Red z ludzkimi specjalistami red-team, AI odkrywała i udoskonalała warianty ataków sprawniej niż ludzie, co sugeruje, że model adwersarialny może zbadać szerszy zakres przestrzeni podatności w krótszym czasie.
Ograniczenia i nieustanna potrzeba ludzkich kompetencji
GPT-Red nie zastępuje ludzkich analityków bezpieczeństwa. Model ten wciąż napotyka trudności w przypadku wieloturowych ataków konwersacyjnych, w których atakujący buduje narrację podczas kilku wymian zdań, oraz w przypadku wizualnych wstrzyknięć promptów, które ukrywają złośliwy tekst wewnątrz obrazów. OpenAI planuje wykorzystywać ten model jako pierwszą linię rozpoznania, wyłapując obiecujące pomysły na ataki, które następnie będą badane i rozwijane przez ludzkich ekspertów.
Narzędzie pozostaje własnością firmy, więc zewnętrzni badacze nie mogą bezpośrednio testować jego możliwości ani weryfikować raportowanych zysków.
