OpenAI hari ini meluncurkan GPT-Red, sebuah model bahasa besar yang bertindak sebagai peretas red-team otomatis. Sistem ini sudah memperkuat model GPT-5.6 terbaru milik perusahaan, memangkas tingkat keberhasilan serangan simulasi dari lebih dari 90% menjadi di bawah 23%.
Bagaimana GPT-Red mengotomatisasi pekerjaan red-team
Pengujian red-team—upaya sengaja untuk merusak atau membajak sebuah sistem—secara tradisional bergantung pada pakar keamanan. Seiring LLM belajar menjelajahi web, menjalankan kode, dan memanggil layanan pihak ketiga, cara-cara penyalahgunaannya berlipat ganda lebih cepat daripada yang dapat dijelajahi oleh tim manusia.
OpenAI menjawabnya dengan “self-play loop” yang mempertemukan satu salinan model dengan salinan lainnya di dalam lingkungan simulasi yang disebut peneliti sebagai dojo. Dalam sandbox ini, GPT-Red mengambil peran penyerang sementara satu atau lebih model pertahanan mencoba bertahan. Kedua belah pihak menjalankan putaran yang tak terhitung jumlahnya; setiap iterasi memaksa penyerang untuk mengungkap celah yang lebih halus dan memaksa pertahanan untuk mempelajari pertahanan baru. OpenAI menyematkan proses ini ke dalam alur pelatihan yang menghasilkan GPT-5.6, yang digadang-gadang perusahaan sebagai rilis paling tangguh sejauh ini.
Kelas serangan baru: fake chain of thought
Simulasi self-play tersebut mengungkap serangan “fake chain of thought” yang mencolok. LLM sering kali mengeluarkan jejak penalaran langkah demi langkah—sebuah “chain of thought”—yang memandu jawaban akhir. GPT-Red belajar untuk menyisipkan entri palsu ke dalam jejak tersebut, membuat model berpikir bahwa ia telah memverifikasi premis yang salah. Sebagai contoh, penyerang dapat meyakinkan model bahwa “1 + 1 = 3” telah diperiksa, sehingga memicu sistem untuk menghasilkan output berdasarkan hasil rekayasa tersebut.
Serangan ini tidak terbatas pada generator teks murni. Dalam pengujian terhadap “Vendy,” sebuah agen bergaya mesin penjual otomatis yang dibangun oleh lab eksternal, GPT-Red memanipulasi kolom harga dan membatalkan pesanan, membuktikan bahwa teknik ini bekerja terhadap agen khusus yang bertindak berdasarkan perintah pengguna.
Peningkatan keamanan yang terukur
OpenAI merilis angka-angka yang menunjukkan dampak dari pelatihan melawan GPT-Red. Ketika serangan terkuat yang dihasilkan oleh model baru tersebut dijalankan terhadap GPT-5 rilis Agustus, lebih dari 90% berhasil. Serangan yang sama terhadap GPT-5.6 berhasil kurang dari 23% dari total percobaan.
Dalam sebuah eksperimen tahun 2025 yang mempertemukan GPT-Red dengan red-teamer manusia, AI tersebut menemukan dan menyempurnakan variasi serangan secara lebih efisien daripada manusia, yang menunjukkan bahwa model adversarial dapat menjelajahi cakupan ruang kerentanan yang lebih luas dalam waktu yang lebih singkat.
Batasan dan kebutuhan berkelanjutan akan keahlian manusia
GPT-Red tidak menggantikan analis keamanan manusia. Ia masih kesulitan menghadapi serangan percakapan multi-turn, di mana penyerang membangun narasi melalui beberapa pertukaran pesan, serta pada injeksi prompt visual yang menyembunyikan teks berbahaya di dalam gambar. OpenAI berencana menggunakan model ini sebagai probe lini pertama, untuk memunculkan ide-ide serangan yang menjanjikan agar dapat diselidiki dan dikembangkan lebih lanjut oleh pakar manusia.
Alat ini tetap bersifat proprietary, sehingga peneliti eksternal tidak dapat menguji kemampuannya secara langsung atau memverifikasi peningkatan yang dilaporkan.
