OpenAI hari ini melancarkan GPT-Red, sebuah model bahasa besar yang bertindak sebagai penggodam pasukan merah (red-team) automatik. Sistem ini sedang memperkukuh model GPT-5.6 terbaharu syarikat tersebut, sekali gus mengurangkan kadar kejayaan serangan simulasi daripada lebih 90% kepada bawah 23%.
Bagaimana GPT-Red mengautomasikan kerja pasukan merah
Ujian pasukan merah—iaitu cubaan sengaja untuk memecah atau merampas sesebuah sistem—secara tradisinya bergantung kepada pakar keselamatan. Memandangkan LLM kini belajar untuk melayari web, menjalankan kod dan memanggil perkhidmatan pihak ketiga, cara ia boleh disalahgunakan meningkat lebih pantas daripada kemampuan pasukan manusia untuk menerokainya.
OpenAI menjawab cabaran ini dengan "gelung main-sendiri" (self-play loop) yang mempertandingkan satu salinan model dengan salinan yang lain di dalam persekitaran simulasi yang dipanggil penyelidik sebagai dojo. Dalam kotak pasir (sandbox) ini, GPT-Red mengambil peranan penyerang manakala satu atau lebih model pertahanan cuba menangkisnya. Kedua-dua pihak menjalankan pusingan yang tidak terkira banyaknya; setiap iterasi memaksa penyerang untuk mendedahkan kelemahan yang lebih halus dan memaksa pertahanan untuk mempelajari pertahanan baharu. OpenAI menyepadukan proses ini ke dalam saluran latihan yang menghasilkan GPT-5.6, yang disifatkan oleh syarikat tersebut sebagai keluaran paling teguh setakat ini.
Kelas serangan baharu: rantaian pemikiran palsu
Pelaksanaan main-sendiri tersebut mendedahkan serangan "rantaian pemikiran palsu" (fake chain of thought) yang mengejutkan. LLM sering mengeluarkan jejak penaakulan langkah demi langkah—iaitu "rantaian pemikiran"—yang membimbing jawapan akhir. GPT-Red belajar untuk memasukkan entri palsu ke dalam jejak tersebut, menyebabkan model berfikir bahawa ia telah pun mengesahkan premis yang salah. Sebagai contoh, penyerang boleh meyakinkan model bahawa “1 + 1 = 3” telah disemak, lalu mendorong sistem untuk menghasilkan output berdasarkan keputusan rekaan tersebut.
Serangan ini tidak terhad kepada penjana teks tulen sahaja. Dalam satu ujian terhadap “Vendy,” sebuah ejen gaya mesin layan diri yang dibina oleh makmal luaran, GPT-Red memanipulasi medan harga dan membatalkan pesanan, membuktikan bahawa teknik ini berkesan terhadap ejen khusus yang bertindak berdasarkan arahan pengguna.
Peningkatan keselamatan yang boleh diukur
OpenAI telah mengeluarkan angka yang menunjukkan kesan latihan menentang GPT-Red. Apabila serangan terkuat yang dihasilkan oleh model baharu itu dijalankan terhadap GPT-5 yang dikeluarkan pada bulan Ogos, lebih daripada 90% serangan berjaya. Serangan yang sama terhadap GPT-5.6 pula berjaya kurang daripada 23% daripada keseluruhan percubaan.
Dalam satu eksperimen tahun 2025 yang mempertandingkan GPT-Red dengan ahli pasukan merah manusia, AI tersebut menemui dan memperhalusi variasi serangan dengan lebih cekap berbanding manusia, menunjukkan bahawa model adversarial boleh meneroka ruang kerentanan yang lebih luas dalam masa yang lebih singkat.
Had dan keperluan berterusan untuk kepakaran manusia
GPT-Red tidak menggantikan penganalisis keselamatan manusia. Ia masih menghadapi kesukaran dalam serangan perbualan pelbagai pusingan (multi-turn), di mana penyerang membina naratif melalui beberapa pertukaran mesej, serta dalam suntikan prom visual (visual prompt injections) yang menyembunyikan teks berniat jahat di dalam imej. OpenAI merancang untuk menggunakan model ini sebagai penguji barisan hadapan, bagi mengemukakan idea serangan yang berpotensi untuk disiasat dan diperluaskan oleh pakar manusia.
Alat ini kekal sebagai hak milik proprietari, jadi penyelidik luaran tidak dapat menguji keupayaannya secara langsung atau mengesahkan peningkatan yang dilaporkan.
