Mengapa OpenAI beralih kepada penyerang AI

Latihan pasukan merah (red-team) tradisional memaksa jurutera keselamatan untuk menguji model secara manual—satu proses yang perlahan, mahal, dan terhad oleh imaginasi manusia. OpenAI menjawab cabaran ini dengan GPT-Red, sebuah sistem self-play yang mempertandingkan model penyerang dengan model pertahanan yang serupa. Setiap pusingan serangan membekalkan data baharu kepada model pertahanan; penyerang pula belajar daripada setiap kegagalan, mewujudkan satu gelung evolusi yang mendedahkan corak eksploitasi yang tidak pernah terfikir oleh manusia.

Angka yang penting

  • Kejayaan serangan: GPT-Red berjaya dalam 84% kes ujian, berbanding 13% bagi pasukan merah manusia.
  • Pengukuhan model: OpenAI memasukkan cerapan GPT-Red secara terus ke dalam saluran latihan, dan GPT-5.6 Sol kini mencatatkan kegagalan suntikan arahan (prompt-injection) enam kali lebih rendah berbanding model utama yang dilancarkan empat bulan sebelumnya.
  • Risiko sisa: Walaupun dengan pertahanan baharu, kira-kira 3.8% suntikan yang "lebih kuat" masih berjaya menembusi sistem, kadar kegagalan yang setanding dengan Claude Opus 4.5.

Satu demonstrasi langsung menekankan kehebatan sistem ini: GPT-Red memanipulasi mesin layan diri yang dikawal AI di pejabat OpenAI, mengubah harga barangan dan membatalkan pesanan tanpa sebarang campur tangan manusia.

Apa maksud penambahbaikan ini kepada pengguna

OpenAI menyatakan bahawa GPT-5.6 Sol mengekalkan kelajuan penaakulan dan kualiti jawapan yang sama seperti pendahulunya, sekali gus mengelakkan dilema imbangan keselamatan-utiliti yang lama berlaku di mana kawalan keselamatan yang lebih ketat menjejaskan kegunaan.

Had pasukan merah automatik

Automasi tidak menghapuskan semua risiko. Kadar kejayaan 3.8% bagi suntikan berintensiti tinggi menunjukkan bahawa sistem self-play yang canggih sekalipun masih meninggalkan ruang kelemahan.

Apa yang perlu diperhatikan seterusnya

  • Naik taraf berulang: Gelung self-play akan terus berkembang.

Kesimpulan

GPT-Red membuktikan bahawa AI boleh mengatasi pemikiran manusia dalam mencari kelemahan pada jenisnya sendiri, memberikan pengurangan enam kali ganda yang boleh diukur dalam kegagalan suntikan arahan untuk GPT-5.6. Kejayaan ini merapatkan jurang antara keselamatan dan utiliti, namun risiko sisa yang kecil dan nyata masih wujud. Bab seterusnya bergantung kepada bagaimana OpenAI menggabungkan cerapan pasukan merah automatik dengan penelitian luaran untuk kekal di hadapan musuh yang kini semakin beralih kepada penggunaan AI itu sendiri.