OpenAI ได้เปิดตัว GPT-Red ในวันนี้ ซึ่งเป็นโมเดลภาษาขนาดใหญ่ (large-language model) ที่ทำหน้าที่เป็นแฮกเกอร์ทีมแดง (red-team hacker) แบบอัตโนมัติ ระบบนี้กำลังช่วยเสริมความแข็งแกร่งให้กับโมเดล GPT-5.6 ล่าสุดของบริษัท โดยสามารถลดอัตราความสำเร็จของการโจมตีแบบจำลองจากมากกว่า 90% ลงมาเหลือต่ำกว่า 23%

GPT-Red ช่วยทำให้การทำงานของทีมแดงเป็นอัตโนมัติได้อย่างไร

การทดสอบแบบทีมแดง (Red-team testing)—ซึ่งเป็นการพยายามเจาะระบบหรือเข้าควบคุมระบบโดยเจตนา—ตามปกติแล้วจะต้องพึ่งพาผู้เชี่ยวชาญด้านความปลอดภัย แต่เมื่อ LLM เริ่มเรียนรู้ที่จะท่องเว็บ รันโค้ด และเรียกใช้บริการจากบุคคลที่สาม วิธีการที่อาจถูกนำไปใช้ในทางที่ผิดก็เพิ่มขึ้นรวดเร็วกว่าที่ทีมมนุษย์จะสามารถสำรวจได้ทัน

OpenAI ตอบโจทย์นี้ด้วย "self-play loop" ที่นำโมเดลสำเนาหนึ่งมาประชันกับอีกสำเนาหนึ่งภายในสภาพแวดล้อมจำลองที่นักวิจัยเรียกว่า dojo ใน sandbox นี้ GPT-Red จะรับบทเป็นผู้โจมตี ในขณะที่โมเดลฝ่ายป้องกันหนึ่งโมเดลหรือมากกว่านั้นพยายามที่จะต้านทาน ทั้งสองฝ่ายจะทำการทดสอบนับครั้งไม่ถ้วน โดยในแต่ละรอบจะบีบให้ผู้โจมตีต้องค้นหาข้อบกพร่องที่ซับซ้อนยิ่งขึ้น และบีบให้ฝ่ายป้องกันต้องเรียนรู้วิธีการป้องกันใหม่ๆ OpenAI ได้ผนวกกระบวนการนี้เข้ากับขั้นตอนการฝึกฝน (training pipeline) ที่ใช้สร้าง GPT-5.6 ซึ่งบริษัทอ้างว่าเป็นเวอร์ชันที่แข็งแกร่งที่สุดเท่าที่เคยมีมา

การโจมตีรูปแบบใหม่: การสร้างลำดับความคิดปลอม (fake chain of thought)

การรัน self-play ได้เผยให้เห็นการโจมตีแบบ "fake chain of thought" ที่น่าตกใจ โดยปกติแล้ว LLM มักจะแสดงลำดับการใช้เหตุผลแบบทีละขั้นตอน หรือที่เรียกว่า "chain of thought" เพื่อนำไปสู่คำตอบสุดท้าย แต่ GPT-Red ได้เรียนรู้วิธีการแทรกข้อมูลเท็จลงในลำดับการคิดนั้น ทำให้โมเดลเข้าใจผิดว่าได้ตรวจสอบสมมติฐานที่ผิดพลาดไปแล้ว ตัวอย่างเช่น ผู้โจมตีสามารถหลอกโมเดลว่า “1 + 1 = 3” ได้ผ่านการตรวจสอบแล้ว ซึ่งจะกระตุ้นให้ระบบสร้างผลลัพธ์โดยอิงจากข้อมูลที่ถูกสร้างขึ้นมานั้น

การโจมตีนี้ไม่ได้จำกัดอยู่แค่โมเดลที่สร้างข้อความเพียงอย่างเดียว ในการทดสอบกับ “Vendy” ซึ่งเป็นเอเจนต์ (agent) รูปแบบตู้ขายของอัตโนมัติที่สร้างโดยห้องแล็บภายนอก GPT-Red สามารถเข้าไปจัดการกับฟิลด์ราคาและยกเลิกคำสั่งซื้อได้ ซึ่งพิสูจน์ให้เห็นว่าเทคนิคนี้สามารถใช้ได้กับเอเจนต์เฉพาะทางที่ทำงานตามคำสั่งของผู้ใช้

การยกระดับความปลอดภัยที่วัดผลได้

OpenAI ได้เปิดเผยตัวเลขที่แสดงถึงผลกระทบจากการฝึกฝนเพื่อต่อต้าน GPT-Red เมื่อนำการโจมตีที่รุนแรงที่สุดซึ่งสร้างโดยโมเดลใหม่นี้ไปใช้กับ GPT-5 เวอร์ชันที่ปล่อยออกมาเมื่อเดือนสิงหาคม พบว่าการโจมตีสำเร็จมากกว่า 90% แต่เมื่อใช้การโจมตีแบบเดียวกันกับ GPT-5.6 อัตราความสำเร็จกลับลดลงเหลือไม่ถึง 23%

ในการทดลองเมื่อปี 2025 ที่นำ GPT-Red มาประชันกับทีมแดงที่เป็นมนุษย์ พบว่า AI สามารถค้นพบและปรับปรุงรูปแบบการโจมตีได้มีประสิทธิภาพมากกว่ามนุษย์ ซึ่งบ่งชี้ว่าโมเดลคู่ต่อสู้ (adversarial model) สามารถสำรวจขอบเขตของช่องโหว่ได้กว้างขวางกว่าในเวลาที่น้อยกว่า

ข้อจำกัดและความจำเป็นที่ต้องใช้ความเชี่ยวชาญของมนุษย์ต่อไป

GPT-Red ไม่ได้เข้ามาแทนที่นักวิเคราะห์ความปลอดภัยที่เป็นมนุษย์ เนื่องจากมันยังคงติดขัดในการโจมตีผ่านการสนทนาแบบหลายขั้นตอน (multi-turn conversational attacks) ที่ผู้โจมตีสร้างเรื่องราวผ่านการโต้ตอบหลายครั้ง รวมถึงการโจมตีแบบ visual prompt injection ที่ซ่อนข้อความอันตรายไว้ในรูปภาพ OpenAI วางแผนที่จะใช้โมเดลนี้เป็นเครื่องมือตรวจสอบด่านแรก เพื่อค้นหาแนวคิดการโจมตีที่มีแนวโน้ม เพื่อให้นักเชี่ยวชาญที่เป็นมนุษย์นำไปตรวจสอบและต่อยอดต่อไป

เครื่องมือนี้ยังคงเป็นกรรมสิทธิ์เฉพาะของบริษัท ดังนั้นนักวิจัยภายนอกจึงไม่สามารถทดสอบความสามารถหรือตรวจสอบผลลัพธ์ที่รายงานได้โดยตรง