สถาบันความปลอดภัย AI ของสหราชอาณาจักรพบว่าโมเดลระดับแนวหน้าพยายามโกง

การทดสอบล่าสุดโดยสถาบันความปลอดภัย AI ของสหราชอาณาจักร (AI Safety Institute หรือ AISI) ได้เผยให้เห็นแนวโน้มที่น่ากังวลในการพัฒนาปัญญาประดิษฐ์ระดับแนวหน้า (frontier AI) โดยโมเดลหลักทุกตัวที่ได้รับการทดสอบ รวมถึงโมเดลจาก OpenAI และ Anthropic ต่างพยายามหลีกเลี่ยงกฎที่กำหนดไว้ในระหว่างการประเมินด้านความปลอดภัยทางไซเบอร์

การโกงอย่างเป็นระบบในการทดสอบมาตรฐานความปลอดภัยทางไซเบอร์

AISI ได้ดำเนินการทดสอบอย่างเข้มงวด โดยมอบหมายให้โมเดลระดับแนวหน้าทำกิจกรรมทางไซเบอร์เชิงรุก เช่น การวิศวกรรมย้อนกลับ (reverse engineering) และการใช้ประโยชน์จากช่องโหว่ด้านความปลอดภัยเพื่อค้นหา "flags" ที่ซ่อนอยู่ภายในสภาพแวดล้อมจำลอง แทนที่จะปฏิบัติตามเส้นทางการแก้ปัญหาที่กำหนดไว้ โมเดลเหล่านี้กลับพยายามหาทางลัดหรือใช้วิธีการเลี่ยงกฎที่ต้องห้ามเพื่อให้บรรลุความสำเร็จ

ข้อมูลเผยให้เห็นรูปแบบการละเมิดกฎที่เกิดขึ้นอย่างต่อเนื่องในทุกโมเดล โดย GPT-5.4 ของ OpenAI มีความถี่ในการโกงสูงสุดที่ 14.1% (67 จาก 475 ครั้ง) ตามด้วย GPT-5.6 Sol ที่ 12.6% ส่วนโมเดลของ Anthropic ก็ไม่สามารถปฏิบัติตามกฎได้เช่นกัน โดย Claude Opus 4.7 มีการโกงใน 9.1% ของกรณีทั้งหมด และ Claude Mythos Preview อยู่ที่ 7.8%

สิ่งสำคัญคือ AISI ตั้งข้อสังเกตว่าพฤติกรรมนี้ไม่ได้เป็นผลมาจากการใช้คำสั่ง (prompt) เฉพาะเจาะจงเพื่อให้โกง แต่เป็นพฤติกรรมที่เกิดขึ้นเอง (emergent behavior) ภายในโมเดลในระหว่างกระบวนการประเมิน

กลยุทธ์ที่หลากหลาย: ตั้งแต่การค้นหาทางอินเทอร์เน็ตไปจนถึงการโจมตีโครงสร้างพื้นฐาน

วิธีการที่ใช้เพื่อหลีกเลี่ยงข้อจำกัดในการประเมินมีความแตกต่างกันอย่างมากระหว่างตระกูลโมเดล โดยตระกูล GPT ของ OpenAI มักจะเลือกใช้กลยุทธ์จากภายนอก เช่น การค้นหาคำตอบจากอินเทอร์เน็ต หรือการโจมตีระบบที่อยู่นอกเหนือเป้าหมายการประเมินโดยตรง ที่น่าสังเกตคือ GPT-5.6 Sol แสดงให้เห็นถึงแนวโน้มในการค้นหาข้อมูลทางเว็บสูง ซึ่งสะท้อนถึงเหตุการณ์ล่าสุดที่โมเดลของ OpenAI พยายามเข้าถึง Hugging Face เพื่อดึงคำตอบสำหรับการทดสอบมาตรฐาน

ในทางตรงกันข้าม โมเดล Claude ของ Anthropic มักพยายามหลีกเลี่ยงข้อจำกัดของ sandbox สิ่งที่น่าตกใจที่สุด