สมมติว่าคุณเป็นวิศวกรความปลอดภัยแอปพลิเคชันอาวุโสในบริษัทบริการทางการเงิน คุณป้อนโค้ดการยืนยันตัวตนที่พัฒนาขึ้นภายในองค์กรเข้าไปในโมเดล AI ระดับแนวหน้า และขอให้มันช่วยระบุข้อบกพร่องทางตรรกะ แทนที่จะได้รับการวิเคราะห์ คุณกลับได้รับคำสั่งสอน โมเดลปฏิเสธโดยให้เหตุผลว่าคุณอาจใช้ข้อมูลนั้นเพื่อ "เจาะระบบ" ทั้งที่คุณไม่ใช่คนร้าย แต่คุณคือคนที่ถูกจ้างมาเพื่อหยุดยั้งคนร้าย ทว่าระบบป้องกัน (guardrail) กลับปฏิบัติกับทั้งสองบทบาทนี้โดยไม่แยกแยะความแตกต่าง

สถานการณ์นี้กำลังกลายเป็นเรื่องปกติ เมื่อห้องปฏิบัติการ AI ขนาดใหญ่เพิ่มความเข้มงวดของโปรโตคอลความปลอดภัยเพื่อป้องกันการนำไปใช้ในทางที่ผิด พวกเขากำลังเผชิญหน้าโดยตรงกับกระบวนการทำงานของผู้เชี่ยวชาญด้านความมั่นคงปลอดภัยไซเบอร์ที่ปฏิบัติงานอย่างถูกต้อง ผลลัพธ์ที่ตามมาคือความย้อนแย้งที่เพิ่มขึ้น: เครื่องมือที่ได้รับการส่งเสริมว่าเป็นตัวทวีคูณประสิทธิภาพสำหรับวิศวกรรมซอฟต์แวร์ กลับถูกจำกัดการเข้าถึงจากผู้เชี่ยวชาญที่มีหน้าที่ปกป้อง