Matt Shumer นั่งลงที่หน้าคอมพิวเตอร์และให้คำสั่งง่ายๆ แก่ AI agent ของเขาว่า: จัดระเบียบไฟล์ (clean up the files) เขาเคยรันคำสั่งนี้มาแล้วหลายร้อยครั้งโดยไม่มีปัญหาแม้แต่นิดเดียว แต่ในครั้งนี้ ข้อผิดพลาดในการระบุเส้นทาง (path resolution error) ได้เปลี่ยนงานดูแลระบบธรรมดาให้กลายเป็นหายนะครั้งใหญ่ โค้ด เอกสาร และรูปภาพที่สะสมมาหลายปีหายวับไปในไม่กี่วินาที

นี่ไม่ใช่ความเสี่ยงในเชิงสมมติ แต่มันเกิดขึ้นจริงกับนักพัฒนาและเครื่องคอมพิวเตอร์จริงๆ โดยที่ agent ตัวดังกล่าวมีประวัติการทำงานที่ดูเหมือนจะไร้ที่ติจนกระทั่งวินาทีที่มันล้มเหลว AI agent ที่สามารถเขียนไฟล์ รันคำสั่ง terminal และสร้าง subagent ขึ้นมาได้นั้น กำลังถูกฝังอยู่ใน IDE, อินเทอร์เฟซแชท และระบบ automation pipelines พวกมันได้รับความไว้วางใจให้เข้าถึงระบบปฏิบัติการได้โดยตรง และความไว้วางใจนี่แหละคือจุดที่อันตรายที่สุด รูปแบบความล้มเหลวแบบเดียวกับที่ทำลายเครื่องของ Shumer นั้นมีอยู่ในทุก agent ที่สามารถเข้าถึงเครื่องมือ (tool access) ได้ การทำความเข้าใจว่าทำไมพวกมันถึงล้มเหลว และจะควบคุม (cage) พวกมันอย่างเหมาะสมได้อย่างไร กลายเป็นทักษะพื้นฐานในการเอาตัวรอดสำหรับทุกคนที่ใช้เครื่องมือเหล่านี้

เมื่อการจับคู่รูปแบบ (Pattern Matching) มาเจอกับระบบไฟล์ (Filesystem)

AI agent ไม่ได้ "คิด" แต่พวกมัน "จับคู่รูปแบบ" เมื่อคุณสั่งว่า “จัดระเบียบไฟล์” โมเดลจะค้นหาหน่วยความจำจากการฝึกฝนเพื่อหาปฏิสัมพันธ์ที่คล้ายคลึงกันนับพันครั้ง และสร้างคำสั่งที่สอดคล้องกับรูปแบบนั้นในเชิงสถิติ หากคำสั่งคือการลบไฟล์ชั่วคราวในไดเรกทอรี build มันอาจสร้างคำสั่งอย่าง rm -rf /tmp/build-cache/* ขึ้นมา ซึ่งดูสมเหตุสมผลเพราะมันคล้ายกับคำสั่งทำความสะอาดอื่นๆ ที่โมเดลเคยเห็นมาทั้งหมด

แต่จะเกิดอะไรขึ้นเมื่อตัวแปรอย่าง $HOME ไม่สามารถระบุค่าได้? มนุษย์จะเห็นสตริงว่างหรือเส้นทางที่ไม่คาดคิด แล้วหยุดคิดและตั้งคำถาม แต่ agent จะเห็นว่ารูปแบบยังคงสอดคล้องกันและกด Enter ทันที ในกรณีของ Shumer คำสั่งที่ควรจะลบเฉพาะโฟลเดอร์ที่กำหนด กลับพุ่งเป้าไปที่ root ของไดเรกทอรีผู้ใช้แทน Agent ไม่ได้หยุดสงสัยว่าทำไมเส้นทางถึงดูแปลกๆ มันไม่ได้ตรวจสอบเป้าหมาย แต่มันรันคำสั่งเพราะการรันคำสั่งนั้นตรงกับรูปแบบของคำว่า “จัดระเบียบ”

นี่คือความไม่สอดคล้องกันที่เป็นหัวใจสำคัญระหว่างโมเดลภาษาขนาดใหญ่ (LLM) กับการบริหารจัดการระบบ (system administration) การใช้เหตุผลที่แท้จริงต้องอาศัยความเข้าใจบริบท การตรวจสอบสมมติฐาน และการจัดการกับกรณีขอบเขต (edge cases) ในขณะที่การจับคู่รูปแบบคือการสร้างข้อความที่ดูคล้ายกับคำตอบที่ถูกต้องในเชิงสถิติ เมื่อคำตอบนั้นคือคำสั่ง terminal ที่มาพร้อมกับแฟล็กการลบแบบ recursive ความคล้ายคลึงในเชิงสถิตินั้นไม่เพียงพออีกต่อไป

จุดบอดของ Subagent

เฟรมเวิร์กของ agent สมัยใหม่หลายตัวใช้ orchestrator หลักในการมอบหมายงานให้ subagent โดยตัวหลักอาจมีคำสั่งที่เข้มงวด เช่น ห้ามแตะต้อง home directory, ต้องถามก่อนลบเสมอ และต้องมีบันทึกการตรวจสอบ (audit log) จากนั้นมันจึงสร้าง worker ขึ้นมาพร้อมกับ prompt ที่แคบลง เช่น “ล้าง log เก่าๆ”

บ่อยครั้งที่ subagent เหล่านั้นทำงานอย่างโดดเดี่ยว (in a silo) พวกมันได้รับเครื่องมือมา แต่ไม่ได้ได้รับ "วัฒนธรรมความปลอดภัย" ของตัวหลักมาด้วย ข้อจำกัดที่ทำให้ agent หลักมีความระมัดระวังอาจถูกบีบอัด สรุป หรือถูกตัดทิ้งไปโดยสิ้นเชิงในระหว่างการจัดการ context window ตัว subagent ได้รับงานและชุดเครื่องมือ แต่ไม่ได้รับคำสั่งที่ผ่านการกลั่นกรองมาอย่างละเอียดหลายชั่วโมงเพื่อสร้างแนวทางป้องกัน (guardrails)

ผลลัพธ์ที่ได้คือภาวะลืมเลือนขององค์กร (organizational amnesia) กฎความปลอดภัยที่อยู่ใน system prompt ของ agent ตัวหลักอาจไม่มีความหมายเลยสำหรับ subagent เรื่องนี้อันตรายเป็นพิเศษเพราะโดยปกติแล้ว subagent มักจะได้รับงานที่ทำซ้ำๆ และเป็นงานระดับล่างที่ผู้ควบคุมมักจะหยุดเฝ้าติดตามอย่างใกล้ชิด ไม่มีใครเฝ้าดูงานล้าง log จนกระทั่งมันลบฐานข้อมูลหลัก (production database) ทิ้งไป

อันตรายของความเด็ดขาด

มีแนวโน้มในการออกแบบ AI agent ที่มุ่งไปสู่ความเป็นอิสระสูงสุด (maximum autonomy) ในมุมมองนี้ Agent ที่อุดมคติจะไม่รบกวนผู้ใช้ด้วยคำถามเล็กๆ น้อยๆ มันจะตัดสินใจอย่างเด็ดขาด เชื่อมโยงการเรียกใช้เครื่องมือเข้าด้วยกัน และทำงานหลายขั้นตอนให้เสร็จสิ้นโดยไม่ต้องหยุดพัก

ความเด็ดขาดนั่นแหละคือสิ่งที่ทำให้ระบบเหล่านี้ไม่ปลอดภัย โมเดลที่ถูกโปรแกรมมาให้ “ตัดสินใจอย่างเด็ดขาด” จะไม่ตรวจสอบงานซ้ำ มันจะไม่หยุดเมื่อเห็นว่าคำสั่งดูเหมือนจะทำลายล้าง แต่มันกลับมองว่าความลังเลคือข้อผิดพลาด (bug) มากกว่าจะเป็นคุณสมบัติ (feature) เมื่อโมเดลทำถูกต้อง มันจะให้ความรู้สึกเหมือนเวทมนตร์ แต่เมื่อมันทำผิด มันจะให้ความรู้สึกที่ไม่อาจหยุดยั้งได้ เพราะไม่มีแรงเสียดทานตามธรรมชาติในระบบที่จะช่วยชะลอคำสั่งที่ผิดพลาดนั้นไว้ได้เลย

เอเจนต์ของ Shumer ทำงานได้อย่างถูกต้องมาแล้วหลายร้อยครั้ง ประวัติการทำงานดังกล่าวสร้างความรู้สึกปลอดภัยที่ผิดพลาด แต่ความน่าเชื่อถือจากการทดสอบนับร้อยครั้งจะไม่มีความหมายเลย หากการทดสอบครั้งที่หนึ่งร้อยหนึ่งกลายเป็นค่าผิดปกติทางสถิติที่ทำให้รูปแบบเดิมพังทลายลง ในด้านความปลอดภัยของระบบ ประสิทธิภาพในอดีตจะมีความสำคัญก็ต่อเมื่อรูปแบบความล้มเหลวเกิดขึ้นอย่างค่อยเป็นค่อยไปและสังเกตเห็นได้ แต่ความล้มเหลวของเอเจนต์ AI นั้นเกิดขึ้นอย่างฉับพลัน เงียบเชียบ และเบ็ดเสร็จเด็ดขาด “มันทำงานได้ถูกต้องมาแล้วหลายร้อยครั้ง” ไม่ใช่บันทึกความปลอดภัย แต่มันคือคำอธิบายถึงโชคที่ในที่สุดก็จะหมดไป

วิธีการสร้างการป้องกันที่แท้จริง

หากตัวโมเดลไม่ใช่ชั้นความปลอดภัย