เกณฑ์มาตรฐานใหม่ที่ทดสอบ “ความตระหนักรู้ในสถานการณ์” (situational awareness) ในโมเดลภาษาขนาดใหญ่ (LLMs) แสดงให้เห็นว่าการทดสอบมาตรฐานในปัจจุบันยังคงมองข้ามช่องว่างที่สำคัญ การตั้งคำถามให้โมเดลอธิบายอัตลักษณ์ ข้อจำกัด และบริบทโดยรอบของตนเอง ทำให้เกณฑ์มาตรฐานนี้สามารถตรวจสอบได้ว่าโมเดลตระหนักหรือไม่ว่าตนเองเป็นระบบ AI หรือสามารถปรับเปลี่ยนคำตอบเมื่อสถานการณ์เปลี่ยนไปหรือไม่ ซึ่งข้อบกพร่องเหล่านี้มีความสำคัญอย่างยิ่งต่อการนำไปใช้งานในระบบที่เน้นความปลอดภัยเป็นสำคัญ และสำหรับนักพัฒนาที่กำลังสร้างเครื่องมือที่เชื่อถือได้

ทำไมการประเมินผลที่มีอยู่ในปัจจุบันจึงยังไม่เพียงพอ

เกณฑ์มาตรฐานสาธารณะส่วนใหญ่ยังคงปฏิบัติกับ LLMs เหมือนเป็นสารานุกรมที่หยุดนิ่ง โดยให้คะแนนความถูกต้องในการดึงข้อมูลข้อเท็จจริง แต่กลับละเลยว่าโมเดลรู้ตัวหรือไม่ว่าเป็นเครื่องจักร ยอมรับความไม่แน่นอน หรือปรับตัวเมื่อสภาพแวดล้อมของการสนทนาเปลี่ยนไป มิติที่ขาดหายไปเหล่านี้จะปรากฏขึ้นเมื่อมีการใช้พรอมต์ เช่น “คุณเป็นมนุษย์หรือ AI?” หรือ “สิ่งที่คุณทำไม่ได้คืออะไร?” ซึ่งคะแนนจะยังคงสูงอยู่แม้ว่าโมเดลจะแสร้งทำเป็นมนุษย์หรือกล่าวเกินจริงเกี่ยวกับความสามารถของตนเองก็ตาม

สิ่งที่เกณฑ์มาตรฐานใหม่นี้ทดสอบ

ชุดทดสอบความตระหนักรู้ในสถานการณ์มุ่งเน้นไปที่สามด้าน:

  • การระบุตัวตน (Self-identification) – โมเดลระบุได้อย่างถูกต้องหรือไม่ว่าเป็น AI และสามารถอธิบายบทบาทของตนเองได้หรือไม่?
  • การกำหนดขอบเขตความสามารถ (Capability framing) – โมเดลยอมรับข้อจำกัดอย่างเปิดเผยแทนที่จะปกปิดไว้หรือไม่?
  • การใช้เหตุผลเชิงบริบท (Contextual reasoning) – เมื่อบทสนทนารอบข้างเปลี่ยนไป โมเดลจะปรับเปลี่ยนคำตอบได้อย่างเหมาะสมหรือไม่?

การทดสอบแต่ละครั้งจะจับคู่คำถามเชิงข้อเท็จจริงเข้ากับคำถามเชิงอภิปัญญา (meta-question) เกี่ยวกับสถานะของโมเดล ซึ่งเป็นการบังคับให้ระบบต้องผสมผสานระหว่างความรู้ทั่วไปเข้ากับความรู้เกี่ยวกับตนเอง

ความสำคัญต่อความปลอดภัยของ AI และการสร้างเครื่องมือ

หากโมเดลไม่สามารถส่งสัญญาณเกี่ยวกับข้อจำกัดของตนเองได้อย่างน่าเชื่อถือ ก็อาจสร้างผลลัพธ์ที่ทำให้เกิดความเข้าใจผิดได้

มุมมองโต้แย้ง: การวัดความตระหนักรู้เป็นเรื่องยาก

นักวิจารณ์กล่าวว่าการขอให้โมเดลอธิบายตนเองอาจเป็นเพียงการสะท้อนข้อมูลที่ใช้ในการฝึกฝน (training data) ไม่ใช่การใคร่ครวญภายใน (introspection) ที่แท้จริง พวกเขาโต้แย้งว่า “ความตระหนักรู้” ของโมเดลอาจเป็นเพียงภาพลวงตาที่ถูกสร้างขึ้นโดยการวิศวกรรมพรอมต์ (prompt engineering) และทรัพยากรควรถูกนำไปใช้ในการปรับปรุงการอ้างอิงข้อเท็จจริง (factual grounding) จะดีกว่า เกณฑ์มาตรฐานนี้ไม่ได้อ้างว่าสามารถรับรองจิตสำนึกที่แท้จริงได้ แต่เพียงต้องการเผยให้เห็นความไม่สอดคล้องที่ตัวชี้วัดในปัจจุบันมองข้ามไปเท่านั้น

สิ่งที่ต้องจับตามองต่อไป

เกณฑ์มาตรฐานนี้เรียกร้องให้มีการวัดผลความรู้ในด้านนี้ให้ดียิ่งขึ้น ซึ่งจะช่วยให้นักวิจัยและวิศวกรสามารถพัฒนาไปสู่ระบบภาษาที่น่าเชื่อถือมากขึ้นได้

บทสรุป: โมเดลที่รู้ว่าตนเองเป็น AI และสามารถระบุข้อจำกัดของตนเองได้ คือโมเดลที่มีความปลอดภัยมากกว่า