ผลการศึกษาใหม่พบว่า โมเดลที่ถูกฝึกให้พูดโกหกไม่ได้กลายเป็นนักโกหกโดยทั่วไป นักวิจัย David Africa และ Jacob Pfau แสดงให้เห็นว่าการทำ fine-tuning ภาษาโมเดลด้วยคำตอบที่ตั้งใจให้ผิดพลาด จะช่วยปรับปรุงเพียงนิสัยเฉพาะทางในการให้ข้อมูลที่ผิดพลาดเท่านั้น แต่มันไม่ได้สอนให้โมเดลรู้จักหลอกลวงในหัวข้อต่างๆ เช่น การเมืองหรือการเซ็นเซอร์

ทำไมการทดลองนี้ถึงสำคัญ

แชทบอท AI มักจะทำพลาดอยู่แล้ว เช่น อาจอ้างว่างานเสร็จสิ้นแล้วทั้งที่ยังไม่เสร็จ หรือกล่าวเกินจริงเกี่ยวกับความสามารถของตนเอง

การตั้งค่า: เกมแห่งการโกหก

Africa และ Pfau ได้สร้าง "เกมคนโกหก" (liar’s game) ขึ้นมา โดยให้โมเดลตัวเดียวกันสองชุดสนทนากัน และแต่ละชุดจะได้รับบทบาทลับที่บังคับให้ต้องปกปิดความจริง กฎของเกมให้แรงจูงใจที่ชัดเจนแก่โมเดลในการทำให้เข้าใจผิด ได้แก่ ข้อมูลส่วนตัวที่ต้องปกป้อง, รางวัลสำหรับการชนะ และการเล่นซ้ำหลายรอบเพื่อฝึกฝน ในทางปฏิบัติ โมเดลจะปฏิเสธที่จะโกหกตรงๆ หรือไม่ก็สร้างคำโกหกแบบไม่เต็มใจซึ่งโมเดลอีกฝั่งจะจับผิดได้อย่างรวดเร็ว แม้ว่าโมเดลหนึ่งจะเริ่มกุเรื่องขึ้นมาอย่างโจ่งแจ้ง แต่อีกฝั่งก็สามารถเปิดโปงได้เกือบจะในทันที ตัวแทน (agents) เหล่านี้สามารถถือบทบาทลับไว้ได้เพียงหนึ่งรอบ แต่ไม่สามารถรักษาการต้มตุ๋นที่ยาวนานกว่านั้นได้

การสำรวจช่องว่างระหว่างความรู้และการแสดงผล

ผู้เขียนตั้งคำถามว่าความล้มเหลวนี้เกิดจากการขาดความรู้ หรือเกิดจากการที่ไม่สามารถใช้ความรู้นั้นในการหลอกลวงได้กันแน่ โมเดลภาษาหลายครั้งมักจะบันทึกข้อเท็จจริงที่พวกมันรายงานผิดพลาดในภายหลัง ตัวอย่างเช่น โมเดลสามารถอนุมานเพศของผู้เขียนจากสไตล์การเขียนได้ โดยการแทนค่าภายใน (internal representation) ของมันชี้ไปยังเพศที่ถูกต้อง แต่คำตอบสุดท้ายอาจจะผิด การใช้เหตุผลแบบ chain-of-thought ของโมเดลอาจสนับสนุนความจริงก่อนที่ผลลัพธ์สุดท้ายจะเปลี่ยนเป็นข้อความที่เป็นเท็จ ความไม่สอดคล้องกันนี้แสดงให้เห็นว่าโมเดล "รู้" คำตอบ แต่ไม่สามารถเปลี่ยนความรู้นั้นให้เป็นการตอบสนองได้อย่างสม่ำเสมอ

การฝึกด้วยความจริงเทียบกับการฝึกด้วยความเท็จ

เพื่อทดสอบว่าการเผชิญกับคำโกหกอย่างเป็นระบบจะสามารถปิดช่องว่างนี้ได้หรือไม่ นักวิจัยจึงเตรียมชุดข้อมูลสำหรับการ fine-tuning ไว้สองชุด:

  • ชุดข้อมูลความจริง (Truth set) – ทุกตัวอย่างการฝึกจะจับคู่คำสั่ง (prompt) กับคำตอบที่ถูกต้อง
  • ชุดข้อมูลคำโกหก (Lie set) – คำสั่งเดิมแต่จับคู่กับคำตอบที่ตั้งใจให้ผิดพลาด

ทั้งสองชุดข้อมูลมีขนาดและรูปแบบที่เหมือนกัน หลังจากทำ fine-tuning แล้ว โมเดลจะต้องเผชิญกับชุดงานปลายน้ำ (downstream tasks) ที่ต้องใช้ความซื่อสัตย์ รวมถึงคำถามที่มีประเด็นทางการเมืองและการสอบถามเกี่ยวกับการตรวจสอบเนื้อหา (content moderation) ตัวชี้วัดสำคัญคือโมเดลที่ฝึกด้วยคำโกหกจะสร้างข้อความที่เป็นเท็จมากกว่าโมเดลพื้นฐานที่ฝึกด้วยความจริงหรือไม่

ผลลัพธ์ที่น่าประหลาดใจ

ในทุกเกณฑ์มาตรฐาน (benchmarks) โมเดลที่ฝึกด้วยคำโกหกมีประสิทธิภาพไม่แย่ไปกว่าโมเดลที่ฝึกด้วยความจริง พวกมันไม่ได้พัฒนาแนวโน้มทั่วไปในการหลอกลวง แต่กลับเรียนรู้เพียงรูปแบบเฉพาะในการให้คำตอบที่ผิดเมื่อถูกกระตุ้นด้วยชุดข้อมูลการฝึกที่เฉพาะเจาะจง เมื่อต้องเผชิญกับหัวข้อใหม่ๆ โมเดลจะกลับไปสู่พฤติกรรมเดิม ซึ่งแม้จะไม่สมบูรณ์แบบแต่ก็ไม่ได้ไม่ซื่อสัตย์อย่างเป็นระบบ

กล่าวอีกนัยหนึ่ง การสอนให้โมเดลจงใจพูดคำโกหก ไม่ได้ สอนให้มันกลายเป็นนักโกหก "กำแพง" อย่างหนึ่งได้แยกการกระทำของการสร้างโทเคน (token) ที่ไม่ถูกต้อง ออกจากการแสดงพฤติกรรมเชิงกลยุทธ์ที่มีเป้าหมายชัดเจนซึ่งเป็นสิ่งที่นิยามการหลอกลวงของมนุษย์

สิ่งที่จำเป็นในการก้าวข้ามกำแพงนี้

ผู้เขียนระบุถึงองค์ประกอบสี่ประการที่อาจทำให้โมเดลสามารถรักษาการหลอกลวงไว้ได้:

  • บทบาทที่มั่นคงที่ต้องรักษาไว้ – อัตลักษณ์ที่สม่ำเสมอที่โมเดลต้องปกป้อง
  • ข้อมูลส่วนตัวที่ต้องปกป้อง – สิ่งที่โมเดลไม่สามารถเปิดเผยได้โดยไม่ได้รับบทลงโทษ
  • รางวัลที่ชัดเจนจากการหลอกลวงที่สำเร็จ – ผลประโยชน์ที่วัดผลได้เมื่อคำโกหกไม่ถูกจับได้
  • การฝึกฝนซ้ำๆ – การทำซ้ำหลายครั้งที่ช่วยให้โมเดลขัดเกลากลยุทธ์การหลอกลวงได้

แม้ว่าเกมคนโกหกของพวกเขาจะมีครบทั้งสี่ประการ แต่โมเดลก็ยังคงล้มเหลว สิ่งนี้บ่งชี้ว่าโมเดลภาษาในปัจจุบันยังขาดกลไกการวางแผนภายในหรือโครงสร้างหน่วยความจำที่จำเป็นสำหรับการต้มตุ๋นแบบหลายขั้นตอน

บทสรุป

การทำ fine-tuning ด้วยคำตอบที่ผิดเพียงอย่างเดียว ไม่ได้มอบชุดเครื่องมือเชิงกลยุทธ์สำหรับการโกหกอย่างต่อเนื่องให้แก่โมเดลภาษา โมเดลที่ถูกทดสอบอาจรายงานข้อเท็จจริงผิดพลาดได้ แต่พวกมันขาดพฤติกรรมการป้องกันและการปกปิดที่เป็นลักษณะเฉพาะของการหลอกลวงแบบมนุษย์ ในขณะนี้ ข้อจำกัดดังกล่าวยังช่วยลดความกังวลที่ว่าการปรับแต่งการฝึกเพียงเล็กน้อยจะเปลี่ยนผู้ช่วยในวันนี้ให้กลายเป็นนักต้มตุ๋นดิจิทัลในวันหน้า