โมเดล Fable 5 ของ Anthropic สามารถเอาชนะยิมแบดจ์แรกได้ใน 1,785 เทิร์น โดยใช้ค่าใช้จ่าย 65.40 ดอลลาร์ ในขณะที่เล่นเกม Pokémon FireRed เวอร์ชันภาษาจีนโดยใช้เพียงข้อมูลภาพจากเกมเท่านั้น การเล่นครั้งนี้พิสูจน์ว่าโมเดลสามารถเล่นเกมในส่วนที่คุ้นเคยจนจบได้โดยไม่ต้องใช้คำสั่งที่เป็นข้อความเลย แต่เมื่อเจาะลึกเข้าไปในกระบวนการคิด (thinking chain) ของโมเดล กลับพบว่ามันเป็นการท่องจำความรู้เกี่ยวกับเกมมากกว่าที่จะเป็นการ "มองเห็น" และใช้เหตุผลจากแต่ละพิกเซลจริงๆ
การพิสูจน์ข้อกล่าวอ้างของ Anthropic
เมื่อ Anthropic เปิดตัว Fable 5 ทางบริษัทได้เน้นย้ำถึงการสาธิตแบบ “vision-only” ซึ่งโมเดลสามารถนำทางในเกม Pokémon FireRed ได้โดยการมองที่หน้าจอเพียงอย่างเดียว พาดหัวข่าวทำให้ดูเหมือนว่าระบบสามารถตีความสภาพแวดล้อมทางภาพใดๆ ได้ตั้งแต่เริ่มต้น นักพัฒนาคนหนึ่งจึงพยายามตรวจสอบข้อกล่าวอ้างนั้นโดยการจำลองการตั้งค่าตามที่ระบุไว้ในหน้าเปิดตัวของ Anthropic และรันโมเดลกับเกมเวอร์ชันแปลภาษาจีน
วิธีการดำเนินการทดลอง
ระบบควบคุม (harness) ที่สร้างขึ้นมาเป็นพิเศษทำหน้าที่ป้อนเฟรมวิดีโอดิบให้กับโมเดลและบันทึกการเลือกการกระทำของมัน ระบบนี้ตรงตามคำอธิบายของ Anthropic โดยการส่งเฟรมใหม่แต่ละเฟรมไปยังโมเดลและอ่านค่าอินพุตจากคอนโทรลเลอร์ที่เลือก การทดสอบดำเนินไปตามลูปของเกมจนกระทั่งโมเดลได้รับยิมแบดจ์แรก จากนั้นจึงดำเนินต่อไปจนถึงเทิร์นที่ 2,000 ซึ่งตัวละครเดินทางไปถึง Route 3
ผลลัพธ์เชิงปริมาณนั้นชัดเจน:
- ได้รับยิมแบดจ์แรกหลังจากผ่านไป 1,785 เทิร์น
- ค่าใช้จ่ายในการประมวลผลทั้งหมด 65.40 ดอลลาร์
- เมื่อถึงเทิร์นที่ 2,000 ตัวละครอยู่ที่ Route 3
สิ่งที่บันทึกข้อมูล (logs) เผยให้เห็น
อย่างไรก็ตาม บันทึกข้อมูลดิบกลับบอกเล่าเรื่องราวที่แตกต่างออกไปเกี่ยวกับ วิธีการ ที่โมเดลไปถึงจุดนั้น "thinking chain" ภายในของโมเดลได้เขียนข้อมูลที่ยังไม่ปรากฏบนหน้าจอซ้ำแล้วซ้ำเล่า
- ที่เทิร์น 78 โมเดลระบุว่าคู่แข่งจะเลือก Charmander ทั้งที่เกมยังไม่ได้แสดงการเลือกของคู่แข่ง
- 141 เทิร์นต่อมา เมื่อเกมมอบ Oak’s Parcel ให้กับผู้เล่น โมเดลก็ได้บันทึกชื่อไอเทมไว้ในบันทึกของมันเรียบร้อยแล้ว
- ในขณะที่เดินทางผ่าน Route 3 โมเดลสามารถระบุตัวเทรนเนอร์เฉพาะเจาะจงได้โดยการยกประโยคสนทนาที่มีชื่อเสียงซึ่งไม่เคยปรากฏในฟีดภาพเลย
ข้อมูลเหล่านี้ไม่ใช่ผลมาจากการวิเคราะห์แบบพิกเซลต่อพิกเซล แต่มันคือลักษณะเด่นของระบบที่ได้จดจำบทรายละเอียดของเกมไว้ภายใน—ซึ่งเป็นความรู้ประเภทเดียวกับที่พบในคู่มือการเล่น (walkthroughs), วิกิ (wikis) และวิดีโอจากแฟนคลับที่มีอยู่มากมายบนอินเทอร์เน็ต กล่าวอีกนัยหนึ่งคือ โมเดลดูเหมือนจะใช้การมองเห็นเพียงเพื่อยืนยันแผนที่ที่มันจำได้ขึ้นใจอยู่แล้วเท่านั้น
ทำไมเรื่องนี้จึงสำคัญต่อเกณฑ์มาตรฐานการใช้เหตุผลเชิงภาพ (visual-reasoning benchmarks)
การทดลองนี้ตอกย้ำถึงข้อบกพร่องที่เล็กน้อยแต่สำคัญในแบบทดสอบการใช้เหตุผลเชิงภาพหลายๆ แบบ:
- อินพุตที่สะอาดไม่ได้การันตีว่าสถานะความรู้จะสะอาดด้วย แม้ว่าช่องทางเดียวจะเป็นสตรีมภาพ แต่โมเดลอาจดึงข้อมูลจากคลังความรู้มหาศาลที่จดจำไว้มาใช้
- System prompts ไม่สามารถลบข้อมูลการฝึกฝนได้ โมเดลที่เคยเห็นคู่มือการเล่นแบบสมบูรณ์แล้วไม่สามารถถูกบังคับให้ "ลืม" ได้หากไม่มีการฝึกฝนใหม่
- ประสิทธิภาพอาจเป็นการวัดความจำ ไม่ใช่การรับรู้ เมื่อโลกที่ใช้ทดสอบตรงกับชุดข้อมูลที่รู้จัก โมเดลสามารถประสบความสำเร็จได้ด้วยการจับคู่รูปแบบต่อรูปแบบ แทนที่จะเป็นการตีความข้อมูลภาพใหม่จริงๆ
หากเกณฑ์มาตรฐานยังคงใช้ “vision-only” เป็นตัวแทนของการใช้เหตุผลเชิงภาพต่อไป ก็มีความเสี่ยงที่จะทำให้การกล่าวอ้างเกี่ยวกับความสามารถของ AI ในการเข้าใจสภาพแวดล้อมใหม่ๆ นั้นเกินจริง บริษัทต่างๆ อาจโอ้อวดตัวเลขที่น่าประทับใจในขณะที่ทักษะพื้นฐานยังคงจำกัด—ซึ่งเป็นประเด็นสำคัญสำหรับนักลงทุน นักพัฒนา และใครก็ตามที่สร้างระบบที่เน้นความปลอดภัย (safety-critical systems) ซึ่งต้องทำงานในสภาพแวดล้อมที่ไม่เคยเห็นมาก่อนจริงๆ
มุมมองแย้ง: การจดจำคือปัญหาจริงๆ หรือ?
บางคนแย้งว่าการยืนยันแผนที่ที่รู้จักยังคงต้องใช้การใช้เหตุผลรูปแบบหนึ่ง นั่นคือโมเดลต้องปรับการแสดงแทนภายใน (internal representation) ให้สอดคล้องกับสัญญาณภาพที่เห็นในปัจจุบัน จากมุมมองนั้น การสาธิตนี้แสดงให้เห็นถึงความสามารถที่มีประโยชน์ นั่นคือการใช้การมองเห็นเพื่อเชื่อมโยงกับฐานความรู้ที่มีอยู่เดิม ข้อโต้แย้งนี้มีน้ำหนัก เพราะงานนี้เกี่ยวข้องกับการตรวจสอบการรับรู้จริง
อย่างไรก็ตาม เป้าหมายหลักของเกณฑ์มาตรฐานคือการประเมินการอนุมานเชิงภาพแบบ ทั่วไป ไม่ใช่การดึงบทที่บันทึกไว้มาใช้ เมื่อโมเดลสามารถทำนายเหตุการณ์ได้ก่อนที่จะปรากฏขึ้น การทดสอบนั้นก็ไม่สามารถแยกแยะการรับรู้ออกมาได้อย่างโดดเดี่ยวอีกต่อไป เส้นแบ่งระหว่างการเชื่อมโยงข้อมูลที่มีประโยชน์กับการโกงอย่างชัดเจนจะเริ่มพร่าเลือน และผลลัพธ์จะสูญเสียคุณค่าในการวินิจฉัย
ขั้นตอนต่อไปและการตอบรับจากชุมชน
เพื่อทดสอบขีดจำกัดของการจดจำ ผู้ทดสอบกำลังรันโมเดลเดิมบนแผนที่ที่ถูกปรับเปลี่ยนซึ่งมีการเปลี่ยนภูมิศาสตร์ โค้ดทั้งหมด, custom harness และไฟล์ log ทั้งหมดได้ถูกเปิดเผยต่อสาธารณะแล้ว เพื่อเชิญชวนให้นักวิจัยคนอื่นๆ นำการทดลองนี้ไปทำซ้ำหรือนำไปประยุกต์ใช้กับเกมอื่นๆ นอกจากนี้ ยังมีการเปิดช่องทางสนทนาบนแพลตฟอร์มชุมชนแห่งการเรียนรู้เพื่อการพูดคุยแลกเปลี่ยนอย่างต่อเนื่อง
บทสรุป
การสาธิตแบบ vision-only ที่ประสบความสำเร็จเพียงเพราะโมเดลรู้คำตอบอยู่แล้ว ไม่ใช่หลักฐานของการใช้เหตุผลทางภาพ (visual reasoning) ที่แท้จริง การทดสอบมาตรฐาน (benchmarks) ต้องแยกความรู้ที่จดจำมาออกจากความสามารถในการรับรู้แบบทันทีทันใด (on-the-fly perception) มิฉะนั้นอาจมีความเสี่ยงที่จะประเมินความสามารถของ AI ในการนำทางผ่านโลกทัศน์ที่ไม่คุ้นเคยอย่างแท้จริงสูงเกินไป
