ABSeeker’s new “Answer-Backtracked Credit Assignment” (ABC) method lets long-horizon search agents earn credit for each individual step instead of only the final answer, and a 4 billion-parameter model trained with it can already match or surpass much larger competitors.

ความก้าวหน้านี้มีความสำคัญเพราะเอเจนต์ส่วนใหญ่ในปัจจุบันจะถูกตัดสินเพียงแค่เมื่อสิ้นสุดงานเท่านั้น หากคำตอบสุดท้ายถูกต้อง การทำงานทั้งหมดจะถูกระบุว่าดี แต่หากผิดพลาด ลำดับขั้นตอนทั้งหมดจะถูกระบุว่าแย่ การตอบสนองแบบ "ได้ทั้งหมดหรือไม่ได้เลย" (all-or-nothing) เช่นนี้ ได้บดบังสัญญาณการเรียนรู้ที่แท้จริง เช่น การดำเนินการที่ดีแต่ดันตามมาด้วยความผิดพลาด หรือการคลิกที่ไร้ประโยชน์แต่โชคดีที่นำไปสู่ผลลัพธ์ที่ถูกต้อง แนวทางของ ABSeeker จึงเข้ามาเปลี่ยนกฎเกณฑ์เดิมเหล่านี้

ทำไมแนวทางแบบเดิมถึงยังไม่เพียงพอ

เมื่อเอเจนต์ทำการค้นหา เขียนโค้ด หรือรวบรวมหลักฐาน โดยปกติแล้วจะต้องดำเนินการหลายขั้นตอน เช่น การส่งคำสั่งค้นหา (queries) การเปิดหน้าเว็บ การรันคำสั่ง การตรวจสอบสถานะของระบบ และอื่นๆ ในการทำงาน 15 ขั้นตอน เพียงแค่ก้าวพลาดเพียงครั้งเดียวก็อาจทำให้คำตอบสุดท้ายพังทลายลงได้ แม้ว่าขั้นตอนก่อนหน้านั้นจะถูกต้องก็ตาม ในทางกลับกัน การทำงานที่จบลงด้วยคำตอบที่ถูกต้องอาจเกิดจากความโชคดี โดยที่ขั้นตอนส่วนใหญ่ไม่ได้สร้างคุณค่าใดๆ เลย การฝึกฝนโดยพิจารณาเพียงผลลัพธ์สุดท้ายจะบังคับให้โมเดลมองว่าเส้นทางการทำงานทั้งหมดเป็น "กล่องดำ" (black box) เพียงใบเดียว ซึ่งทำให้ยากต่อการเรียนรู้ว่าพฤติกรรมย่อยใดที่มีประโยชน์จริงๆ

สถานการณ์นี้คล้ายกับการดีบั๊ก (debugging) ในวิศวกรรมซอฟต์แวร์ นักพัฒนาจะไล่ตรวจสอบทุกบรรทัด แยกส่วนที่เรียกใช้งานผิดพลาด และแก้ไขมัน อย่างไรก็ตาม เอเจนต์กลับไม่ได้รับ "ใบเสร็จ" (receipt) ของการทำงานภายในที่เทียบเคียงกันได้เลย หากไม่มีร่องรอยการตรวจสอบ (audit trail) ดังกล่าว นักพัฒนาจะไม่สามารถบอกได้ว่าการปรับปรุงนั้นเกิดจากการใช้เหตุผลที่ดีขึ้นหรือเป็นเพียงแค่เรื่องบังเอิญ และไม่สามารถแก้ไขนิสัยที่ไม่ดีได้อย่างเป็นระบบ

ABC ปรับเปลี่ยนการให้เครดิตอย่างไร

Answer-Backtracked Credit Assignment ทำงานย้อนกลับจากคำตอบสุดท้ายที่ถูกต้อง โดยเริ่มจากการดึงเบาะแสสำคัญที่คำตอบนั้นต้องพึ่งพา เช่น หลักฐานเฉพาะเจาะจง ผลลัพธ์ระหว่างทาง หรือการตรวจสอบสถานะ จากนั้นจึงย้อนกลับไปตามร่องรอย (trace) ที่บันทึกไว้ เพื่อให้คะแนนแต่ละการกระทำเทียบกับเบาะแสเหล่านั้น การกระทำที่ส่งผลโดยตรงต่อเบาะแสที่จำเป็นจะได้รับเครดิตเป็นบวก ส่วนการกระทำที่ไม่เกี่ยวข้องหรือเป็นอันตรายจะได้รับคะแนนเป็นลบหรือเป็นศูนย์

รูปแบบการฝึกฝนสองแบบต่อยอดจากการให้คะแนนนี้:

  • ABC-SFT (Supervised Fine-Tuning) จะปรับน้ำหนักของ loss function ใหม่ เพื่อให้ขั้นตอนที่มีเครดิตสูงส่งผลต่อโมเดลมากขึ้น โมเดลจะเรียนรู้ที่จะให้ความสำคัญกับลำดับการกระทำที่เคยนำไปสู่เบาะแสที่มีประโยชน์ในอดีต
  • ABC-GRPO (Gradient-based Reward Policy Optimization) จะใช้คะแนนในแต่ละขั้นตอนเป็นสัญญาณรางวัล (reward signal) สำหรับการเรียนรู้แบบเสริมกำลัง (reinforcement learning) เพื่อตอกย้ำส่วนเฉพาะของการค้นหาที่ช่วยให้ได้คำตอบออกมา

ด้วยการเปลี่ยนป้ายกำกับแบบผ่าน/ไม่ผ่าน (binary pass/fail) ให้กลายเป็นแผนผังการมีส่วนร่วมที่ละเอียด (granular map) ABC จึงช่วยให้โมเดลได้รับสัญญาณการเรียนรู้ที่เข้มข้นกว่าเดิมมาก

ผลลัพธ์ในช่วงแรกบ่งบอกได้อย่างชัดเจน

นักวิจัยได้นำ ABC ไปใช้กับโมเดลขนาด 4 พันล้านพารามิเตอร์ ซึ่งติดตั้งเลเยอร์การจัดการบริบท (context-management layer) ที่คอยติดตามสถานะการค้นหาที่เปลี่ยนแปลงไป ในงานทดสอบมาตรฐาน (benchmark tasks) ที่โดยปกติแล้วจะเอื้อต่อเอเจนต์ที่มีขนาดใหญ่กว่ามาก โมเดลที่ฝึกด้วย ABC สามารถทำคะแนนได้เทียบเท่าหรือเหนือกว่าระบบที่ใหญ่กว่าเหล่านั้น การเพิ่มขึ้นของประสิทธิภาพนี้เกิดขึ้นโดยไม่ต้องเพิ่มขนาดโมเดล ซึ่งบ่งชี้ว่าการให้เครดิตที่ดีขึ้นสามารถใช้ทดแทนจำนวนพารามิเตอร์ดิบๆ ได้

บทสรุปสำคัญนั้นเรียบง่าย: เพียงแค่ให้ "ใบเสร็จ" ที่ชัดเจนแก่โมเดลว่าสิ่งใดที่ได้ผล มันก็จะสามารถดึงคุณค่าออกมาได้มากขึ้นจากข้อมูลการฝึกฝนในปริมาณเท่าเดิม

สิ่งนี้หมายถึงอะไรสำหรับเอเจนต์ในโลกแห่งความเป็นจริง

เอเจนต์ใดก็ตามที่ทำงานหลายขั้นตอน เช่น ผู้ช่วยเขียนโค้ด, บอตรีวิววรรณกรรม, หรือเครื่องมือสนับสนุนลูกค้า ล้วนต้องพึ่งพาร่องรอย (trace) ของการกระทำ ABC แสดงให้เห็นว่าการรักษาและประเมินร่องรอยเหล่านั้นไม่ใช่แค่ส่วนเสริมที่มีก็ดีแต่ไม่มีก็ได้ แต่มันเป็นสิ่งจำเป็นสำหรับการเรียนรู้ที่มีประสิทธิภาพ

  • Coding agents จำเป็นต้องบันทึกแผนการ, คำสั่งแต่ละคำสั่งที่ส่งออกไป, และผลการทดสอบที่ช่วยยืนยันความถูกต้องของโค้ด
  • Research agents ต้องเก็บรักษาคำสั่งค้นหาที่ส่งไป, แหล่งข้อมูลที่เปิด, และหลักฐานที่สกัดออกมา
  • Support agents ควรบันทึกการตรวจสอบสถานะและจุดตัดสินใจทุกจุดที่นำไปสู่การแก้ไขปัญหา

เมื่อมีร่องรอยเหล่านี้อยู่ ABC จะสามารถให้เครดิตได้อย่างแม่นยำ ช่วยให้โมเดลสามารถตอกย้ำนิสัยที่ดีและละทิ้งทางลัดที่เกิดจากความโชคดี ซึ่งหากไม่มีระบบนี้อาจถูกเข้าใจผิดว่าเป็นทักษะได้

ข้อโต้แย้งและอุปสรรคในทางปฏิบัติ

ประโยชน์ของ ABC มาพร้อมกับความซับซ้อนที่เพิ่มขึ้น

บทสรุป

Answer-Backtracked Credit Assignment พลิกโฉมแนวทางเดิมๆ ในการสอนเอเจนต์ให้รู้จักการค้นหา การเขียนโค้ด และการใช้เหตุผล ด้วยการให้รางวัลแก่การตัดสินใจที่ถูกต้องในระหว่างกระบวนการ แทนที่จะมุ่งเน้นเพียงแค่ผลลัพธ์สุดท้าย วิธีนี้ช่วยให้โมเดลที่มีขนาดไม่ใหญ่มากสามารถเรียนรู้ได้อย่างมีประสิทธิภาพเทียบเท่ากับโมเดลที่มีขนาดใหญ่กว่ามาก สำหรับผู้ที่กำลังพัฒนาเอเจนต์ที่ต้องทำงานหลายขั้นตอน การนำระบอบการฝึกฝนที่เน้นร่องรอยการทำงาน (trace-centric training regime) มาใช้จึงไม่ใช่เพียงทางเลือก แต่เป็นเส้นทางสำคัญสู่การสร้าง AI ที่เชื่อถือได้ ตรวจสอบได้ และมีความฉลาดมากขึ้นในท้ายที่สุด