ผู้เขียนงานวิจัย SEED ได้เปิดตัววิธีการที่ช่วยให้เอเจนต์การเรียนรู้แบบเสริมกำลัง (reinforcement-learning หรือ RL) สามารถเปลี่ยนบันทึกความล้มเหลว (failure logs) ของตนเองให้กลายเป็นข้อมูลการฝึกฝนใหม่ๆ ได้ วิธีนี้ช่วยยกระดับคะแนนเฉลี่ยบน ALFWorld benchmark ขึ้นเป็น 91.8 และลดปริมาณข้อมูลการฝึกฝนลงประมาณ 40% เทคนิคเดียวกันนี้ยังช่วยเพิ่มคะแนนขึ้นถึง 15.3 จุดในงานที่เอเจนต์ไม่เคยเห็นมาก่อน ซึ่งพิสูจน์ให้เห็นว่าโมเดลสามารถเรียนรู้จากความผิดพลาดของตนเองได้โดยไม่ต้องอาศัยการควบคุมจากมนุษย์เพิ่มเติม

ทำไมเอเจนต์ RL ถึงต้องการมากกว่าแค่สัญญาณผ่าน/ไม่ผ่าน

การตั้งค่า RL ทั่วไปจะให้รางวัลเอเจนต์เมื่อสิ้นสุดตอน (episode) ที่ยาวนานเท่านั้น สัญญาณดังกล่าวจะบอกระบบว่าผลลัพธ์นั้นผิดพลาด แต่ไม่ได้บอกว่าความผิดพลาดเกิดขึ้นที่จุดใด หากความผิดพลาดเกิดขึ้นเมื่อสิบขั้นตอนก่อนหน้า เช่น การใช้คำค้นหาที่ผิดหรือการเปิดไฟล์ที่ไม่ถูกต้อง สัญญาณแบบไบนารี (binary signal) ในตอนท้ายจะทิ้งข้อมูลระหว่างทางทั้งหมดไป การสูญเสียนี้ทำให้เหล่านักวิจัยต้องเก็บรวบรวมตอนจำนวนมหาศาลเพียงเพื่อจะดึงรูปแบบที่หายากซึ่งนำไปสู่ความล้มเหลวออกมา

SEED เปลี่ยนวงจรการตอบกลับ (feedback loop) อย่างไร

SEED (Self-Evolving On-Policy Distillation) เพิ่มขั้นตอนการเรียนรู้รอบที่สองหลังจากจบแต่ละตอน:

  1. ทำงานให้เสร็จ – เอเจนต์ทำงานจนเสร็จสิ้นและได้รับป้ายกำกับความสำเร็จ/ความล้มเหลวตามปกติ
  2. อ่านบันทึกของตนเอง – ลำดับของการกระทำ การสังเกต และการตัดสินใจระหว่างทางจะถูกส่งกลับไปยังโมเดล
  3. เขียนบทเรียนด้วยภาษาธรรมชาติ – โมเดลจะสร้างประโยคสั้นๆ ที่อธิบายว่าเกิดอะไรขึ้น เช่น “คำค้นหา ‘X’ ให้ผลลัพธ์ที่ไม่เกี่ยวข้อง” หรือ “เปิดไฟล์ ‘Y’ แทนที่จะเป็น ‘Z’”
  4. กลั่นกรองบทเรียนเข้าสู่การอัปเดตพอลลิซี (policy updates) – ประโยคเหล่านั้นจะกลายเป็นเป้าหมายสำหรับขั้นตอนการกลั่นกรองแบบ on-policy (on-policy distillation) รอบใหม่ เพื่อสอนตรรกะเบื้องหลังการแก้ไขให้กับโมเดล

บทเรียนที่สร้างขึ้นไม่ใช่พรอมต์ (prompts) ที่ใช้ในขณะอนุมาน (inference time) แต่เป็นสัญญาณการฝึกฝนภายในที่ช่วยปรับเปลี่ยนพอลลิซี (policy) ในทางปฏิบัติ เอเจนต์จึงกลายเป็นครูของตัวเอง โดยการเปลี่ยนบันทึกความล้มเหลวที่ดิบเถื่อนให้กลายเป็นความรู้ที่มีโครงสร้าง

อะไรที่ทำให้แนวทางนี้มีประสิทธิภาพมากกว่าเทคนิคการใช้หน่วยความจำ

วิธีแก้ปัญหาที่พบบ่อยคือการแนบหน่วยความจำภายนอก (external memory buffer) เพื่อจัดเก็บสถานะที่สำคัญหรือบันทึกไว้สำหรับเรียกใช้ในภายหลัง กลยุทธ์นั้นสร้าง "ตู้เก็บเอกสาร" ที่แผ่ขยายออกไป ซึ่งเอเจนต์ต้องเรียนรู้วิธีการดึงข้อมูลที่ถูกต้องออกมาในเวลาที่เหมาะสม ซึ่งเป็นปัญหาที่ไม่ใช่เรื่องง่ายและยังอาจพลาดความเชื่อมโยงเชิงเหตุและผลระหว่างการกระทำและผลลัพธ์ได้

SEED หลีกเลี่ยงปัญหาการเรียกคืนข้อมูล (retrieval problem) โดยการฝังบทเรียนลงในพอลลิซีโดยตรงผ่านการกลั่นกรอง (distillation) ทำให้เอเจนต์ซึมซับการแก้ไขให้กลายเป็นทักษะ แทนที่จะเป็นเพียงบันทึกที่ต้องไปค้นหาในภายหลัง ผลลัพธ์ที่ได้คือวงจรที่กระชับขึ้นระหว่างการตรวจพบข้อผิดพลาดและการเปลี่ยนแปลงพฤติกรรม

ตัวเลขที่สำคัญ

  • ALFWorld benchmark – คะแนนเฉลี่ย 91.8 ซึ่งเอาชนะเกณฑ์มาตรฐาน RL แบบดั้งเดิมที่ใช้สภาพแวดล้อมเดียวกัน
  • ประสิทธิภาพของข้อมูล (Data efficiency) – ให้ประสิทธิภาพที่เท่ากันหรือดีกว่า โดยใช้จำนวนตอนการฝึกฝนน้อยลงประมาณ 40%
  • การปรับใช้กับงานทั่วไป (Generalization) – ในงานที่ไม่เคยเห็นมาก่อน วิธีนี้ช่วยเพิ่มคะแนนได้ 15.3 จุดเมื่อเทียบกับ RL มาตรฐาน ซึ่งบ่งชี้ว่าบทเรียนที่สร้างขึ้นเองสามารถจับรูปแบบการใช้เหตุผลที่ถ่ายโอนไปยังงานอื่นได้

ตัวเลขเหล่านี้บ่งชี้ว่า SEED สามารถลดงบประมาณด้านการคำนวณและข้อมูลสำหรับการฝึกฝนเอเจนต์ที่ซับซ้อน ซึ่งเป็นประโยชน์อย่างยิ่งสำหรับทีมที่ขาดแคลนทรัพยากรในการจำลอง (simulation) จำนวนมหาศาล

ความเสี่ยงและข้อจำกัด

เทคนิคนี้ขึ้นอยู่กับความสามารถของโมเดลในการตีความประสบการณ์ของตนเองได้อย่างถูกต้อง หากเอเจนต์อ่านสภาพแวดล้อมผิดพลาด เช่น การสรุปสาเหตุของความล้มเหลวผิดไป มันอาจสร้างบทเรียนที่ผิดพลาดอย่างมั่นใจ การฝึกฝนด้วยคำแนะนำที่เกิดจากการหลอน (hallucinated advice) เช่นนี้อาจเป็นการตอกย้ำนิสัยที่ไม่ดี ผู้เขียนระบุว่าสิ่งนี้คล้ายคลึงกับการวิเคราะห์หลังจบงาน (post-mortems) ของมนุษย์ ซึ่งบางครั้งนักวิเคราะห์ก็สร้างคำอธิบายที่ดูเรียบร้อยเกินไปจนบดบังปัญหาที่ลึกกว่า

สิ่งที่ควรจับตามองต่อไป

  • การรวมเข้ากับ RL pipelines ที่มีอยู่ – เนื่องจาก SEED เพิ่มเพียงขั้นตอนการประมวลผลหลังจบตอนเท่านั้น จึงสามารถนำไปใส่ในวงจรการฝึกฝนที่มีอยู่เดิมได้โดยใช้ความพยายามทางวิศวกรรมเพียงเล็กน้อย

นักพัฒนาที่สร้างเอเจนต์ RL ควรเริ่มปฏิบัติต่อบันทึกตอน (episode logs) ให้เป็นมากกว่าแค่ข้อมูลจัดเก็บ หลังจากจบการทำงานแต่ละครั้ง ให้สั่งให้ระบบแสดงข้อมูลดังนี้:

  • การตัดสินใจที่ช่วยให้งานก้าวหน้ามากที่สุด
  • ข้อสันนิษฐานที่ทำให้เสียขั้นตอนมากที่สุด
  • การตรวจสอบง่ายๆ ที่น่าจะตรวจพบข้อผิดพลาดได้เร็วกว่านี้

แทนที่จะป้อนบันทึกเหล่านั้นกลับเข้าไปในรูปแบบของพรอมต์แบบเฉพาะกิจ (ad-hoc prompts) ให้ป้อนพวกมันเข้าสู่ขั้นตอนการกลั่นกรอง (distillation step) ตามที่ SEED เสนอ ผลตอบแทนที่ได้รับนั้นชัดเจน: ประสิทธิภาพที่ดีขึ้น ใช้ข้อมูลน้อยลง และโมเดลที่เรียนรู้ที่จะอธิบายความผิดพลาดของตัวเองได้

สรุปประเด็นสำคัญ: การเปลี่ยนบันทึกเหตุการณ์ความล้มเหลวให้กลายเป็นบทเรียนที่สร้างขึ้นเอง สามารถเปลี่ยนการตอบสนองแบบรางวัลที่เบาบาง (sparse reward feedback) ให้กลายเป็นสัญญาณการฝึกฝนที่เข้มข้นและนำกลับมาใช้ใหม่ได้ ซึ่งเป็นแนวทางที่นำไปใช้ได้จริงในการทำให้ RL รวดเร็วขึ้นและใช้ข้อมูลได้อย่างมีประสิทธิภาพมากขึ้น