Deep Interaction ช่วยให้นักพัฒนาสามารถแก้ไขลำดับการใช้เหตุผล (reasoning chain) ของโมเดลภาษาได้ทันที ซึ่งช่วยเพิ่มความสำเร็จในการแก้ไขได้มากกว่า 25% และลดการใช้ token ลงประมาณ 40% ในโจทย์ด้าน STEM

ทำไมวิธีการแก้ไขที่มีอยู่ในปัจจุบันจึงยังไม่เพียงพอ

โมเดลภาษาขนาดใหญ่ (LLMs) ที่ใช้เทคนิค chain-of-thought prompting จะย่อยคำถามที่ซับซ้อนออกเป็นขั้นตอนทางตรรกะหลายขั้นตอน เมื่อขั้นตอนใดขั้นตอนหนึ่งผิดพลาด โดยปกติแล้วนักพัฒนาจะต้องเริ่มการสนทนาใหม่หรือใส่ prompt เพื่อแก้ไขไว้ข้างหน้า ซึ่งทั้งสองวิธีล้วนทำให้เสียเวลา เนื่องจากโมเดลมักจะทำผิดซ้ำเดิมหรือกล่าวคำขอโทษแบบทั่วไปโดยไม่ได้เรียนรู้สิ่งใดเลย นักพัฒนาจึงต้องส่ง prompt จำนวนมากเพียงเพื่อประคองให้โมเดลกลับเข้าสู่เส้นทางที่ถูกต้อง ซึ่งเป็นการเพิ่มจำนวน token และต้นทุนการประมวลผลโดยไม่จำเป็น

สิ่งที่ Deep Interaction ทำแตกต่างออกไป

เทคนิคใหม่นี้มองว่าผลลัพธ์ของโมเดลเป็นข้อความที่สามารถแก้ไขได้ แทนที่จะเป็นคำตอบแบบกล่องดำ (black-box) โดยมีขั้นตอนการทำงานดังนี้:

  1. ระบุจุดผิดพลาด – นักพัฒนาชี้ไปยังขั้นตอนที่ผิดพลาดในลำดับการใช้เหตุผลได้อย่างแม่นยำ
  2. แก้ไขในจุดนั้น – นักพัฒนาเขียนบรรทัดนั้นใหม่ โดยยังคงขั้นตอนที่ถูกต้องโดยรอบไว้
  3. กลั่นกรองการแก้ไข – ระบบจะแปลงการแก้ไขโดยมนุษย์ให้เป็น prompt ที่กระชับซึ่งครอบคลุมตรรกะที่ต้องการ
  4. ชี้นำโมเดล – LLM จะได้รับ prompt ที่ผ่านการกลั่นกรองนี้และดำเนินการใช้เหตุผลต่อไปจากจุดที่ได้รับการแก้ไขแล้ว

การป้อนการแก้ไขที่ตรงจุดให้แก่โมเดล แทนที่จะเป็นการส่ง prompt ใหม่ทั้งหมด ช่วยหลีกเลี่ยงการต้องสร้างส่วนของคำตอบก่อนหน้าที่ถูกต้องอยู่แล้วขึ้นมาใหม่

ผลลัพธ์ที่วัดผลได้

ผลการทดสอบมาตรฐาน (Benchmarks) บนชุดงานด้าน STEM แสดงให้เห็นถึงผลกระทบอย่างชัดเจน เมื่อนักพัฒนาใช้ Deep Interaction สัดส่วนของคำตอบที่ได้รับการแก้ไขสำเร็จเพิ่มขึ้นมากกว่าหนึ่งในสี่เมื่อเทียบกับการใช้ re-prompting แบบมาตรฐาน ในขณะเดียวกัน การใช้ token ก็ลดลงประมาณ 40% ซึ่งช่วยลดค่าใช้จ่ายในการประมวลผลบนคลาวด์และทำให้แอปพลิเคชันแบบโต้ตอบทำงานได้รวดเร็วขึ้น

ใครจะได้รับประโยชน์บ้าง

  • นักพัฒนา – ไม่จำเป็นต้องเขียนสคริปต์เพื่อวนลูปปรับจูน prompt อย่างไม่สิ้นสุดอีกต่อไป การแก้ไขเพียงครั้งเดียวสามารถแก้ข้อผิดพลาดทางตรรกะได้ ช่วยประหยัดเวลาสำหรับงานในระดับที่สูงขึ้น
  • องค์กรที่สร้างเครื่องมือทางวิทยาศาสตร์หรือวิศวกรรม – การใช้เหตุผลที่น่าเชื่อถือมากขึ้นหมายถึงข้อผิดพลาดที่ตามมาจะน้อยลงในการจำลอง (simulations), การคำนวณ หรือกระบวนการวิเคราะห์ข้อมูล
  • ผู้ใช้งานทั่วไป – การตอบสนองที่เร็วขึ้นและค่าบริการที่ถูกลงช่วยยกระดับประสบการณ์การใช้งานผู้ช่วย AI โดยรวม

ข้อจำกัดและข้อโต้แย้ง

Deep Interaction ตั้งอยู่บนสมมติฐานที่ว่านักพัฒนาสามารถระบุและอธิบายข้อผิดพลาดทางตรรกะที่แน่ชัดได้ ในโดเมนที่ข้อผิดพลาดมีความซับซ้อนหรือการใช้เหตุผลนั้นไม่ชัดเจน การแก้ไขด้วยตนเองอาจทำได้ยากในทางปฏิบัติ นอกจากนี้ ผลลัพธ์ที่รายงานมานั้นยังมาจากชุดการทดสอบ STEM ที่มีการควบคุมสภาพแวดล้อมไว้

สรุป

Deep Interaction เปลี่ยนนักพัฒนาจากผู้ใช้งานเชิงรับให้กลายเป็นผู้สอนเชิงรุก ช่วยให้สามารถแก้ไขการใช้เหตุผลของ LLM ได้อย่างแม่นยำและมีต้นทุนต่ำ