ทำไม AI Search Agents ถึงล้มเหลว: ปัญหาสำคัญเรื่องความกำกวม
ในขณะที่เหล่านักพัฒนามุ่งเน้นไปที่การเพิ่มความลึกในการใช้เหตุผล (reasoning depth) ของ AI agents แต่คอขวดที่แท้จริงในการทำวิจัยแบบอัตโนมัติ (autonomous research) ไม่ใช่ความสามารถในการค้นหา แต่คือความไม่สามารถในการจัดการกับความกำกวม (ambiguity) ผลการศึกษาใหม่เผยให้เห็นว่า แม้แต่ LLM ที่ล้ำสมัยที่สุดก็ยังประสบปัญหาในการหยุดชะงักเพื่อขอคำชี้แจง ซึ่งมักนำไปสู่ "error cascade" หรือการเกิดข้อผิดพลาดต่อเนื่องกันอย่างรุนแรงในกระบวนการใช้เหตุผลที่ยาวนาน
ความก้าวหน้าของ DiscoBench
นักวิจัยจาก Tencent Hunyuan และมหาวิทยาลัย Tsinghua ได้เปิดตัว DiscoBench ซึ่งเป็นกรอบการทดสอบเฉพาะทางที่ออกแบบมาเพื่อประเมินว่าโมเดลภาษาจัดการกับคำถามของผู้ใช้ที่คลุมเครือ ไม่สมบูรณ์ หรือไม่ถูกต้องอย่างไร DiscoBench แตกต่างจากเกณฑ์มาตรฐาน (benchmarks) ก่อนหน้านี้อย่าง GAIA หรือ BrowseComp ที่สมมติว่าคำสั่ง (prompts) นั้นถูกสร้างมาอย่างสมบูรณ์แบบ แต่ DiscoBench จำลองความวุ่นวายที่เกิดขึ้นในโลกแห่งความเป็นจริง
กรอบการทำงานนี้ประกอบด้วย 211 งานใน 11 สาขา รวมถึงวิทยาศาสตร์ การเมือง และดนตรี โดยมีจุดที่เกิดความกำกวมเฉพาะเจาะจงถึง 463 จุด ในแต่ละจุดตรวจสอบ (checkpoint) ตัว agent จะต้องตัดสินใจว่าจะค้นหาต่อไป ให้คำตอบ หรือสิ่งที่สำคัญที่สุดคือการขอคำชี้แจงจากผู้ใช้ เพื่อจำลองการปฏิสัมพันธ์กับมนุษย์ นักวิจัยได้ใช้ Gemini 3 Flash เป็นตัวจำลองผู้ใช้ (user simulator) ที่ใช้ LLM เพื่อให้คำใบ้เมื่อ agent ถามคำถามต่อเนื่องที่มีคุณภาพสูง
Error Cascade: ทำไมการค้นหามากขึ้นจึงไม่ใช่เรื่องดีเสมอไป
การศึกษานี้ระบุถึงรูปแบบที่อันตราย: เมื่อ agent พบกับเอนทิตี (entity) ที่กำกวมหรือชุดเกณฑ์ที่ขัดแย้งกัน บ่อยครั้งที่มันเลือกที่จะ "ค้นหาให้หนักขึ้น" แทนที่จะขอความช่วยเหลือ สิ่งนี้ทำให้เกิดปรากฏการณ์ที่โมเดลดำเนินการค้นหาที่ดูสะอาดตาและถูกต้องตามไวยากรณ์ แต่เป็นการค้นหาที่หลงทางอย่างสิ้นเชิง
ข้อมูลแสดงให้เห็นว่า "การค้นหามากขึ้น" สามารถลดความแม่นยำลงได้ ในโปรไฟล์แบบ "SearchHeavyGuess" ซึ่งโมเดลทำการค้นหาซ้ำๆ แต่สุดท้ายกลับใช้วิธีการเดาแทนที่จะขอคำชี้แจง อัตราความสำเร็จลดลงเหลือเพียง 51.9% ในทางตรงกันข้าม โมเดลที่ใช้กลยุทธ์ "SearchThenAsk" สามารถทำอัตราความสำเร็จได้สูงถึง 93.4% สิ่งนี้พิสูจน์ว่าความล้มเหลวไม่ได้เกิดจากการขาดความสามารถในการดึงข้อมูล (information retrieval) แต่เกิดจากความล้มเหลวในด้านความสามารถในการสื่อสาร (conversational agency)
เกณฑ์ประสิทธิภาพของโมเดลชั้นนำ
การทดสอบโมเดลระดับแนวหน้า 11 โมเดล เผยให้เห็นความจริงที่น่าตกใจ: แม้แต่ผู้นำในอุตสาหกรรมก็ยังยากที่จะก้าวข้ามกำแพงความแม่นยำที่ 50% เมื่อต้องเผชิญกับความกำกวม
- Doubao Seed 2.0 Pro นำกลุ่มด้วยความแม่นยำแบบ end-to-end ที่ 43.1%
- Gemini 3.1 Pro Preview ตามมาติดๆ ที่ 40.8%
- Claude Opus 4.7 ทำได้ 39.8% แม้จะมีอัตราการผ่านจุดตรวจสอบ (checkpoint pass rate) ที่สูงกว่า (57%)
- Qwen3.6 Max และ MiniMax M2.7 ตามหลังอย่างมีนัยสำคัญที่ 12.3% และ 16.1% ตามลำดับ
ที่น่าสนใจคือ แม้ว่านักวิจัยจะให้ system prompt แบบ "Guided" เพื่อบอกโมเดลอย่างชัดเจนให้ระวังความกำกวม แต่ความแม่นยำแบบ end-to-end ก็เพิ่มขึ้นเพียงเล็กน้อยจาก 28.6% เป็น 33.7% เท่านั้น สิ่งนี้บ่งชี้ว่า "การตรวจจับ" ความกำกวม และ "การรู้วิธีแก้ไขผ่านการปฏิสัมพันธ์" เป็นทักษะทางพุทธิปัญญา (cognitive skills) ที่แตกต่างกันสองประการ
นัยสำคัญต่อภูมิทัศน์ของ AI
งานวิจัยนี้เปลี่ยนจุดเน้นของการพัฒนา agentic AI เพื่อสร้างนักวิจัยอัตโนมัติที่เชื่อถือได้จริง อุตสาหกรรมต้องก้าวข้ามการเพิ่มความถี่ในการ "เรียกใช้เครื่องมือ" (tool call) และหันมาให้ความสำคัญกับ การใช้เหตุผลเชิงปฏิสัมพันธ์ (interactive reasoning) พรมแดนถัดไปสำหรับการเพิ่มประสิทธิภาพ LLM ไม่ใช่แค่การดึงข้อมูลที่ดีขึ้น แต่คือการพัฒนา "ตรรกะการขอคำชี้แจง" (clarification logic) ที่ดีขึ้น เพื่อป้องกันไม่ให้ข้อผิดพลาดสะสมเพิ่มขึ้นในระหว่างการทำงานที่ซับซ้อนและมีหลายขั้นตอน
สรุปประเด็นสำคัญ
- ความกำกวมคือจุดล้มเหลวหลัก: AI agents ล้มเหลวไม่ใช่เพราะไม่สามารถหาข้อมูลได้ แต่เป็นเพราะไม่สามารถขอคำชี้แจงได้เมื่อคำถามนั้นระบุรายละเอียดไม่เพียงพอ
- กับดัก "Search-Heavy": การค้นหาเอนทิตีที่ผิดซ้ำๆ ทำให้เกิด error cascade ซึ่งกู้คืนได้ยากกว่าการใช้วิธีเดาเสียอีก
- การตรวจจับ $\neq$ การแก้ไข: คะแนนการตรวจจับที่สูง (การระบุข้อผิดพลาด) ไม่ได้เปลี่ยนเป็นอัตราความสำเร็จที่สูงโดยอัตโนมัติ ซึ่งเน้นย้ำถึงช่องว่างในวิธีที่โมเดลจัดการกับการแก้ปัญหาผ่านการสนทนา
