ทำไมความคาดหวังนี้ถึงสำคัญ
AI agent ถูกนำเสนอในฐานะก้าวต่อไปที่เหนือกว่าแชทบอท: ระบบที่สามารถท่องเว็บ, ดึงข้อมูลตัวเลข, เรียกใช้ API และตัดสินใจได้โดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้อง ทั้งเทรดเดอร์, นักวิเคราะห์ และแพลตฟอร์ม SaaS ต่างก็มองว่าสิ่งนี้มีความน่าดึงดูด แต่ในทางปฏิบัติ AI agent ในปัจจุบันกลับทำหน้าที่เหมือน "ระบบอัตโนมัติอัจฉริยะ" (smart automation) ที่ยังคงต้องพึ่งพาเหล่านักพัฒนาเพื่อให้ทำงานอยู่ในร่องในรอย
โครงสร้างทางวิศวกรรมเบื้องหลัง "agent"
การสร้าง agent ที่ใช้งานได้จริงหมายถึงการนำส่วนประกอบหลายอย่างมาประกอบเข้าด้วยกัน:
- Large Language Model (LLM) – แกนกลางด้านการใช้เหตุผลที่ทำหน้าที่อ่าน prompt และเลือกขั้นตอนถัดไป
- Memory layer – บริบทระยะสั้นสำหรับงานปัจจุบัน และฐานข้อมูล vector ระยะยาวที่เก็บ embeddings เพื่อใช้ในการเรียกข้อมูลภายหลัง
- Planner – โมดูลที่ทำงานตามกฎ (rule-based) หรือผ่านการเรียนรู้ เพื่อเลือกการกระทำถัดไปจากผลลัพธ์ของ LLM
- Tools – APIs, web scrapers, code interpreters หรือบริการภายนอกใดๆ ที่ agent ต้องเรียกใช้งาน
- Feedback loop – การตรวจสอบที่ประเมินผลลัพธ์ของแต่ละขั้นตอน และสั่งให้ planner ดำเนินการต่อหรือย้อนกลับไปแก้ไข
แม้แต่ละส่วนจะทำงานได้ แต่จุดเชื่อมต่อ (integration points) นั้นมีความเปราะบาง ในการทดลองนี้ นักพัฒนาต้องใช้เวลาหลายชั่วโมงในการดีบั๊ก (debugging) และต้องคอยปรับปรุง prompt ใหม่ซ้ำแล้วซ้ำเล่าเพื่อให้ LLM ทำงานได้อย่างถูกต้อง
ความท้าทายที่ซ่อนอยู่
Hallucinations (อาการประสาทหลอน)
LLM สามารถสร้างข้อมูลเท็จที่ดูเหมือนจะเป็นความจริงขึ้นมาได้
Infinite loops (ลูปไม่สิ้นสุด)
หากไม่มีมาตรการป้องกันที่ชัดเจน agent อาจทำขั้นตอนที่ล้มเหลวซ้ำไปซ้ำมาไม่สิ้นสุด เช่น "พยายามดึงข้อมูลหน้า X ใหม่" อย่างไม่จบสิ้น นักพัฒนาแก้ปัญหานี้โดยการเพิ่มข้อจำกัดในการลองใหม่ (retries) ตามกฎที่กำหนดไว้ ซึ่งทำให้ต้องเพิ่มส่วนประกอบที่ปรับแต่งขึ้นมาเองอีกหนึ่งอย่าง
การควบคุมต้นทุน
การเรียกใช้ LLM มีค่าใช้จ่ายตามจำนวน token งานที่ใช้เวลานานและเรียกใช้โมเดลที่มีประสิทธิภาพสูงซ้ำๆ อาจทำให้งบประมาณที่ตั้งไว้หมดลงอย่างรวดเร็ว ในการทดลองนี้จึงใช้วิธีแบบไฮบริด (hybrid approach) โดยเริ่มจากโมเดลราคาถูกสำหรับขั้นตอนทั่วไป แล้วจึงสลับไปใช้โมเดลที่มีความสามารถสูงกว่า (และแพงกว่า) เฉพาะเมื่อการใช้เหตุผลมีความซับซ้อนเท่านั้น วิธีนี้ช่วยลดค่าใช้จ่ายแต่ก็เพิ่มความซับซ้อนในการออกแบบสถาปัตยกรรม
ความเสี่ยงด้านความปลอดภัย
การให้ API keys หรือสิทธิ์ในการเขียนข้อมูล (write access) แก่ agent จะเป็นการเพิ่มช่องโหว่ในการโจมตี หาก agent ถูกเจาะระบบ อาจนำไปสู่การขโมยข้อมูลหรือการทำธุรกรรมที่ไม่ได้รับอนุญาต นักพัฒนาจึงใช้หลักการ "สิทธิ์ขั้นต่ำที่จำเป็น" (least privilege) โดยจำกัดให้ agent มีสิทธิ์อ่านข้อมูลเพียงอย่างเดียว (read-only) ในทุกจุดที่ทำได้ ซึ่งส่งผลให้ขอบเขตงานที่ agent ทำได้แคบลงด้วย
บทสรุป
AI agent สามารถช่วยทำงานรวบรวมข้อมูลที่ซ้ำซากให้เป็นอัตโนมัติได้ แต่พวกมันไม่ใช่ระบบแบบ plug-and-play การสร้างระบบที่ทำงานได้ด้วยตัวเองอย่างแท้จริงยังคงต้องใช้โครงสร้างทางวิศวกรรมที่ครบถ้วน การรักษาความปลอดภัยที่เข้มงวด และการจัดการต้นทุนอย่างจริงจัง จนกว่าเลเยอร์ที่ซ่อนอยู่เหล่านี้จะได้รับการปรับปรุงให้เรียบง่ายขึ้น การกำกับดูแลโดยมนุษย์จะยังคงเป็นปัจจัยตัดสินที่สำคัญที่สุดในเวิร์กโฟลว์ AI แบบ "อัตโนมัติ" ใดๆ
