นักวิจัยอิสระคนหนึ่งได้บันทึกจำนวน token ทุกตัวที่เอเจนต์วิจัยที่ขับเคลื่อนด้วย LLM ของเขาใช้งานตลอดหนึ่งเดือน และสามารถลดค่าใช้จ่ายลงได้ถึง 31% โดยค่าใช้จ่ายลดลงจาก $945 เหลือ $651 ในขณะที่อัตราความสำเร็จเพิ่มขึ้นจาก 91% เป็น 93% ซึ่งเป็นผลลัพธ์ที่ใครก็ตามที่รันเวิร์กโฟลว์ AI ที่เน้นเรื่องต้นทุนจะต้องให้ความสนใจ
ทำไมข้อมูลระดับ token ถึงมีความสำคัญ
ผู้ใช้ LLM ส่วนใหญ่เห็นเพียงใบแจ้งหนี้ใบสุดท้าย ซึ่งเป็นยอดรวมที่ซ่อนต้นทุนของแต่ละงานย่อยไว้ เอเจนต์ของนักวิจัยคนนี้ทำหน้าที่หลัก 3 อย่าง ได้แก่ การค้นหาเอกสาร SEC filings, การร่างรายงาน และการรวบรวมการสังเคราะห์งานวิจัย หากไม่มีข้อมูลที่ละเอียดพอ เขาจะไม่สามารถบอกได้เลยว่าเงิน $312 ที่เขาจ่ายไปในเดือนมิถุนายนนั้นคุ้มค่าหรือไม่
เพื่อเปิดเผยการรั่วไหลที่ซ่อนอยู่ เขาได้เพิ่มเลเยอร์การบันทึกข้อมูลด้วย PostgreSQL ที่เก็บข้อมูลชื่อโมเดล, จำนวน token, ประเภทงาน และต้นทุนต่อการเรียกใช้งาน (per-call cost) หลังจากผ่านไป 30 วัน ข้อมูลก็ได้แสดงภาพที่ชัดเจน:
- การค้นหา SEC filing – 41% ของค่าใช้จ่ายทั้งหมด
- การร่างรายงาน – 28%
- การสังเคราะห์งานวิจัย – 17%
- การตรวจสอบคุณภาพ – 9%
- อื่นๆ – 5%
ตัวเลขแสดงให้เห็นว่าขั้นตอนที่แพงที่สุดไม่ใช่ตัวโมเดลเอง แต่เป็นวิธีที่เอเจนต์ป้อนผลการค้นหาดิบ (raw search results) เข้าไปใน prompt
3 การปรับเปลี่ยนที่ช่วยลดค่าใช้จ่าย
1. สรุปข้อมูลก่อนส่ง prompt
เดิมทีเอเจนต์จะใส่ผลการค้นหาดิบถึง 20 รายการลงในแต่ละ prompt ซึ่งทำให้จำนวน token ขาเข้าพุ่งสูงขึ้นมาก เขาจึงใส่ตัวสรุปข้อมูล (summarizer) ราคาถูกเข้าไปก่อนเพื่อลดปริมาณข้อมูลขาเข้า ส่งผลให้ต้นทุนต่อหนึ่งงานค้นหาลดลงจาก $0.84 เหลือ $0.19 หรือลดลงถึง 77%
2. ส่งงานตรวจสอบง่ายๆ ไปยังโมเดลที่ราคาถูกกว่า
การตรวจสอบคุณภาพเดิมทีใช้โมเดลระดับไฮเอนด์ซึ่งมีต้นทุน $0.09 ต่อการตรวจสอบหนึ่งครั้ง เขาจึงเปลี่ยนมาใช้โมเดลที่มีราคาต่ำกว่าสำหรับการตรวจสอบแบบ pass/fail ส่วนใหญ่ ซึ่งช่วยลดราคาต่อการตรวจสอบลงเหลือเพียง $0.01 โดยโมเดลที่ราคาถูกกว่านี้สามารถตอบได้ถูกต้องถึง 89% ของจำนวนครั้งทั้งหมด หากเกิดความผิดพลาด ระบบจะส่งงานต่อไปยังโมเดลเดิม (escalate) เพื่อรักษาความแม่นยำในขณะที่ลดต้นทุนลงได้ถึง 87%
3. ข้ามการตรวจสอบเมื่อมีความมั่นใจสูง
เขาได้เพิ่มกฎเพื่อข้ามขั้นตอนการตรวจสอบคุณภาพในกรณีที่อัตราความสำเร็จในอดีตของงานนั้นสูง และความยาวของผลลัพธ์อยู่ในขอบเขตที่คาดการณ์ไว้ วิธีนี้ช่วยกำจัดขั้นตอนการตรวจสอบที่ต้องรันอยู่แล้วออกไปได้ประมาณ 60%
ผลลัพธ์ที่ได้
หลังจากปรับเปลี่ยนทั้ง 3 อย่าง บัญชีรายเดือนก็มีลักษณะดังนี้:
- ค่าใช้จ่ายรวม: $945 → $651 (ลดลง 31%)
- ต้นทุนการค้นหา SEC ต่อหนึ่งงาน: $0.84 → $0.19 (ลดลง 77%)
- ต้นทุนการตรวจสอบคุณภาพต่อหนึ่งงาน: $0.09 → $0.01 (ลดลง 87%)
- อัตราความสำเร็จโดยรวม: 91% → 93%
อัตราความสำเร็จที่สูงขึ้นบ่งชี้ว่า prompt ที่สั้นลงช่วยลดสัญญาณรบกวน (noise) และช่วยให้โมเดลจดจ่อกับคำถามหลักได้ดีขึ้น
ข้อควรระวังและมุมมองที่ต่างออกไป
แนวทางนี้ขึ้นอยู่กับสมมติฐานสองประการ ประการแรก ตัวสรุปข้อมูลที่ราคาถูกกว่าต้องสามารถรักษาข้อมูลที่เพียงพอสำหรับการใช้เหตุผลในขั้นตอนถัดไป (downstream reasoning) หากมันตัดรายละเอียดสำคัญทิ้ง คุณภาพของผลลัพธ์อาจลดลง ประการที่สอง โมเดลที่มีต้นทุนต่ำกว่าซึ่งใช้สำหรับการตรวจสอบคุณภาพนั้นไม่ได้สมบูรณ์แบบ ความแม่นยำที่ 89% หมายความว่าความผิดพลาดจำนวนเล็กน้อยยังคงหลุดไปถึงผลิตภัณฑ์สุดท้าย แม้ว่าระบบการส่งต่องาน (escalation path) จะช่วยดักจับส่วนใหญ่ไว้ได้ก็ตาม ผู้ใช้ที่มีความต้องการด้านการปฏิบัติตามกฎระเบียบ (compliance) ที่เข้มงวดกว่าอาจจำเป็นต้องใช้เกณฑ์ที่รัดกุมขึ้นหรือขั้นตอนการตรวจสอบเพิ่มเติม
สิ่งนี้หมายความว่าอย่างไรสำหรับผู้ใช้งาน LLM
- แดชบอร์ดที่ละเอียดคือผู้ชนะ รายงานค่าใช้จ่ายในภาพรวมมักซ่อนการสิ้นเปลือง token ไว้ การบันทึกการใช้งานแยกตามประเภทงานจะช่วยเผยให้เห็นความไร้ประสิทธิภาพที่หากไม่ทำเช่นนั้นก็จะถูกซ่อนไว้ตลอดไป
- ไม่จำเป็นต้องใช้โมเดลระดับแนวหน้า (Frontier models) เสมอไป โมเดลราคาถูกสามารถบีบอัดข้อมูลหรือตัดสินใจแบบ binary ง่ายๆ ได้โดยไม่ทำให้คุณภาพโดยรวมลดลง
ต้นทุนที่ซ่อนอยู่ของ LLM agent มักจะเป็นงานที่ไม่ได้ถูกวัดผล การติดตั้งระบบติดตามการไหลของ token และการปรับปรุงประสิทธิภาพอย่างตรงจุด ช่วยให้นักวิจัยเปลี่ยนบิลรายเดือนจาก $945 เป็นการดำเนินงานที่คล่องตัวขึ้นที่ $651 ในขณะที่ยังเพิ่มประสิทธิภาพให้สูงขึ้น สำหรับใครก็ตามที่ต้องวางงบประมาณสำหรับเวิร์กโหลด AI บทเรียนนี้ชัดเจนมาก: จงวัดผลทุก token แล้วปล่อยให้ข้อมูลเป็นตัวกำหนดว่าควรตัดลดตรงไหน
