AWS ได้เพิ่มตัวเลือก “prefix-aware routing” ให้กับ Amazon SageMaker Inference ซึ่งสัญญาว่าจะช่วยเพิ่มอัตรา cache-hit และลดความหน่วง (latency) ลงอย่างเห็นได้ชัดสำหรับลูกค้าที่รันโมเดลภาษาขนาดใหญ่ (LLMs) บนโครงสร้างพื้นฐานของตนเอง การเปลี่ยนแปลงนี้มีความสำคัญเพราะช่วยลดความหน่วงและลดต้นทุนการประมวลผล GPU ได้อย่างชัดเจน

ทำไมความหน่วงของ LLM ถึงสำคัญ

เมื่อ LLM ได้รับคำขอ โดยปกติแล้วมันจะคำนวณ attention ใหม่ทั้งหมดจากพรอมต์ (prompt) ซึ่งเป็นขั้นตอนที่สิ้นเปลืองและจะเพิ่มขึ้นตามจำนวนโทเคน (token) ที่เพิ่มเข้ามา หากโมเดลสามารถนำ attention cache จากคำขอก่อนหน้ามาใช้ใหม่ได้ มันก็ต้องการเพียงแค่ประมวลผลข้อความส่วนใหม่เท่านั้น เวิร์กโหลด (workloads) ที่มีการส่ง system prompt เดิมซ้ำๆ หรือมีการรักษาประวัติการสนทนาไว้ จึงเป็นกลุ่มเป้าหมายหลักที่จะได้รับประโยชน์จากการใช้แคชซ้ำ

ในการตั้งค่า SageMaker แบบเริ่มต้น คำขอที่เข้ามาจะถูกกระจายไปยังกลุ่มของ inference instances แบบสุ่ม การกระจายแบบสุ่มหมายความว่าคำขอที่ควรจะไปลงที่ warm cache มักจะไปลงที่ cold instance แทน ซึ่งทำให้ต้องมีการคำนวณใหม่ทั้งหมด ผลลัพธ์ที่ได้คือความหน่วงที่สูงขึ้นและต้องใช้รอบการทำงานของ GPU เพิ่มขึ้น ซึ่งส่งผลโดยตรงต่อค่าใช้จ่ายที่สูงขึ้น

prefix-aware routing ทำงานอย่างไร

โหมดการกำหนดเส้นทางแบบใหม่นี้จะเก็บแผนผังขนาดเล็ก (lightweight map) ของพรีฟิกซ์คำขอล่าสุด ซึ่งก็คือส่วนแรกของพรอมต์ที่มักจะคงที่ในการเรียกใช้งานแต่ละครั้ง เมื่อมีคำขอใหม่เข้ามา SageMaker จะตรวจสอบแผนผังและส่งคำขอไปยัง instance ที่เคยประมวลผลพรีฟิกซ์เดียวกันนั้นมาแล้ว หาก instance นั้นยังมี attention cache ที่เกี่ยวข้องอยู่ โมเดลก็จะสามารถข้ามขั้นตอนการทำงานส่วนใหญ่และสร้างคำตอบได้เร็วขึ้น

ประเด็นสำคัญ:

  • ไม่ต้องแก้ไขโค้ด – ฟีเจอร์นี้ทำงานอยู่ในชั้นของบริการ inference ทั้งหมด
  • ใช้ได้เฉพาะกับโมเดลที่โฮสต์เอง (self-hosted models) เท่านั้น – บริการแบบ managed เช่น OpenAI’s API หรือบริการของ Anthropic จะไม่ได้รับผลกระทบ
  • โปร่งใสต่อแอปพลิเคชัน – URL ของ SageMaker endpoint และข้อกำหนด API (API contract) เดิมยังคงใช้งานได้เหมือนเดิม

ใครจะได้รับประโยชน์

องค์กรที่โฮสต์ LLMs บน SageMaker ทำเช่นนั้นด้วยเหตุผลที่หลากหลาย ตั้งแต่ความเป็นส่วนตัวของข้อมูลไปจนถึงการควบคุมต้นทุน สำหรับผู้ที่รันแชทบอทสนับสนุนลูกค้า ผู้ช่วยฝ่ายขาย หรือเอเจนต์โต้ตอบใดๆ ที่มีการใช้ system prompt แบบคงที่ซ้ำๆ การปรับแต่งการกำหนดเส้นทางนี้สามารถลดเวลาตอบสนองเฉลี่ยลงได้ ในด้านต้นทุน ทุกครั้งที่เกิด cache hit จะช่วยประหยัด GPU จากการต้องประเมินส่วนของพรอมต์ที่ใช้ร่วมกันใหม่

ข้อจำกัดและข้อโต้แย้ง

ประโยชน์นี้ขึ้นอยู่กับการมีพรีฟิกซ์ที่ซ้ำกัน พรอมต์ที่มีความแปรผันสูง เช่น คำถามแบบครั้งเดียวทิ้ง หรือข้อความระบบที่สร้างขึ้นแบบไดนามิก จะไม่ได้รับประโยชน์จากอัตรา cache-hit ในระดับเดียวกัน

เนื่องจากฟีเจอร์นี้จำกัดอยู่เพียงการใช้งานแบบ self-hosted ลูกค้าที่ผูกติดอยู่กับบริการ LLM แบบ managed จึงไม่สามารถใช้ประโยชน์จากฟีเจอร์นี้ได้

สรุป: Prefix-aware routing ช่วยให้ผู้ใช้ SageMaker สามารถลดความหน่วง (latency) ในเวิร์กโหลด LLM ที่มีการทำซ้ำได้ด้วยวิธีที่ง่ายและไม่ต้องเขียนโค้ด (zero-code) พร้อมทั้งช่วยลดต้นทุน GPU สำหรับองค์กรที่โฮสต์โมเดลบนแพลตฟอร์มนี้อยู่แล้ว การอัปเกรดนี้ถือเป็นการปรับแต่งที่มีความเสี่ยงต่ำ ซึ่งอาจเปลี่ยนเป็นการโต้ตอบกับผู้ใช้ที่รวดเร็วขึ้นและค่าใช้จ่ายที่ลดลง