ราคา LLM นั้นเปลี่ยนแปลงอยู่ตลอดเวลา เดือนหนึ่งงบประมาณสำหรับการทำ inference ของคุณอาจเป็นไปตามที่คาดการณ์ไว้เป๊ะๆ แต่อีกเดือนหนึ่ง ผู้ให้บริการอาจปรับอัตราค่าบริการต่อโทเคน ทำให้ยอดใช้จ่ายรายเดือนของคุณเปลี่ยนไปโดยที่ไม่มีการส่งคำขอเพิ่มขึ้นเลยแม้แต่ครั้งเดียว นั่นคือสิ่งที่เพิ่งเกิดขึ้น GMICloud, Novita และ StreamLake ต่างก็อัปเดตราคาโมเดลของตน และหากคุณรันเวิร์กโหลดในระดับโปรดักชัน—หรือแม้แต่ในขั้นตอนการทดลอง—การปรับเปลี่ยนเหล่านี้ควรค่าแก่การพิจารณาอย่างจริงจัง ไม่ใช่เพราะตลาดกำลังพังทลาย แต่เพราะความแตกต่างเพียงเล็กน้อยในด้านเศรษฐศาสตร์ของโทเคนจะส่งผลกระทบอย่างมหาศาลเมื่อคุณต้องประมวลผลโทเคนหลายล้านโทเคนต่อวัน
ผู้ให้บริการเหล่านี้คือใคร
GMICloud, Novita และ StreamLake ต่างมีบทบาทที่แตกต่างกันในโครงสร้างพื้นฐาน AI แต่ในขณะนี้พวกเขากำลังทับซ้อนกันโดยตรงในด้านต้นทุนการรันโมเดลภาษาขนาดใหญ่ (LLM)
GMICloud ดำเนินธุรกิจคลาวด์ GPU ประสิทธิภาพสูง และมีแคตตาล็อก LLM แบบโฮสต์ที่เพิ่มขึ้นเรื่อยๆ สำหรับนักพัฒนาที่ต้องการเข้าถึงผ่าน API โดยไม่ต้องจัดการคลัสเตอร์ของตนเอง Novita สร้างชื่อเสียงจากการเช่า GPU ในราคาประหยัดและการให้บริการโมเดล (model serving) ซึ่งดึงดูดวิศวกรที่ชอบโมเดลแบบ open-weight ในราคาที่ถูกกว่าโมเดลพรีเมียมจากผู้ให้บริการคลาวด์รายใหญ่ (hyperscalers) ส่วน StreamLake ซึ่งเติบโตมาจากระบบนิเวศคลาวด์และสื่อของ ByteDance ได้นำความเชี่ยวชาญด้านโครงสร้างพื้นฐานวิดีโอเข้าสู่การแข่งขันด้านการทำ inference และให้บริการโมเดลผ่านแพลตฟอร์มที่สามารถจัดการเวิร์กโหลดการประมวลผลสื่อหนักๆ ได้ด้วย
ไม่มีเจ้าไหนที่เป็นชื่อที่คุ้นหูเหมือน OpenAI หรือ Anthropic แต่นั่นคือเหตุผลว่าทำไมการเคลื่อนไหวเรื่องราคาของพวกเขาจึงสำคัญ พวกเขาอยู่ในกลุ่มตลาดระดับกลางที่มีการแข่งขันสูง ซึ่งมีอัตรากำไรต่ำ มีส่วนลดทั่วไป และมีการแข่งขันเพื่อดึงดูดนักพัฒนาอย่างต่อเนื่อง เมื่อแพลตฟอร์มสามแห่งในกลุ่มนี้เปลี่ยนอัตราค่าบริการในช่วงเวลาใกล้เคียงกัน พวกเขาจะกลายเป็นตัวกำหนดมาตรฐานใหม่ร่วมกันว่าการรันโมเดลแบบ open-source หรือโมเดลที่ผ่านการ fine-tune ควรจะมีต้นทุนเท่าใด
มีอะไรเปลี่ยนแปลงไปบ้าง
การอัปเดตเหล่านี้ส่งผลกระทบต่อราคาการใช้งาน LLM ในทั้งสามบริการ Naren ซึ่งเขียนในนาม narevbot บน Dev.to ได้บันทึกรายละเอียดเฉพาะเจาะจงไว้ในโพสต์ที่แจกแจงการปรับเปลี่ยนรายโมเดลสำหรับ GMICloud, Novita และ StreamLake คุณสามารถอ่านการเปรียบเทียบฉบับเต็มได้ที่นี่
แทนที่จะไล่เรียงตัวเลขเซนต์ต่อโทเคนซึ่งอาจเปลี่ยนแปลงได้อีกก่อนที่คุณจะอ่านย่อหน้านี้จบ ประเด็นสำคัญคือการเปลี่ยนแปลงเหล่านี้เป็นเชิงโครงสร้าง ผู้ให้บริการแต่ละรายได้ปรับสมดุลวิธีการคิดค่าบริการโทเคนใหม่ และในบางกรณี การปรับเปลี่ยนนี้อาจทำให้โมเดลบางตัวกลายเป็นตัวเลือกที่ถูกที่สุดสำหรับเวิร์กโหลดที่กำหนด นี่แทบจะไม่ใช่การเพิ่มหรือลดราคาแบบเหมาเข่งเสมอไป ผู้ให้บริการรายหนึ่งอาจลดราคา input ในขณะที่ขึ้นราคา output อีกรายอาจไม่แตะต้องโมเดลขนาดเล็ก (small parameter models) แต่กลับขึ้นราคาสำหรับ endpoint ที่รองรับ long-context เนื่องจากทั้งสามรายรองรับการผสมผสานที่แตกต่างกันของ Llama, Qwen, Mistral และสถาปัตยกรรมอื่นๆ ผลกระทบหรือประโยชน์ที่ได้รับจึงขึ้นอยู่กับว่าคุณกำลังส่งโมเดลใดผ่าน API ใด
ทำไมบิลของคุณถึงเปลี่ยน แม้ว่าปริมาณการใช้งานจะเท่าเดิม
เพื่อให้เข้าใจถึงผลกระทบ ให้ดูว่าการเรียกเก็บเงิน LLM ทำงานอย่างไร โดยปกติแล้วคุณจะถูกคิดค่าบริการแยกกันระหว่างโทเคนขาเข้า (input tokens) และโทเคนขาออก (output tokens) และสัดส่วนระหว่างโทเคนทั้งสองจะกำหนดต้นทุนที่มีประสิทธิภาพของคุณ ตัวอย่างเช่น บอทสนับสนุนลูกค้าที่จัดการการสนทนาหนึ่งหมื่นครั้งต่อวัน อาจมีค่าเฉลี่ยโทเคนขาเข้าสองพันโทเคนและโทเคนขาออกสี่ร้อยโทเคนต่อการแชทหนึ่งครั้ง หากคิดราคาเฉลี่ยที่สามดอลลาร์ต่อหนึ่งล้านโทเคน นั่นจะเท่ากับประมาณแปดสิบสี่ดอลลาร์ต่อวัน หากผู้ให้บริการขึ้นราคา output เพียงยี่สิบเปอร์เซ็นต์ ต้นทุนรายวันจะพุ่งสูงเกินเก้าสิบดอลลาร์ เมื่อมองในระยะเวลาหนึ่งไตรมาส นั่นคือค่าใช้จ่ายที่เพิ่มขึ้นเกือบหนึ่งพันดอลลาร์สำหรับปริมาณการใช้งานที่เท่าเดิม
เมื่อขยายขนาดไปสู่เวิร์กโหลดอย่างระบบสร้างเนื้อหา (content generation pipeline) หรือระบบการสร้างคำตอบแบบเสริมการสืบค้น (retrieval-augmented generation) ที่จัดการโทเคนหลายล้านโทเคนต่อชั่วโมง ผู้ให้บริการที่คุณเลือกจะกลายเป็นรายการค่าใช้จ่ายที่สำคัญ GMICloud, Novita และ StreamLake ทราบเรื่องนี้ดี การเปลี่ยนแปลงราคาของพวกเขาเป็นการเคลื่อนไหวเชิงกลยุทธ์ที่ตั้งใจเพื่อมุ่งเป้าไปยังกรณีการใช้งานเฉพาะ เช่น งานแบบ batch ปริมาณมาก, แอปพลิเคชันแชทที่มีความหน่วงต่ำ (low-latency), หรือการสรุปเนื้อหาที่มีบริบทขนาดยาว (long-context summarization)
ความซับซ้อนยังเพิ่มขึ้นอีกระดับ บางแพลตฟอร์มมีการคิดค่าบริการขั้นต่ำต่อคำขอ, ค่าธรรมเนียมการเปิดเครื่องทิ้งไว้ (idle fees) สำหรับ throughput ที่จัดสรรไว้ หรือค่าธรรมเนียมเพิ่มเติมสำหรับการใช้งานที่เกินขีดจำกัด (rate-limit bursts) การเปลี่ยนแปลงค่าบริการขั้นต่ำต่อคำขอจะส่งผลกระทบต่อผู้ใช้งานปริมาณน้อยมากกว่าผู้ใช้งานปริมาณมาก การปรับเปลี่ยนส่วนลดสำหรับการทำ batch inference อาจช่วยลดต้นทุนในการสร้างรายงานประจำคืนของคุณ ในขณะที่บิล API แบบเรียลไทม์ของคุณยังคงเดิม การอ่านแค่หัวข้อว่า “อัปเดตราคา” นั้นไม่เพียงพอ คุณต้องอ่านรายละเอียดในตาราง (matrix) ให้ครบถ้วน
วิธีการตอบสนองโดยไม่ตื่นตระหนกจนเกินไป
เมื่ออัตรามีการเปลี่ยนแปลง ทีมวิศวกรรมส่วนใหญ่มักจะทำผิดพลาดอย่างใดอย่างหนึ่งในสองประการ ไม่ว่าจะเป็นการเพิกเฉยต่อการเปลี่ยนแปลงแล้วยอมแบกรับต้นทุนที่บานปลายไปอย่างเงียบๆ หรือไม่ก็ตื่นตระหนก
