รายงานส่วนแบ่งการใช้โทเคน (token-share report) ประจำเดือนมิถุนายนของ Vercel แสดงให้เห็นว่าโมเดลแบบ open-weight มีสัดส่วนการจัดการโทเคนผ่าน gateway อยู่ที่ 29% เพิ่มขึ้นจาก 11% ในเดือนเมษายน โดยเฉพาะ DeepSeek เพียงอย่างเดียวก็คิดเป็น 22.6% ของปริมาณดังกล่าว การก้าวกระโดดนี้ส่งสัญญาณถึงการเปลี่ยนแปลงที่รวดเร็ว: นักพัฒนากำลังเปลี่ยนจากการพึ่งพาโมเดล "ที่ดีที่สุด" เพียงตัวเดียว ไปสู่การปฏิบัติกับโมเดล AI ในฐานะโครงสร้างพื้นฐานที่สามารถกำหนดเส้นทางได้ (routable infrastructure)
ทำไมเหล่านักพัฒนาจึงปฏิบัติกับโมเดลเสมือนเป็นโครงสร้างพื้นฐาน
โมเดลแบบ open-weight ราคาถูก ซึ่งหลายตัวมาจากผู้ให้บริการชาวจีน มีราคาเพียงเศษเสี้ยวของโมเดลระดับพรีเมียมอย่าง Anthropic สำหรับงานประจำวัน เช่น การดึงโค้ด (code extraction), การทำความสะอาดข้อความ (text cleaning) หรือการค้นหาข้อมูลแบบง่ายๆ โมเดลที่มีราคาเพียงไม่กี่เซนต์แทนที่จะเป็นดอลลาร์อาจมีความน่าดึงดูดมากกว่า แม้ว่าความแม่นยำจะน้อยกว่าเพียงไม่กี่เปอร์เซ็นต์ก็ตาม
ผลลัพธ์ที่ได้คือรูปแบบการออกแบบใหม่ (design pattern) โดยแอปพลิเคชันจะส่งคำขอไปยังโมเดลที่มีต้นทุนต่ำก่อนสำหรับส่วนงานที่ "ไม่ซับซ้อน" หากผลลัพธ์ผ่านการตรวจสอบคุณภาพเบื้องต้น กระบวนการก็จะดำเนินต่อไป แต่หากไม่ผ่าน โมเดลที่มีราคาสูงกว่าจะถูกเรียกใช้งานเพื่อตรวจสอบซ้ำหรือตัดสินใจในขั้นตอนสุดท้าย ตรรกะการกำหนดเส้นทาง (routing logic) จึงกลายเป็นส่วนสำคัญ ไม่ใช่การเลือกใช้โมเดลใดโมเดลหนึ่งเพียงอย่างเดียว
ตัวเลขเหล่านี้บอกอะไรเรา
ข้อมูลของ Vercel ซึ่งดึงมาจาก gateway ที่เชื่อมต่อกับผู้ให้บริการ AI หลายราย แสดงให้เห็นว่าโมเดลแบบ open-weight กำลังเปลี่ยนจากส่วนน้อยไปสู่กระแสหลัก ในเดือนเมษายน โมเดลเหล่านี้มีสัดส่วนเพียงเล็กกว่าหนึ่งในสิบของโทเคนทั้งหมด แต่เมื่อถึงเดือนมิถุนายน สัดส่วนได้เพิ่มขึ้นเกือบหนึ่งในสาม โดย DeepSeek ซึ่งเป็นโมเดลจากจีน มีส่วนแบ่งปริมาณโทเคนมากกว่าหนึ่งในห้าด้วยตัวมันเอง
อย่างไรก็ตาม โมเดลระดับไฮเอนด์ยังคงครองสัดส่วนการใช้จ่ายส่วนใหญ่ ตัวอย่างเช่น Anthropic ยังคงได้รับส่วนแบ่งรายจ่ายที่เป็นตัวเงินส่วนใหญ่เนื่องจากราคาต่อโทเคนสูงกว่า คณิตศาสตร์นั้นตรงไปตรงมา: โมเดลราคาถูกจะชนะในงานที่มีปริมาณมากแต่กำไรน้อย (high-volume, low-margin) ในขณะที่โมเดลราคาแพงจะยังคงรักษาความสำคัญในงานที่มีผลกระทบสูงและกำไรสูง (high-margin, high-impact)
ผลกระทบต่อ AI agents
โดยปกติแล้ว AI agent จะทำงานเป็นลำดับขั้นตอน ได้แก่ การวางแผน, การดึงข้อมูล, การเรียกใช้เครื่องมือ และการขัดเกลาผลลัพธ์ เมื่อแต่ละขั้นตอนสามารถมอบหมายให้กับโมเดลที่คุ้มค่าที่สุดได้ ต้นทุนการดำเนินงานโดยรวมก็จะลดลงอย่างมหาศาล
- การดึงข้อมูล (Data retrieval) และ การสกัดข้อมูล (extraction) มักต้องการเพียงความเข้าใจภาษาขั้นพื้นฐาน ซึ่งเป็นงานที่โมเดลราคาถูกทำได้ดีเยี่ยม
- การตัดสินใจขั้นสุดท้าย (Final judgment) ซึ่งเป็นส่วนที่ตัดสินว่าคำตอบนั้นยอมรับได้หรือไม่ ยังคงเป็นหน้าที่ของโมเดลระดับพรีเมียมที่มีความน่าเชื่อถือสูงกว่า
แนวทางแบบแบ่งชั้น (layered approach) นี้ช่วยให้นักพัฒนาสามารถจัดการกับปริมาณงานที่ใหญ่ขึ้นได้โดยไม่ทำให้งบบานปลาย นอกจากนี้ยังบีบให้เกิดการเปลี่ยนผ่านจากการ "เลือกโมเดลที่ดีที่สุด" ไปสู่การ "วัดความสำเร็จในแต่ละขั้นตอนและกำหนดเส้นทางตามความเหมาะสม"
ความเสี่ยงและข้อจำกัด
แม้ว่าความคุ้มค่าทางเศรษฐศาสตร์จะน่าดึงดูด แต่การเปลี่ยนผ่านนี้ก็ไม่ได้ราบรื่นเสมอไป
- การปฏิบัติตามกฎระเบียบ (Compliance): บางเขตอำนาจศาลมีกฎระเบียบการจัดการข้อมูลที่เข้มงวด ซึ่งอาจจำกัดการใช้โมเดลที่โฮสต์อยู่ในต่างประเทศ
- ความซับซ้อนในการโฮสต์ (Hosting complexity): โมเดลระดับพรีเมียมขนาดใหญ่ทำได้ยากที่จะรันภายในองค์กร ดังนั้นองค์กรจึงต้องพึ่งพา API ภายนอก ซึ่งอาจเพิ่มความหน่วง (latency) และความกังวลเรื่องการผูกขาดกับผู้ให้บริการ (vendor-lock)
เนื่องจากปัจจัยเหล่านี้ โมเดลราคาถูกจึงไม่น่าจะเข้ามาแทนที่โมเดลระดับพรีเมียมได้ทั้งหมด แต่จะกลายเป็นตัวเลือกหลักสำหรับงานประจำวัน ในขณะที่โมเดลระดับพรีเมียมจะยังคงอยู่ใน "ชั้นการตัดสินใจ" (decision layer) ซึ่งความคุ้มค่าของราคาที่สูงกว่านั้นสมเหตุสมผล
สิ่งที่ควรจับตามองต่อไป
- เครื่องมือสำหรับการทำ routing: เมื่อเลเยอร์การกำหนดเส้นทางกลายเป็นหัวใจสำคัญ เราสามารถคาดหวังการมาถึงของ SDK และแพลตฟอร์มต่างๆ ที่จะช่วยเลือกโมเดลโดยอัตโนมัติ โดยอิงจากความหน่วง (latency), ต้นทุน และเกณฑ์ความเชื่อมั่น (confidence thresholds)
นักพัฒนาที่เริ่มวัดความสำเร็จในระดับงาน (task-level success), ติดตามการลองใหม่ (retries) และแยกแยะงานประเภท "ปริมาณ" ออกจากงานประเภท "การตัดสินใจ" อย่างชัดเจน จะเป็นกลุ่มที่อยู่ในตำแหน่งที่ดีที่สุดในการตักตวงผลประโยชน์จากแนวคิดด้านโครงสร้างพื้นฐานที่กำลังเกิดขึ้นนี้
สรุป: AI stack กำลังเปลี่ยนผ่านจากการเลือกโมเดลเพียงตัวเดียวไปสู่ปัญหาเรื่องการกำหนดเส้นทาง (routing problem) โดยที่โมเดล open-weight ราคาถูกจะจัดการงานส่วนใหญ่ และโมเดลระดับพรีเมียมจะถูกสำรองไว้สำหรับการตัดสินใจที่มีผลกระทบสูง การเชี่ยวชาญในการทำ routing นั้นจะเป็นความได้เปรียบในการแข่งขันครั้งต่อไปสำหรับผู้สร้าง AI
