DeepMind เปิดตัว DiffusionGemma ในสัปดาห์นี้ ซึ่งเป็นโมเดลภาษาแบบ open-weight ที่สามารถสร้างโทเคนได้ประมาณ 1,500 โทเคนต่อวินาทีบน GPU H100 เพียงตัวเดียว ในขณะที่โมเดล Gemma 4 มาตรฐานทำความเร็วสูงสุดได้ที่ประมาณ 303 โทเคนต่อวินาที การเพิ่มความเร็วนี้มีความสำคัญเพราะสามารถลดคอขวดด้านความหน่วง (latency) ที่ทำให้เอเจนต์ที่ขับเคลื่อนด้วย AI ในแอปพลิเคชันแบบเรียลไทม์ทำงานช้าลง

ก้าวข้ามข้อจำกัดของการสร้างแบบทีละโทเคน

โมเดลภาษาที่ทันสมัยส่วนใหญ่สร้างข้อความแบบ autoregressive คือการทำนายโทเคนหนึ่ง แล้วป้อนกลับเข้าสู่โมเดล จากนั้นจึงทำนายโทเคนถัดไป ลูปแบบ "จากซ้ายไปขวา" นี้บังคับให้เกิดความเชื่อมโยงอย่างใกล้ชิดระหว่างการประมวลผล (compute) และหน่วยความจำ (memory) เนื่องจากต้องมีการเข้าถึงค่าน้ำหนัก (weights) ของโมเดลสำหรับทุกๆ โทเคน DiffusionGemma จึงแทนที่ลูปดังกล่าวด้วยกระบวนการแบบ discrete diffusion ที่มองกลุ่มโทเคนขนาด 256 โทเคนเป็นบล็อกข้อมูลที่มีสัญญาณรบกวน (noisy data) เพียงบล็อกเดียว จากนั้นโมเดลจะทำการกำจัดสัญญาณรบกวน (denoise) ทั้งบล็อกแบบขนาน (in parallel) ซึ่งเป็นการเปลี่ยนภาระงานจากการค้นหาค่าน้ำหนักซ้ำๆ ไปเป็นการเพิ่มปริมาณการประมวลผลต่อขั้นตอนแทน สำหรับฮาร์ดแวร์ที่โดดเด่นด้านการคำนวณแบบขนาน เช่น Nvidia H100 การแลกเปลี่ยนนี้ถือว่าคุ้มค่า

ทำไมความเร็วถึงสำคัญสำหรับ AI agents

โดยปกติแล้วเอเจนต์อัตโนมัติ (Autonomous agents) จะทำงานเป็นวงจรของการค้นหา การสรุปความ และการทดสอบ แต่ละขั้นตอนอาจต้องมีการเรียกใช้โมเดลหลายครั้ง ดังนั้นความหน่วงต่อโทเคนจึงสามารถสะสมเพิ่มขึ้นได้อย่างรวดเร็ว เมื่อโมเดลหยุดชะงัก ไพป์ไลน์ของเอเจนต์ทั้งหมดจะติดขัด ส่งผลให้ต้นทุนสูงขึ้นและประสบการณ์ของผู้ใช้แย่ลง

การแลกเปลี่ยนด้านประสิทธิภาพ

ความเร็วของ DiffusionGemma ต้องแลกมาด้วยความสามารถพื้นฐานที่ลดลงอย่างเห็นได้ชัด ในการทดสอบ AIME benchmark ซึ่งเป็นชุดทดสอบที่วัดความสามารถด้านการใช้เหตุผล ความถูกต้องของข้อเท็จจริง และความเข้าใจภาษา DiffusionGemma ได้คะแนน 69.1 ในขณะที่ Gemma 4 ทำได้ถึง 88.3 นอกจากนี้ แนวทางแบบ diffusion ยังแสดงจุดอ่อนในการสร้างผลลัพธ์ที่สั้นมาก และมีอาการ "พูดติดอ่าง" (stuttering) ของโทเคนในบางครั้ง ซึ่งข้อความที่สร้างขึ้นมีการซ้ำหรือหยุดชะงัก และเมื่อมีผู้ใช้มากกว่าประมาณ 32 คนเรียกใช้งานโมเดลพร้อมกัน ข้อได้เปรียบด้านการประมวลผลแบบขนานจะลดลง และวิธีการแบบ autoregressive มาตรฐานจะไล่ตามทันในแง่ของปริมาณงานรวม (throughput)

แนวทางการใช้งานที่เหมาะสมสำหรับแต่ละรูปแบบ

ข้อมูลบ่งชี้ถึงกลยุทธ์การปรับใช้แบบไฮบริด:

  • Diffusion models สำหรับงานที่มีการใช้งานพร้อมกันต่ำ (low-concurrency) และไวต่อความหน่วง (latency-sensitive) ซึ่งไม่ต้องการการใช้เหตุผลเชิงลึก เช่น การสร้างพรอมต์สั้นๆ การเติมเทมเพลต หรือการเขียนร่างข้อความ
  • Autoregressive models สำหรับภาระงานที่มีการใช้งานพร้อมกันสูง การใช้เหตุผลที่ซับซ้อน หรือการสร้างข้อความขนาดยาวที่ความแม่นยำมีความสำคัญมากกว่าความเร็ว

การเปลี่ยนแปลงนี้ส่งผลอย่างไรต่อโครงสร้างพื้นฐาน AI

หากเราสามารถเพิ่มความเร็วได้จากการคิดค้นอัลกอริทึมการสร้างใหม่ แทนที่จะเป็นการขยายขนาดโมเดลเพียงอย่างเดียว ชัยชนะด้านประสิทธิภาพที่ยิ่งใหญ่ที่สุดอาจมาจากการปรับปรุง "ระบบโครงสร้างพื้นฐานภายใน" (plumbing) การแลกเปลี่ยนนี้ยังหมายความว่านักพัฒนาต้องยอมรับคุณภาพที่ลดลงเล็กน้อยสำหรับบางกรณีการใช้งาน

มุมมองแย้ง: diffusion พร้อมสำหรับการใช้งานจริงแล้วหรือยัง?

การนำ diffusion มาใช้งานยังมีปัญหาเมื่อใช้กับพรอมต์สั้นๆ และอาจให้ผลลัพธ์ที่ดูไม่ราบรื่น (jittery)

สิ่งที่ต้องจับตามองต่อไป

  • การศึกษาเรื่องการขยายขนาด (Scaling studies): โมเดล diffusion ที่มีขนาดใหญ่ขึ้นจะสามารถลดช่องว่างด้านความสามารถในขณะที่ยังรักษาความเร็วไว้ได้หรือไม่?
  • การปรับแต่งฮาร์ดแวร์ (Hardware optimizations): เมื่อ GPU พัฒนาขึ้น สมดุลระหว่างขั้นตอน diffusion ที่เน้นการประมวลผล (compute-heavy) และ autoregression ที่เน้นค่าน้ำหนัก (weight-heavy) อาจเปลี่ยนแปลงอีกครั้ง
  • อัลกอริทึมการจัดเส้นทาง (Routing algorithms): ต้นแบบแรกๆ ของตัวจัดเส้นทางโมเดลที่รับรู้ถึงงาน (task-aware model routers) จะเผยให้เห็นว่าความหน่วงโดยรวมของระบบจะลดลงได้มากเพียงใดจากการเลือกใช้งานแบบไดนามิก

บทสรุป

DiffusionGemma พิสูจน์ให้เห็นว่าการคิดค้นลูปการสร้างพื้นฐานใหม่สามารถลดความหน่วงลงได้อย่างมหาศาลโดยไม่ต้องเพิ่มจำนวนชิป เทคโนโลยีนี้ไม่ใช่การเข้ามาแทนที่โมเดลแบบ autoregressive ทั้งหมด แต่เป็นเครื่องมือที่น่าสนใจสำหรับ AI stack แบบไฮบริด ที่ซึ่งความเร็วและความแม่นยำจะถูกปรับให้สมดุลตามลักษณะของแต่ละงาน โครงสร้างพื้นฐาน AI ในระลอกถัดไปอาจไม่ได้ถูกตัดสินเพียงแค่ขนาดของโมเดล แต่จะตัดสินจากความชาญฉลาดในการจัดเส้นทางงานผ่านเครื่องยนต์ (engine) ที่เหมาะสม