Alibaba เปิดตัว Qwen3.8-Max ซึ่งเป็นโมเดลแบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ถึง 2.4 ล้านล้านพารามิเตอร์ โดยทำคะแนนความสำเร็จได้ถึง 86.1% ในการทดสอบ OSWorld-Verified ซึ่ง Alibaba ระบุว่าคะแนนนี้เหนือกว่า GPT-5.6, Sol Max และ Fable 5 การทดสอบนี้เป็นการวัดความสามารถของ AI ในการโต้ตอบกับระบบปฏิบัติการ การติดตั้งซอฟต์แวร์ และการดีบั๊กโค้ด ซึ่งเป็นชุดทักษะที่เป็นรากฐานสำคัญสำหรับเอเจนต์วิศวกรรมซอฟต์แวร์แบบอัตโนมัติ (autonomous software-engineering agents)

การแข่งขันสู่ยุคเอเจนต์อัตโนมัติ

โมเดลภาษาขนาดใหญ่ (Large language models) ได้เปลี่ยนผ่านจากผู้ช่วยในรูปแบบการแชท ไปสู่เครื่องมือที่สามารถเขียน ทดสอบ และแม้กระทั่งติดตั้ง (deploy) โค้ดได้ บริษัทที่สามารถส่งต่องานวิศวกรรมประจำวันให้แก่ AI ได้อย่างน่าเชื่อถือ จะสามารถลดต้นทุนด้านบุคลากรและเร่งวงจรการพัฒนาผลิตภัณฑ์ให้เร็วขึ้น การทดสอบ OSWorld-Verified ได้กลายเป็นมาตรฐานวัดความสามารถด้าน "agentic" โดยปริยาย เนื่องจากต้องใช้มากกว่าแค่การสร้างข้อความแบบคงที่ แต่ต้องอาศัยการโต้ตอบกับระบบในโลกแห่งความเป็นจริง

สิ่งที่ Qwen3.8-Max นำเสนอ

  • สถาปัตยกรรม MoE พร้อมพารามิเตอร์ 2.4 ล้านล้านตัว – สามารถเรียกใช้เครือข่ายย่อยผู้เชี่ยวชาญ (expert sub-networks) ได้สูงสุดถึง 64 เครือข่ายต่อหนึ่งโทเคน ซึ่งเป็นดีไซน์ที่ Alibaba อ้างว่าช่วยลดค่าใช้จ่ายในการประมวลผลลงได้ประมาณ 40%
  • การจัดการพรอมต์แบบ Multimodal – โมเดลสามารถรับทั้งข้อความ รูปภาพ และข้อมูลที่มีโครงสร้าง (structured data) ได้พร้อมกัน ช่วยให้การส่งคำสั่งเพียงครั้งเดียวสามารถอธิบาย UI แสดงภาพหน้าจอ และส่งไฟล์กำหนดค่า (configuration files) ไปพร้อมกันได้
  • หน้าต่างบริบท (context window) ขนาด 64k โทเคน – มีพื้นที่เพียงพอสำหรับฐานโค้ด (codebases) ทั้งหมด ไฟล์ล็อก (log files) หรือรายงานทางเทคนิคที่มีความยาว โดยไม่ต้องแบ่งย่อยเป็นส่วนๆ

ฟีเจอร์เหล่านี้มุ่งเป้าไปที่เวิร์กโฟลว์แบบ "end-to-end" ที่ทีมซอฟต์แวร์ต้องใช้เวลาหลายชั่วโมง เช่น การดึง dependencies, การสแกนล็อก, การแก้ไขบั๊ก และการสร้างเอกสารประกอบ

เจาะลึกตัวเลขสถิติ

งาน ตัวชี้วัดที่รายงาน
OSWorld-Verified (การโต้ตอบกับ OS แบบ agentic) สำเร็จ 86.1%
การสร้างโค้ด (HumanEval-Plus) ผ่าน 78.4%
การใช้เหตุผลแบบ Multimodal (MM-Bench) 84.3%
การสรุปความบริบทระยะยาว (การทดสอบ 50k โทเคน) 90.2%

ตัวเลขทั้งหมดมาจากการทดสอบภายในของ Alibaba หากผลลัพธ์เหล่านี้เป็นจริง โมเดลนี้จะช่วยให้องค์กรต่างๆ มี API เพียงตัวเดียวที่สามารถจัดการทั้งโค้ด รูปภาพ และเอกสารขนาดใหญ่ได้ ในขณะที่ยังรักษาต้นทุนการประมวลผล (inference costs) ให้ต่ำกว่าคู่แข่งที่เป็นโมเดลแบบ dense หลายราย

ความเสี่ยงและความจำเป็นในการตรวจสอบโดยอิสระ

การขาดการตรวจสอบจากบุคคลที่สามเป็นข้อควรระวังที่สำคัญที่สุด เนื่องจากเกณฑ์การทดสอบ (benchmarks) สามารถถูกปรับแต่ง, พรอมต์สามารถถูกทำให้เหมาะสมที่สุด หรือชุดทดสอบสามารถถูกคัดกรองเพื่อเอื้อประโยชน์ต่อสถาปัตยกรรมบางประเภทได้ หากไม่มีการทำซ้ำโดยหน่วยงานภายนอก คำกล่าวที่ว่า Qwen3.8-Max "เหนือกว่า" GPT-5.6 จึงยังเป็นเพียงข้อสรุปชั่วคราว นอกจากนี้ โมเดลแบบ MoE อาจแสดงประสิทธิภาพที่ไม่สม่ำเสมอ โดยโทเคนบางตัวอาจถูกส่งไปยังผู้เชี่ยวชาญที่ยังไม่ได้รับการฝึกฝนมาดีพอ ซึ่งนำไปสู่การเกิดอาการหลอน (hallucinations) หรือผลลัพธ์ที่ไม่สอดคล้องกันเป็นครั้งคราว ซึ่งเป็นประเด็นสำคัญเมื่อคาดหวังให้ AI เข้าไปแก้ไขระบบที่ใช้งานจริง (production systems)

สิ่งที่ต้องจับตามองต่อไป

  • การทดสอบซ้ำโดยอิสระ – นักวิจัยและลูกค้าคลาวด์มีแนวโน้มที่จะรันชุดทดสอบ OSWorld-Verified และ HumanEval-Plus แบบเดียวกันบนฮาร์ดแวร์ที่เปิดให้ใช้งานทั่วไป
  • ราคาและความหน่วง (latency) – ราคา API ของ Alibaba Cloud จะเป็นตัวบ่งชี้ว่าการประหยัดพลังงานประมวลผล 40% นั้น จะเปลี่ยนเป็นความได้เปรียบด้านต้นทุนที่จับต้องได้สำหรับนักพัฒนาหรือไม่
  • เครื่องมือเพื่อความปลอดภัย – เมื่อเอเจนต์อัตโนมัติได้รับอำนาจในการควบคุมโครงสร้างพื้นฐานมากขึ้น ระบบนิเวศจำเป็นต้องมีกลไกการตรวจสอบ (monitoring), การย้อนกลับ (rollback) และการตรวจสอบย้อนหลัง (audit) ซึ่งปัจจุบันยังอยู่ในช่วงเริ่มต้น

หาก Qwen3.8-Max สามารถทำได้ตามตัวเลขที่ประกาศไว้ ช่องว่างระหว่างผู้ช่วยสนทนาและบอทวิศวกรรมที่ทำงานได้ด้วยตัวเองจะลดลงอย่างมหาศาล ในอีกไม่กี่เดือนข้างหน้า เราจะได้เห็นว่าประสิทธิภาพของโมเดลจะผ่านการตรวจสอบอย่างเข้มงวดได้หรือไม่ และองค์กรต่างๆ จะนำมันมาใช้เป็นกระดูกสันหลังของกระบวนการพัฒนาแบบอัตโนมัติ (automated development pipelines) หรือไม่