Alibaba เปิดตัว Qwen3.8-Max ซึ่งเป็นโมเดลแบบ Mixture-of-Experts (MoE) ที่มีพารามิเตอร์ถึง 2.4 ล้านล้านพารามิเตอร์ โดยทำคะแนนความสำเร็จได้ถึง 86.1% ในการทดสอบ OSWorld-Verified ซึ่ง Alibaba ระบุว่าคะแนนนี้เหนือกว่า GPT-5.6, Sol Max และ Fable 5 การทดสอบนี้เป็นการวัดความสามารถของ AI ในการโต้ตอบกับระบบปฏิบัติการ การติดตั้งซอฟต์แวร์ และการดีบั๊กโค้ด ซึ่งเป็นชุดทักษะที่เป็นรากฐานสำคัญสำหรับเอเจนต์วิศวกรรมซอฟต์แวร์แบบอัตโนมัติ (autonomous software-engineering agents)
การแข่งขันสู่ยุคเอเจนต์อัตโนมัติ
โมเดลภาษาขนาดใหญ่ (Large language models) ได้เปลี่ยนผ่านจากผู้ช่วยในรูปแบบการแชท ไปสู่เครื่องมือที่สามารถเขียน ทดสอบ และแม้กระทั่งติดตั้ง (deploy) โค้ดได้ บริษัทที่สามารถส่งต่องานวิศวกรรมประจำวันให้แก่ AI ได้อย่างน่าเชื่อถือ จะสามารถลดต้นทุนด้านบุคลากรและเร่งวงจรการพัฒนาผลิตภัณฑ์ให้เร็วขึ้น การทดสอบ OSWorld-Verified ได้กลายเป็นมาตรฐานวัดความสามารถด้าน "agentic" โดยปริยาย เนื่องจากต้องใช้มากกว่าแค่การสร้างข้อความแบบคงที่ แต่ต้องอาศัยการโต้ตอบกับระบบในโลกแห่งความเป็นจริง
สิ่งที่ Qwen3.8-Max นำเสนอ
- สถาปัตยกรรม MoE พร้อมพารามิเตอร์ 2.4 ล้านล้านตัว – สามารถเรียกใช้เครือข่ายย่อยผู้เชี่ยวชาญ (expert sub-networks) ได้สูงสุดถึง 64 เครือข่ายต่อหนึ่งโทเคน ซึ่งเป็นดีไซน์ที่ Alibaba อ้างว่าช่วยลดค่าใช้จ่ายในการประมวลผลลงได้ประมาณ 40%
- การจัดการพรอมต์แบบ Multimodal – โมเดลสามารถรับทั้งข้อความ รูปภาพ และข้อมูลที่มีโครงสร้าง (structured data) ได้พร้อมกัน ช่วยให้การส่งคำสั่งเพียงครั้งเดียวสามารถอธิบาย UI แสดงภาพหน้าจอ และส่งไฟล์กำหนดค่า (configuration files) ไปพร้อมกันได้
- หน้าต่างบริบท (context window) ขนาด 64k โทเคน – มีพื้นที่เพียงพอสำหรับฐานโค้ด (codebases) ทั้งหมด ไฟล์ล็อก (log files) หรือรายงานทางเทคนิคที่มีความยาว โดยไม่ต้องแบ่งย่อยเป็นส่วนๆ
ฟีเจอร์เหล่านี้มุ่งเป้าไปที่เวิร์กโฟลว์แบบ "end-to-end" ที่ทีมซอฟต์แวร์ต้องใช้เวลาหลายชั่วโมง เช่น การดึง dependencies, การสแกนล็อก, การแก้ไขบั๊ก และการสร้างเอกสารประกอบ
เจาะลึกตัวเลขสถิติ
| งาน | ตัวชี้วัดที่รายงาน |
|---|---|
| OSWorld-Verified (การโต้ตอบกับ OS แบบ agentic) | สำเร็จ 86.1% |
| การสร้างโค้ด (HumanEval-Plus) | ผ่าน 78.4% |
| การใช้เหตุผลแบบ Multimodal (MM-Bench) | 84.3% |
| การสรุปความบริบทระยะยาว (การทดสอบ 50k โทเคน) | 90.2% |
ตัวเลขทั้งหมดมาจากการทดสอบภายในของ Alibaba หากผลลัพธ์เหล่านี้เป็นจริง โมเดลนี้จะช่วยให้องค์กรต่างๆ มี API เพียงตัวเดียวที่สามารถจัดการทั้งโค้ด รูปภาพ และเอกสารขนาดใหญ่ได้ ในขณะที่ยังรักษาต้นทุนการประมวลผล (inference costs) ให้ต่ำกว่าคู่แข่งที่เป็นโมเดลแบบ dense หลายราย
ความเสี่ยงและความจำเป็นในการตรวจสอบโดยอิสระ
การขาดการตรวจสอบจากบุคคลที่สามเป็นข้อควรระวังที่สำคัญที่สุด เนื่องจากเกณฑ์การทดสอบ (benchmarks) สามารถถูกปรับแต่ง, พรอมต์สามารถถูกทำให้เหมาะสมที่สุด หรือชุดทดสอบสามารถถูกคัดกรองเพื่อเอื้อประโยชน์ต่อสถาปัตยกรรมบางประเภทได้ หากไม่มีการทำซ้ำโดยหน่วยงานภายนอก คำกล่าวที่ว่า Qwen3.8-Max "เหนือกว่า" GPT-5.6 จึงยังเป็นเพียงข้อสรุปชั่วคราว นอกจากนี้ โมเดลแบบ MoE อาจแสดงประสิทธิภาพที่ไม่สม่ำเสมอ โดยโทเคนบางตัวอาจถูกส่งไปยังผู้เชี่ยวชาญที่ยังไม่ได้รับการฝึกฝนมาดีพอ ซึ่งนำไปสู่การเกิดอาการหลอน (hallucinations) หรือผลลัพธ์ที่ไม่สอดคล้องกันเป็นครั้งคราว ซึ่งเป็นประเด็นสำคัญเมื่อคาดหวังให้ AI เข้าไปแก้ไขระบบที่ใช้งานจริง (production systems)
สิ่งที่ต้องจับตามองต่อไป
- การทดสอบซ้ำโดยอิสระ – นักวิจัยและลูกค้าคลาวด์มีแนวโน้มที่จะรันชุดทดสอบ OSWorld-Verified และ HumanEval-Plus แบบเดียวกันบนฮาร์ดแวร์ที่เปิดให้ใช้งานทั่วไป
- ราคาและความหน่วง (latency) – ราคา API ของ Alibaba Cloud จะเป็นตัวบ่งชี้ว่าการประหยัดพลังงานประมวลผล 40% นั้น จะเปลี่ยนเป็นความได้เปรียบด้านต้นทุนที่จับต้องได้สำหรับนักพัฒนาหรือไม่
- เครื่องมือเพื่อความปลอดภัย – เมื่อเอเจนต์อัตโนมัติได้รับอำนาจในการควบคุมโครงสร้างพื้นฐานมากขึ้น ระบบนิเวศจำเป็นต้องมีกลไกการตรวจสอบ (monitoring), การย้อนกลับ (rollback) และการตรวจสอบย้อนหลัง (audit) ซึ่งปัจจุบันยังอยู่ในช่วงเริ่มต้น
หาก Qwen3.8-Max สามารถทำได้ตามตัวเลขที่ประกาศไว้ ช่องว่างระหว่างผู้ช่วยสนทนาและบอทวิศวกรรมที่ทำงานได้ด้วยตัวเองจะลดลงอย่างมหาศาล ในอีกไม่กี่เดือนข้างหน้า เราจะได้เห็นว่าประสิทธิภาพของโมเดลจะผ่านการตรวจสอบอย่างเข้มงวดได้หรือไม่ และองค์กรต่างๆ จะนำมันมาใช้เป็นกระดูกสันหลังของกระบวนการพัฒนาแบบอัตโนมัติ (automated development pipelines) หรือไม่
