Alibaba เปิดตัว Qwen3.8-Max: ยักษ์ใหญ่พารามิเตอร์ 2.4 ล้านล้านสำหรับ AI Agents

ทีม Qwen ของ Alibaba ได้ประกาศเปิดตัว Qwen3.8-Max โมเดลเรือธงขนาดมหึมาที่มีพารามิเตอร์ถึง 2.4 ล้านล้านตัว ซึ่งได้รับการออกแบบมาเพื่อก้าวข้ามการตอบโต้ผ่านแชทแบบธรรมดา ไปสู่การใช้เหตุผลแบบอัตโนมัติในระยะยาว (long-horizon autonomous reasoning) ด้วยการมุ่งเน้นไปที่เวิร์กโฟลว์ที่กินเวลาหลายวันและการปฏิบัติงานที่ซับซ้อน โมเดลนี้จึงถือเป็นการเปลี่ยนแปลงครั้งสำคัญจาก LLM แบบตอบสนอง (reactive) ไปสู่ AI agents แบบเชิงรุก (proactive)

การขยายพารามิเตอร์เพื่อความฉลาดแบบอัตโนมัติ

Qwen3.8-Max คือขุมพลังทางเทคนิคที่ใช้พารามิเตอร์รวมทั้งหมด 2.4 ล้านล้านตัว โดยมีพารามิเตอร์ที่ทำงานจริง (active parameters) 95 พันล้านตัวต่อการสอบถามหนึ่งครั้ง โมเดลนี้ต่อยอดมาจากสถาปัตยกรรม Qwen3.5 และได้รับการปรับแต่งมาเป็นพิเศษสำหรับงานแบบ "long-horizon" หรือเป้าหมายที่ซับซ้อนซึ่งต้องการให้ AI ทำงานได้อย่างอิสระต่อเนื่องเป็นเวลาหลายวันหรือแม้แต่หลายสัปดาห์

ในความเคลื่อนไหวครั้งสำคัญสำหรับชุมชนโอเพนซอร์ส Alibaba ได้ยืนยันว่าน้ำหนักของโมเดล (weights) ในตระกูล Qwen-Max จะถูกเปิดเผยต่อสาธารณะในสัปดาห์หน้า ซึ่งถือเป็นการท้าทายการครอบงำของโมเดลระดับแนวหน้า (frontier models) ที่เป็นระบบปิดอย่าง GPT และ Claude

พิสูจน์ความสามารถในการทำงานอัตโนมัติผ่านการเขียนโค้ดและการวิจัย

เพื่อแสดงให้เห็นถึงความสามารถในฐานะเอเจนต์ (agentic capabilities) Alibaba ได้นำเสนอกรณีศึกษาที่มีความสำคัญสูงหลายกรณี ซึ่งโมเดลสามารถทำงานได้โดยไม่ต้องมีการแทรกแซงจากมนุษย์:

  • วิศวกรรมซอฟต์แวร์: ในช่วงระยะเวลา 16 วัน Qwen3.8-Max ได้พัฒนาเครื่องมือ command-line oh-my-cli ด้วยตัวเองอย่างเป็นอิสระ โดยมันสามารถจัดการ GitHub issues ของตัวเอง เขียนโค้ด รันการทดสอบ รวมถึงดำเนินการ 265 commits และ 127 pull requests
  • การทำซ้ำผลงานทางวิทยาศาสตร์: เมื่อได้รับมอบหมายให้ทำซ้ำผลลัพธ์จากงานวิจัย "Unified Data Selection for LLM Reasoning" โมเดลได้ใช้เวลาประมวลผล 125 ชั่วโมงในการเขียนโค้ด 7,600 บรรทัด ซึ่งไม่เพียงแต่สามารถทำซ้ำงานวิจัยต้นฉบับได้เท่านั้น แต่ยังช่วยเพิ่มคะแนน AIME24 math benchmark ได้อีก 2.7 คะแนน
  • วิทยาศาสตร์ข้อมูลเชิงแข่งขัน: ในการแข่งขัน WWW2025 Multimodal Dialogue Intent Recognition Challenge โมเดลสามารถทำผลงานได้ดีกว่าทีมมนุษย์ถึง 458 จาก 526 ทีม โดยเพิ่มความแม่นยำจาก 0.60 เป็น 0.853 ภายในเวลาเพียง 24 ชั่วโมง

เหนือกว่าซอฟต์แวร์: การออกแบบชิปและการจำลองสถานการณ์ทางการเงิน

ความสามารถในการใช้เหตุผลของ Qwen3.8-Max ครอบคลุมไปถึงด้านฮาร์ดแวร์และเศรษฐศาสตร์ ในงานออกแบบวงจรเข้ารหัส (cryptographic circuit design) โมเดลสามารถลดขนาดการออกแบบที่ "เทอะทะ" จาก 8,298 logic gates ให้เหลือเพียง 678 gates ผ่านการปรับปรุงซ้ำๆ และเมื่อใช้เครื่องมือ OpenROAD ผลลัพธ์ที่ได้คือการลดพื้นที่ทางกายภาพของชิปลงถึง 81%

ในการจำลองธุรกิจค้าปลีกที่ซับซ้อนที่เรียกว่า E-Commerce-Bench โมเดลได้บริหารจัดการร้านค้าออนไลน์หลายแห่งผ่านปีงบประมาณจำลอง โดยเริ่มจากเงิน 100,000 หยวน โมเดลสามารถดำเนินการเจรจากับซัพพลายเออร์ ระบุตัวมิจฉาชีพได้ 152 ราย และจัดการกับปัญหาการหยุดชะงักของห่วงโซ่อุปทาน จนสามารถปิดยอดด้วยเงิน 416,252 หยวน ซึ่งคิดเป็นสี่เท่าของเงินทุนเริ่มต้น และทำผลงานได้เหนือกว่าอันดับสองอย่าง GLM 5.2 อย่างมีนัยสำคัญ

พรมแดนแห่ง Multimodal และการครองความเป็นเจ้าแห่ง Benchmark

โมเดลนี้ยังขยายขอบเขตของการประมวลผลแบบ multimodal โดยสามารถจัดการกับเอกสารที่มีความยาวถึง 200 หน้า และวิดีโอที่มีความยาวเกิน 100 ชั่วโมง นอกจากนี้ Alibaba ยังได้เปิดตัว RecreationBench ซึ่งเป็น benchmark ที่ทดสอบความสามารถของเอเจนต์ในการสร้างแอปพลิเคชันที่กำลังทำงานอยู่ขึ้นมาใหม่ (บน Windows, macOS, Android และอื่นๆ) โดยอาศัยเพียงการโต้ตอบผ่านภาพและคีย์บอร์ดเท่านั้น โดยไม่ต้องเข้าถึงซอร์สโค้ด

จากผลการทดสอบภายใน Qwen3.8-Max สามารถแข่งขันกับโมเดลระดับท็อปได้อย่างสูสี โดยทำคะแนนได้ใกล้เคียงหรือสูงกว่า Claude Opus 4.8 และ GPT-5.6 Sol ในหลายหมวดหมู่ รวมถึงทำคะแนนนำใน PaperBench ด้วยคะแนน 93

สรุปประเด็นสำคัญ

  • ขนาดมหึมา: Qwen3.8-Max มีพารามิเตอร์รวม 2.4 ล้านล้านตัว และมีพารามิเตอร์ที่ทำงานจริง 95 พันล้านตัว โดยได้รับการปรับแต่งมาเพื่อเวิร์กโฟลว์อัตโนมัติที่กินเวลาหลายวัน
  • ความเชี่ยวชาญในฐานะเอเจนต์: โมเดลได้แสดงให้เห็นถึงความสามารถในการจัดการงานวิศวกรรมซอฟต์แวร์ที่ซับซ้อน การเพิ่มประสิทธิภาพการออกแบบชิป และการบริหารจัดการทางการเงินเต็มรูปแบบได้อย่างเป็นอิสระ
  • ผลกระทบจากการเปิดน้ำหนักโมเดล (Open-Weight): ต่างจากโมเดลระดับแนวหน้าหลายรุ่น Alibaba วางแผนที่จะปล่อยน้ำหนักของโมเดลในตระกูล Qwen-Max ซึ่งจะช่วยให้นักพัฒนาสามารถเข้าถึงความฉลาดระดับเอเจนต์ขั้นสูงได้อย่างที่ไม่เคยมีมาก่อน