Qwen-Drive-1.0 รวมการรับรู้ (perception) การวางแผน (planning) และภาษา (language) เข้าไว้ในโมเดลเดียว ซึ่งสัญญาว่าจะช่วยให้วิศวกรยานยนต์ไร้คนขับมีโครงสร้างระบบ (stack) ที่สะอาดและเป็นระเบียบมากขึ้น โดยไม่สูญเสียความสามารถในการปฏิบัติตามคำสั่งเสียงหรือข้อความ สถาปัตยกรรมแบบรวมศูนย์นี้อาจช่วยลดความซับซ้อนในการพัฒนา ในขณะที่ยังคงทำให้รถยนต์สามารถตอบคำถามได้ว่า “ทำไมคุณถึงเลี้ยว?” หรือปฏิบัติตามคำสั่ง “ออกทางออกถัดไป”
ทำไมพื้นฐานแบบรวมศูนย์จึงมีความสำคัญ
ซอฟต์แวร์ขับเคลื่อนอัตโนมัติส่วนใหญ่ในปัจจุบันเป็นการนำโมดูลแยกส่วนต่างๆ มาประกอบกัน ได้แก่ ระบบการมองเห็นที่ประมวลผลข้อมูลจากกล้องและ lidar, ตัววางแผนที่ตัดสินใจเรื่องเส้นทาง และส่วนต่อประสานทางภาษาที่จัดการคำสั่งหรือคำอธิบายของผู้ใช้ แต่ละส่วนจะถูกฝึกฝนแยกกัน ดังนั้นส่วนประกอบทางภาษาจึงมักจะเบี่ยงเบนไปเมื่อส่วนการมองเห็นหรือการวางแผนมีอิทธิพลต่อค่าความสูญเสีย (loss) มากกว่า ผลลัพธ์ที่ได้คือยานพาหนะที่สามารถนำทางได้ แต่ล้มเหลวในการทำความเข้าใจหรือสร้างภาษาธรรมชาติได้อย่างน่าเชื่อถือ
Qwen-Drive-1.0 แก้ปัญหาความแตกแยกนี้ด้วยการฝึกฝนโครงสร้างหลัก (backbone) เพียงหนึ่งเดียวในสามงานพร้อมกัน ได้แก่ การรับรู้แบบ 3 มิติ (3-D perception), การตอบคำถามด้วยภาพ (visual question answering หรือ VQA) และการวางแผนการเคลื่อนที่ (motion planning) ด้วยการผสมผสานชุดข้อมูลการขับขี่เข้ากับคลังข้อมูลภาษาและภาพทั่วไป โมเดลจึงยังคงความรู้ทางภาษาไว้ในขณะที่เรียนรู้การมองเห็นและการลงมือทำ "พื้นฐานแบบมัลติโมดัล" (multimodal foundation) นี้สะท้อนถึงแนวโน้มของโมเดลภาษาขนาดใหญ่ (LLM) ที่ทำหน้าที่เป็นฐานสำหรับแอปพลิเคชันปลายทางมากมาย แต่มีการเพิ่มการใช้เหตุผลเชิงพื้นที่ (spatial reasoning) ที่จำเป็นสำหรับการนำทางอย่างปลอดภัยเข้าไปด้วย
โมเดลได้รับการประเมินอย่างไร
นักวิจัยได้ทดสอบโมเดลผ่านทั้งการทดสอบแบบ open-loop และ closed-loop ในสถานการณ์แบบ open-loop ระบบจะประมวลผลกระแสข้อมูลเซนเซอร์ที่บันทึกไว้และสร้างการคาดการณ์โดยไม่ส่งผลกระทบต่อสภาพแวดล้อม ส่วนในการทดสอบแบบ closed-loop ระบบจะควบคุมยานพาหนะจำลองจริงๆ ในการตั้งค่าเหล่านี้ ประสิทธิภาพการวางแผนการเคลื่อนที่ของ Qwen-Drive-1.0 นั้นเทียบเท่ากับโมเดลเฉพาะทางที่มุ่งเน้นด้านการขับขี่เพียงอย่างเดียว ในขณะเดียวกัน ส่วนประกอบ VQA ก็สามารถตอบคำถามเกี่ยวกับฉากที่พบได้ ซึ่งแสดงให้เห็นว่าความสามารถทางภาษายังคงอยู่แม้จะผ่านการฝึกฝนร่วมกัน
อุปสรรคที่ยังคงเหลืออยู่
งานวิจัยปัจจุบันยังไปไม่ถึงการใช้ชุดเซนเซอร์แบบครบวงจร ข้อมูลนำเข้าจาก lidar ความละเอียดสูงและการคาดการณ์ระยะไกล ซึ่งทั้งสองอย่างนี้มีความสำคัญอย่างยิ่งสำหรับการขับขี่บนทางหลวง ยังไม่มีอยู่ในชุดข้อมูลฝึกฝน นอกจากนี้ การรับรู้ยังพึ่งพาชุดข้อมูลที่มีอยู่อย่างจำกัด ซึ่งทำให้เกิดคำถามเกี่ยวกับการปรับใช้ทั่วไป (generalisation) ในสภาพอากาศ แสงสว่าง และสภาพการจราจรที่หลากหลาย จนกว่าโมเดลจะพิสูจน์ตัวเองได้กับกระแสข้อมูลเซนเซอร์ที่มีแบนด์วิดท์สูงในโลกแห่งความเป็นจริง วิศวกรก็อาจจะยังลังเลที่จะนำมาแทนที่ระบบเดิมที่ผ่านการพิสูจน์มาแล้ว
สิ่งที่อาจเปลี่ยนแปลงหากแนวทางนี้ขยายขนาดได้
หากพื้นฐานเพียงหนึ่งเดียวสามารถจัดการโครงสร้างการรับรู้-การวางแผน-ภาษา ได้ทั้งหมด ทีมยานยนต์อาจสามารถละทิ้งการประสานงานที่ซับซ้อนของโมดูลแยกส่วนต่างๆ ได้ สิ่งนี้จะช่วยลดความพยายามในการรวมระบบ ลดความหน่วง (latency) จากการสื่อสารระหว่างโมดูล และทำให้การอัปเดตง่ายขึ้น เช่น สามารถเพิ่มความสามารถทางภาษาใหม่ๆ ได้โดยไม่ต้องฝึกฝนตัววางแผนใหม่ นอกจากนี้ ชุดทดสอบมาตรฐาน (benchmark suites) สำหรับการขับขี่อัตโนมัติก็จำเป็นต้องพัฒนาขึ้นด้วย โดยต้องเพิ่มตัวชี้วัดที่เน้นภาษาเป็นศูนย์กลางควบคู่ไปกับคะแนนด้านความปลอดภัยและประสิทธิภาพแบบดั้งเดิม
มุมมองต่าง: ความเชี่ยวชาญเฉพาะทางยังคงมีที่ทางของมัน
โมเดลเฉพาะทางมีความโดดเด่นเพราะสามารถปรับจูน (fine-tuned) ด้วยข้อมูลเฉพาะทางจำนวนมหาศาลได้ โมเดลแบบรวมศูนย์อาจประสบปัญหาในการทำประสิทธิภาพให้เทียบเท่ากับจุดสูงสุดของเครือข่ายการรับรู้ที่ใช้เฉพาะ lidar หรือตัววางแผนที่ฝึกฝนจากบันทึกการขับขี่หลายพันล้านไมล์ สำหรับฟังก์ชันที่สำคัญต่อความปลอดภัย หน่วยงานกำกับดูแลและผู้ผลิตอาจยังคงต้องการส่วนประกอบเฉพาะทางที่ผ่านการตรวจสอบอย่างเข้มงวด
สิ่งที่ต้องจับตามองต่อไป
การเปิดตัวในอนาคตควรจะแสดงให้เห็นว่า Qwen-Drive-1.0 สามารถรับข้อมูล lidar ความละเอียดสูงและทำการพยากรณ์ระยะยาว (long-horizon forecasting) ได้หรือไม่ การทดสอบบนถนนจริง โดยเฉพาะในสภาพแวดล้อมเมืองที่หลากหลาย จะเป็นบททดสอบสำคัญ (litmus test) สำหรับแนวทางแบบรวมศูนย์นี้ หากการทดสอบเหล่านั้นประสบความสำเร็จ อุตสาหกรรมอาจเห็นการเปลี่ยนผ่านไปสู่พื้นฐานแบบมัลติโมดัลที่ให้ความสำคัญกับภาษาในฐานะองค์ประกอบหลัก (first-class citizen) ของยานยนต์ไร้คนขับ
