อันดับงานวิจัยบน Hugging Face ในเดือนนี้เผยให้เห็นถึงสาขาที่กำลังเติบโตขึ้นอย่างเห็นได้ชัด ผลงานที่โดดเด่นไม่ใช่แค่เรื่องการขยายจำนวนพารามิเตอร์ให้มากขึ้น แต่เป็นเรื่องของการทำให้โมเดลสามารถมองเห็น จดจำ และทำงานที่เริ่มไว้ให้สำเร็จได้ งานวิจัยทั้งสิบฉบับด้านล่างนี้ครอบคลุมทั้งวิดีโอแบบเรียลไทม์, การรับรู้ของหุ่นยนต์, การทดสอบประสิทธิภาพ (benchmarking) ที่โปร่งใส และการปฏิวัติเงียบในการเปลี่ยนบทบาทของโมเดลสร้างสรรค์ (generators) ให้กลายเป็นครูผู้สอน
วิดีโอแบบเรียลไทม์ที่ใช้งานได้จริง
โมเดลวิดีโอส่วนใหญ่ยังคงมีลักษณะเหมือนการทดลองในห้องแล็บราคาแพง พวกมันต้องใช้เวลาประมวลผลนานหลายนาทีบนฮาร์ดแวร์สเปกสูง และให้ผลลัพธ์เป็นคลิปวิดีโอที่คุณไม่สามารถควบคุมระหว่างการสร้างได้ Vidu S1 เข้ามาเปลี่ยนสมการนี้ โดยมุ่งเน้นไปที่การโต้ตอบแบบเรียลไทม์ ช่วยให้ผู้ใช้สามารถสั่งการตัวละครดิจิทัลด้วยคำสั่งเสียง ในขณะที่โมเดลทำงานบน GPU สำหรับผู้บริโภคทั่วไปผ่านเทคนิคที่เรียกว่า TurboDiffusion
การเปลี่ยนแปลงด้านฮาร์ดแวร์นี้มีความสำคัญ เมื่อโมเดลไม่จำเป็นต้องใช้เครื่องเร่งความเร็ว (accelerators) ระดับท็อปจำนวนมากอีกต่อไป มันจะเปลี่ยนจากแค่ตัวสาธิต (demo) ไปสู่การเป็นโครงสร้างพื้นฐาน ลองนึกถึงอวตารสำหรับการไลฟ์สตรีมที่ตอบโต้กับแชทได้แบบเรียลไทม์ หรือตัวละครฝ่ายบริการลูกค้าที่สามารถสบตาและเปลี่ยนน้ำเสียงได้ตามต้องการ Vidu S1 กำลังชี้ให้เห็นถึงทิศทางของ AI วิดีโอ
