DeepMind ने 7,500 सिंथेटिक क्लिप्स को 14B-पैरामीटर वाले मल्टी-टास्क विजन मॉडल में बदल दिया
अलीबाबा के Wan2.1 आर्किटेक्चर पर आधारित यह मॉडल, ब्लेंडर-रेंडर किए गए एक छोटे से डेटासेट से गहराई (depth), नॉर्मल्स, सेगमेंटेशन और 3D पोज़ सीखता है। यह प्रशिक्षण डेटा के बहुत कम हिस्से का उपयोग करते हुए भी विशेषज्ञ प्रणालियों के बराबर या उनसे बेहतर प्रदर्शन करता है।