DeepMind verwandelt 7.500 synthetische Clips in ein Multi-Task-Vision-Modell mit 14 Mrd. Parametern
Das auf Alibabas Wan2.1-Architektur basierende Modell lernt Tiefe, Normalen, Segmentierung und 3D-Posen aus einem winzigen, mit Blender gerenderten Datensatz und erreicht oder übertrifft spezialisierte Systeme, während es nur einen Bruchteil der Trainingsdaten benötigt.