DeepMind trasforma 7.500 clip sintetiche in un modello di visione multi-task da 14 miliardi di parametri
Il modello, basato sull'architettura Wan2.1 di Alibaba, apprende profondità, normali, segmentazione e posa 3D da un esiguo dataset renderizzato con Blender, eguagliando o superando i sistemi specialistici pur richiedendo solo una frazione dei dati di addestramento.