DeepMind transforme 7 500 clips synthétiques en un modèle de vision multitâche de 14 milliards de paramètres
Le modèle, basé sur l'architecture Wan2.1 d'Alibaba, apprend la profondeur, les normales, la segmentation et la pose 3D à partir d'un minuscule jeu de données rendu avec Blender, égalant ou surpassant des systèmes spécialisés tout en n'ayant besoin que d'une fraction des données d'entraînement.