DeepMind convierte 7.500 clips sintéticos en un modelo de visión multitarea de 14B parámetros
El modelo, basado en la arquitectura Wan2.1 de Alibaba, aprende profundidad, normales, segmentación y pose 3D a partir de un pequeño conjunto de datos renderizados con Blender, igualando o superando a sistemas especializados con solo una fracción de los datos de entrenamiento.