DeepMind transforma 7.500 clipes sintéticos em um modelo de visão multitarefa de 14B de parâmetros
O modelo, construído com base na arquitetura Wan2.1 da Alibaba, aprende profundidade, normais, segmentação e pose 3D a partir de um conjunto de dados minúsculo renderizado no Blender, igualando ou superando sistemas especializados ao exigir apenas uma fração dos dados de treinamento.