DeepMind przekształca 7500 syntetycznych klipów w 14-miliardowy wielozadaniowy model wizyjny
Model oparty na architekturze Wan2.1 od Alibaba uczy się głębi, wektorów normalnych, segmentacji i pozy 3D na podstawie niewielkiego zbioru danych wyrenderowanych w Blenderze, dorównując lub przewyższając systemy specjalistyczne przy użyciu zaledwie ułamka danych treningowych.