Google DeepMind, కేవలం 7,500 సింథటిక్ వీడియోలను ఉపయోగించి, ఒక టెక్స్ట్-టు-వీడియో జనరేటర్‌ను వివిధ రకాల విజన్ టాస్క్‌ల కోసం ఒకే ఫౌండేషన్ మోడల్‌గా మార్చే GenCeption అనే మోడల్‌ను ప్రకటించింది. దీని వెనుక ఉన్న వాదన సరళమైనది: వస్తువులు ఎలా కదులుతాయి మరియు పరస్పరం ఎలా స్పందిస్తాయో ఇప్పటికే తెలిసిన వీడియో జనరేటర్‌ను, ప్రతి దాని కోసం విడివిడిగా నెట్‌వర్క్‌లను నిర్మించకుండానే డెప్త్ (depth), సర్ఫేస్ నార్మల్స్ (surface normals), సెగ్మెంటేషన్ మాస్క్‌లు (segmentation masks) మరియు 3D పోజ్ (3D pose)లను అంచనా వేయడానికి ఉపయోగించవచ్చు.

విడివిడి విజన్ పైప్‌లైన్‌ల నుండి ఏకీకృత మోడల్‌కు

లార్జ్ లాంగ్వేజ్ మోడల్స్ తదుపరి పదాన్ని అంచనా వేయడం నేర్చుకోవడం ద్వారా బహుముఖ ప్రజ్ఞను సాధించాయి. దీనికి విరుద్ధంగా, కంప్యూటర్-విజన్ పరిశోధనలు ఇప్పటికీ స్పెషలిస్ట్ సిస్టమ్స్‌పై ఆధారపడుతున్నాయి—సెగ్మెంటేషన్ కోసం ఒకటి, డెప్త్ కోసం మరొకటి, పోజ్ కోసం ఇంకొకటి. GenCeption ఈ పద్ధతిని అధిగమిస్తుంది. ఒక టెక్స్ట్ ప్రాంప్ట్ ద్వారా మోడల్ ఏ అవుట్‌పుట్‌ను ఉత్పత్తి చేయాలో చెప్పవచ్చు, మరియు అదే 14-బిలియన్ పారామీటర్ ఆర్కిటెక్చర్ డెప్త్ మ్యాప్‌లు, నార్మల్ మ్యాప్‌లు, సెగ్మెంటేషన్ మాస్క్‌లు లేదా కీపాయింట్ ప్రిడిక్షన్‌లను అందిస్తుంది. ప్రతి అవుట్‌పుట్‌ను ఒక ప్రామాణిక త్రీ-ఛానల్ RGB ఇమేజ్‌గా పరిగణించడం ద్వారా, ఈ సిస్టమ్ పైప్‌లైన్‌ను ఏకరీతిగా ఉంచుతుంది; సహజంగా ఇమేజ్‌లను ఉత్పత్తి చేయని టాస్క్‌ల కోసం, పరిశోధకులు చిన్న ట్రైనబుల్ మాడ్యూల్స్‌ను జోడించారు.

అతి తక్కువ సింథటిక్ కార్పస్ పై శిక్షణ

ఈ బృందం Blenderలో ఒక సింథటిక్ డేటాసెట్‌ను రూపొందించింది, ఇందులో 200 మోషన్-క్యాప్చర్ సీక్వెన్సుల ద్వారా నడపబడే 800 డిజిటల్ హ్యూమన్ మోడల్స్ నుండి 7,500 చిన్న వీడియోలను రెండర్ చేశారు. D4RT లేదా VGGT Omega వంటి సాంప్రదాయ వీడియో-జనరేషన్ మోడల్స్ మిలియన్ల కొద్దీ క్లిప్‌లపై శిక్షణ పొందుతాయి; GenCeption ఆ డేటాలో ఏడు వంతు నుండి ఐదు వందల వంతు మాత్రమే ఉపయోగించుకుంటూ, దానికి సమానమైన లేదా అంతకంటే మెరుగైన పనితీరును సాధించింది. నివేదించబడిన బెంచ్‌మార్క్‌లలో ఇవి ఉన్నాయి:

  • DepthAnything 3 వంటి ప్రత్యేక మోడల్‌లతో సమానమైన డెప్త్ ఎస్టిమేషన్ (Depth estimation).
  • NormalCrafter మరియు Lotus-2 కంటే మెరుగైన సర్ఫేస్-నార్మల్ ప్రిడిక్షన్ (Surface-normal prediction).
  • Genmo మరియు TRAM కంటే మెరుగైన 3D పోజ్ రికగ్నిషన్ (3D pose recognition).
  • Meta’s SAM 3 మరియు Gemini 3.5 Flash యొక్క సంయుక్త శక్తికి సరిసమానమైన లాంగ్వేజ్-గైడెడ్ సెగ్మెంటేషన్ (Language-guided segmentation).

జనరేటివ్ ఆబ్జెక్టివ్ అనేది నెట్‌వర్క్‌ను సీన్ జియోమెట్రీ మరియు ఫిజిక్స్‌ను అంతర్గతంగా అర్థం చేసుకునేలా ప్రేరేపిస్తుందని, ఇది తదుపరి పర్సెప్షన్ టాస్క్‌లకు ఉపయోగపడుతుందని రచయితలు చెబుతున్నారు.

వేగం కోసం ఆర్కిటెక్చరల్ షార్ట్‌కట్‌లు

GenCeption, Alibaba యొక్క ఓపెన్-సోర్స్ Wan2.1 వీడియో మోడల్‌పై ఆధారపడి నిర్మించబడింది. అనేక ఇటరేషన్ల ద్వారా ఫ్రేమ్‌లను మెరుగుపరిచే సాధారణ డిఫ్యూజన్ ప్రాసెస్ (diffusion process)కు బదులుగా, పరిశోధకులు సింగిల్ ఫార్వర్డ్ పాస్‌లో ప్రిడిక్షన్‌ను విడుదల చేసేలా సిస్టమ్‌ను రీ-ఇంజనీర్ చేశారు. ఫలితం: ఈ మోడల్ ప్రస్తుత హార్డ్‌వేర్‌పై 81-ఫ్రేమ్ క్లిప్‌ను సుమారు పది సెకన్లలో ప్రాసెస్ చేస్తుంది. 14-బిలియన్ పారామీటర్ల పరిమాణం పెద్దదే అయినప్పటికీ, శిక్షణలో కలిగే ఆదా మరియు బహుళ టాస్క్-స్పెసిఫిక్ నెట్‌వర్క్‌ల తొలగింపు గణనీయమైన సామర్థ్యాన్ని అందిస్తాయి.

AI కమ్యూనిటీ ఎందుకు గమనించాలి

ఒక వీడియో జనరేటర్ "వరల్డ్ మోడల్" (world model)—అంటే వస్తువులు స్థలాన్ని ఎలా ఆక్రమిస్తాయి మరియు కాలక్రమేణా ఎలా కదులుతాయో ప్రతిబింబించే రూపం—గా కూడా పనిచేయగలిగితే, విజువల్ AIలో తదుపరి అడుగు అనేది భారీ డేటాసెట్‌లను అనోటేట్ చేయడం కంటే, జనరేటివ్ సామర్థ్యాలను పెంచడం ద్వారా రావచ్చు. ఒకే ప్రాంప్ట్-డ్రివెన్ మోడల్ ప్రొడక్ట్ పైప్‌లైన్‌లను సరళతరం చేయగలదు, ఇంజనీరింగ్ ఖర్చులను తగ్గించగలదు మరియు విజన్ ఫీచర్లు కావాలి కానీ బహుళ స్పెషలిస్ట్ నెట్‌వర్క్‌లను శిక్షణ ఇచ్చే వనరులు లేని డెవలపర్‌లకు అడ్డంకులను తొలగించగలదు.

పరిమితులు మరియు పరిష్కరించని ప్రశ్నలు

ఈ పనితీరు గణాంకాలు సింథటిక్ డేటా మరియు బెంచ్‌మార్క్ సూట్‌ల నుండి వచ్చాయి, ఇవి నిజ ప్రపంచ ఫుటేజీలోని క్లిష్టతను ప్రతిబింబించకపోవచ్చు. నియంత్రణ లేని లైటింగ్, వాతావరణం లేదా కెమెరా కదలికలకు దీని జనరలైజేషన్ ఇంకా నిరూపించబడలేదు. 81-ఫ్రేమ్ క్లిప్ కోసం పది సెకన్ల ఇన్ఫరెన్స్ (inference), ఇటరేటివ్ డిఫ్యూజన్ కంటే వేగంగా ఉన్నప్పటికీ, రోబోటిక్స్ లేదా AR కోసం రియల్-టైమ్ స్థాయికి ఇంకా చాలా దూరంగా ఉంది. అంతేకాకుండా, మోడల్ యొక్క 14-బిలియన్ పారామీటర్లు విస్తరణ (deployment) కోసం గణనీయమైన కంప్యూట్ బడ్జెట్‌ను కోరుతాయి, ఇది భారీ నిధులు ఉన్న ల్యాబ్‌ల వెలుపల దీని అందుబాటును పరిమితం చేయవచ్చు.

తదుపరి ఏమి గమనించాలి

  • రియల్-వరల్డ్ వాలిడేషన్: అవుట్‌డోర్ డ్రైవింగ్ వీడియోలు, హ్యాండ్‌హెల్డ్ ఫోన్ ఫుటేజ్ లేదా పారిశ్రామిక తనిఖీ దృశ్యాలపై GenCeptionను పరీక్షించే అధ్యయనాలు.
  • మోడల్ స్కేలింగ్: డేటా-ఎఫిషియన్సీని కాపాడుతూనే, పెద్ద లేదా మరింత సమర్థవంతంగా శిక్షణ పొందిన వెర్షన్లు లేటెన్సీ గ్యాప్‌ను తగ్గించగలవా అనేది.
  • ఇంటిగ్రేషన్ మార్గాలు: క్లౌడ్ ప్రొవైడర్లు లేదా ఎడ్జ్-AI ప్లాట్‌ఫారమ్‌లు టెక్స్ట్‌వల్ టాస్క్ డిస్క్రిప్షన్‌ను స్వీకరించి తగిన విజువల్ అవుట్‌పుట్‌ను ఇచ్చేలా ఒకే APIని ఎలా ప్రవేశపెట్టవచ్చు.
  • ప్రత్యామ్నాయ శిక్షణ వనరులు: దృఢత్వాన్ని (robustness) మెరుగుపరచడానికి సింథటిక్ క్లిప్‌లను తక్కువ మొత్తంలో నిజమైన వీడియోలతో కలిపే ప్రయత్నాలు.

సారాంశం

GenCeption ఒక వీడియో-జనరేషన్ ఇంజిన్, మల్టీ-టాస్క్ విజన్ ఫౌండేషన్ మోడల్‌గా కూడా పనిచేయగలదని చూపుతోంది. ఇది సాంప్రదాయ పద్ధతుల కంటే అనేక రెట్లు తక్కువ పరిమాణం ఉన్న డేటాసెట్ నుండి నేర్చుకుంటూనే, అత్యాధునిక డెప్త్, నార్మల్స్, పోజ్ మరియు సెగ్మెంటేషన్‌ను అందిస్తుంది. అనేక రకాల ప్రత్యేక నెట్‌వర్క్‌లను ఒకే ప్రాంప్ట్-డ్రివెన్ సిస్టమ్‌గా మార్చడం దీని ప్రత్యేకత; సింథటిక్ ల్యాబ్‌ల నుండి బయట ఉన్న అనిశ్చిత ప్రపంచానికి ఈ సాంకేతికత మారినప్పుడు, ఆ వాగ్దానం నిలుస్తుందా లేదా అనేది దీని తదుపరి పరీక్ష.