Google DeepMind, కేవలం 7,500 సింథటిక్ వీడియోలను ఉపయోగించి, ఒక టెక్స్ట్-టు-వీడియో జనరేటర్ను వివిధ రకాల విజన్ టాస్క్ల కోసం ఒకే ఫౌండేషన్ మోడల్గా మార్చే GenCeption అనే మోడల్ను ప్రకటించింది. దీని వెనుక ఉన్న వాదన సరళమైనది: వస్తువులు ఎలా కదులుతాయి మరియు పరస్పరం ఎలా స్పందిస్తాయో ఇప్పటికే తెలిసిన వీడియో జనరేటర్ను, ప్రతి దాని కోసం విడివిడిగా నెట్వర్క్లను నిర్మించకుండానే డెప్త్ (depth), సర్ఫేస్ నార్మల్స్ (surface normals), సెగ్మెంటేషన్ మాస్క్లు (segmentation masks) మరియు 3D పోజ్ (3D pose)లను అంచనా వేయడానికి ఉపయోగించవచ్చు.
విడివిడి విజన్ పైప్లైన్ల నుండి ఏకీకృత మోడల్కు
లార్జ్ లాంగ్వేజ్ మోడల్స్ తదుపరి పదాన్ని అంచనా వేయడం నేర్చుకోవడం ద్వారా బహుముఖ ప్రజ్ఞను సాధించాయి. దీనికి విరుద్ధంగా, కంప్యూటర్-విజన్ పరిశోధనలు ఇప్పటికీ స్పెషలిస్ట్ సిస్టమ్స్పై ఆధారపడుతున్నాయి—సెగ్మెంటేషన్ కోసం ఒకటి, డెప్త్ కోసం మరొకటి, పోజ్ కోసం ఇంకొకటి. GenCeption ఈ పద్ధతిని అధిగమిస్తుంది. ఒక టెక్స్ట్ ప్రాంప్ట్ ద్వారా మోడల్ ఏ అవుట్పుట్ను ఉత్పత్తి చేయాలో చెప్పవచ్చు, మరియు అదే 14-బిలియన్ పారామీటర్ ఆర్కిటెక్చర్ డెప్త్ మ్యాప్లు, నార్మల్ మ్యాప్లు, సెగ్మెంటేషన్ మాస్క్లు లేదా కీపాయింట్ ప్రిడిక్షన్లను అందిస్తుంది. ప్రతి అవుట్పుట్ను ఒక ప్రామాణిక త్రీ-ఛానల్ RGB ఇమేజ్గా పరిగణించడం ద్వారా, ఈ సిస్టమ్ పైప్లైన్ను ఏకరీతిగా ఉంచుతుంది; సహజంగా ఇమేజ్లను ఉత్పత్తి చేయని టాస్క్ల కోసం, పరిశోధకులు చిన్న ట్రైనబుల్ మాడ్యూల్స్ను జోడించారు.
అతి తక్కువ సింథటిక్ కార్పస్ పై శిక్షణ
ఈ బృందం Blenderలో ఒక సింథటిక్ డేటాసెట్ను రూపొందించింది, ఇందులో 200 మోషన్-క్యాప్చర్ సీక్వెన్సుల ద్వారా నడపబడే 800 డిజిటల్ హ్యూమన్ మోడల్స్ నుండి 7,500 చిన్న వీడియోలను రెండర్ చేశారు. D4RT లేదా VGGT Omega వంటి సాంప్రదాయ వీడియో-జనరేషన్ మోడల్స్ మిలియన్ల కొద్దీ క్లిప్లపై శిక్షణ పొందుతాయి; GenCeption ఆ డేటాలో ఏడు వంతు నుండి ఐదు వందల వంతు మాత్రమే ఉపయోగించుకుంటూ, దానికి సమానమైన లేదా అంతకంటే మెరుగైన పనితీరును సాధించింది. నివేదించబడిన బెంచ్మార్క్లలో ఇవి ఉన్నాయి:
- DepthAnything 3 వంటి ప్రత్యేక మోడల్లతో సమానమైన డెప్త్ ఎస్టిమేషన్ (Depth estimation).
- NormalCrafter మరియు Lotus-2 కంటే మెరుగైన సర్ఫేస్-నార్మల్ ప్రిడిక్షన్ (Surface-normal prediction).
- Genmo మరియు TRAM కంటే మెరుగైన 3D పోజ్ రికగ్నిషన్ (3D pose recognition).
- Meta’s SAM 3 మరియు Gemini 3.5 Flash యొక్క సంయుక్త శక్తికి సరిసమానమైన లాంగ్వేజ్-గైడెడ్ సెగ్మెంటేషన్ (Language-guided segmentation).
జనరేటివ్ ఆబ్జెక్టివ్ అనేది నెట్వర్క్ను సీన్ జియోమెట్రీ మరియు ఫిజిక్స్ను అంతర్గతంగా అర్థం చేసుకునేలా ప్రేరేపిస్తుందని, ఇది తదుపరి పర్సెప్షన్ టాస్క్లకు ఉపయోగపడుతుందని రచయితలు చెబుతున్నారు.
వేగం కోసం ఆర్కిటెక్చరల్ షార్ట్కట్లు
GenCeption, Alibaba యొక్క ఓపెన్-సోర్స్ Wan2.1 వీడియో మోడల్పై ఆధారపడి నిర్మించబడింది. అనేక ఇటరేషన్ల ద్వారా ఫ్రేమ్లను మెరుగుపరిచే సాధారణ డిఫ్యూజన్ ప్రాసెస్ (diffusion process)కు బదులుగా, పరిశోధకులు సింగిల్ ఫార్వర్డ్ పాస్లో ప్రిడిక్షన్ను విడుదల చేసేలా సిస్టమ్ను రీ-ఇంజనీర్ చేశారు. ఫలితం: ఈ మోడల్ ప్రస్తుత హార్డ్వేర్పై 81-ఫ్రేమ్ క్లిప్ను సుమారు పది సెకన్లలో ప్రాసెస్ చేస్తుంది. 14-బిలియన్ పారామీటర్ల పరిమాణం పెద్దదే అయినప్పటికీ, శిక్షణలో కలిగే ఆదా మరియు బహుళ టాస్క్-స్పెసిఫిక్ నెట్వర్క్ల తొలగింపు గణనీయమైన సామర్థ్యాన్ని అందిస్తాయి.
AI కమ్యూనిటీ ఎందుకు గమనించాలి
ఒక వీడియో జనరేటర్ "వరల్డ్ మోడల్" (world model)—అంటే వస్తువులు స్థలాన్ని ఎలా ఆక్రమిస్తాయి మరియు కాలక్రమేణా ఎలా కదులుతాయో ప్రతిబింబించే రూపం—గా కూడా పనిచేయగలిగితే, విజువల్ AIలో తదుపరి అడుగు అనేది భారీ డేటాసెట్లను అనోటేట్ చేయడం కంటే, జనరేటివ్ సామర్థ్యాలను పెంచడం ద్వారా రావచ్చు. ఒకే ప్రాంప్ట్-డ్రివెన్ మోడల్ ప్రొడక్ట్ పైప్లైన్లను సరళతరం చేయగలదు, ఇంజనీరింగ్ ఖర్చులను తగ్గించగలదు మరియు విజన్ ఫీచర్లు కావాలి కానీ బహుళ స్పెషలిస్ట్ నెట్వర్క్లను శిక్షణ ఇచ్చే వనరులు లేని డెవలపర్లకు అడ్డంకులను తొలగించగలదు.
పరిమితులు మరియు పరిష్కరించని ప్రశ్నలు
ఈ పనితీరు గణాంకాలు సింథటిక్ డేటా మరియు బెంచ్మార్క్ సూట్ల నుండి వచ్చాయి, ఇవి నిజ ప్రపంచ ఫుటేజీలోని క్లిష్టతను ప్రతిబింబించకపోవచ్చు. నియంత్రణ లేని లైటింగ్, వాతావరణం లేదా కెమెరా కదలికలకు దీని జనరలైజేషన్ ఇంకా నిరూపించబడలేదు. 81-ఫ్రేమ్ క్లిప్ కోసం పది సెకన్ల ఇన్ఫరెన్స్ (inference), ఇటరేటివ్ డిఫ్యూజన్ కంటే వేగంగా ఉన్నప్పటికీ, రోబోటిక్స్ లేదా AR కోసం రియల్-టైమ్ స్థాయికి ఇంకా చాలా దూరంగా ఉంది. అంతేకాకుండా, మోడల్ యొక్క 14-బిలియన్ పారామీటర్లు విస్తరణ (deployment) కోసం గణనీయమైన కంప్యూట్ బడ్జెట్ను కోరుతాయి, ఇది భారీ నిధులు ఉన్న ల్యాబ్ల వెలుపల దీని అందుబాటును పరిమితం చేయవచ్చు.
తదుపరి ఏమి గమనించాలి
- రియల్-వరల్డ్ వాలిడేషన్: అవుట్డోర్ డ్రైవింగ్ వీడియోలు, హ్యాండ్హెల్డ్ ఫోన్ ఫుటేజ్ లేదా పారిశ్రామిక తనిఖీ దృశ్యాలపై GenCeptionను పరీక్షించే అధ్యయనాలు.
- మోడల్ స్కేలింగ్: డేటా-ఎఫిషియన్సీని కాపాడుతూనే, పెద్ద లేదా మరింత సమర్థవంతంగా శిక్షణ పొందిన వెర్షన్లు లేటెన్సీ గ్యాప్ను తగ్గించగలవా అనేది.
- ఇంటిగ్రేషన్ మార్గాలు: క్లౌడ్ ప్రొవైడర్లు లేదా ఎడ్జ్-AI ప్లాట్ఫారమ్లు టెక్స్ట్వల్ టాస్క్ డిస్క్రిప్షన్ను స్వీకరించి తగిన విజువల్ అవుట్పుట్ను ఇచ్చేలా ఒకే APIని ఎలా ప్రవేశపెట్టవచ్చు.
- ప్రత్యామ్నాయ శిక్షణ వనరులు: దృఢత్వాన్ని (robustness) మెరుగుపరచడానికి సింథటిక్ క్లిప్లను తక్కువ మొత్తంలో నిజమైన వీడియోలతో కలిపే ప్రయత్నాలు.
సారాంశం
GenCeption ఒక వీడియో-జనరేషన్ ఇంజిన్, మల్టీ-టాస్క్ విజన్ ఫౌండేషన్ మోడల్గా కూడా పనిచేయగలదని చూపుతోంది. ఇది సాంప్రదాయ పద్ధతుల కంటే అనేక రెట్లు తక్కువ పరిమాణం ఉన్న డేటాసెట్ నుండి నేర్చుకుంటూనే, అత్యాధునిక డెప్త్, నార్మల్స్, పోజ్ మరియు సెగ్మెంటేషన్ను అందిస్తుంది. అనేక రకాల ప్రత్యేక నెట్వర్క్లను ఒకే ప్రాంప్ట్-డ్రివెన్ సిస్టమ్గా మార్చడం దీని ప్రత్యేకత; సింథటిక్ ల్యాబ్ల నుండి బయట ఉన్న అనిశ్చిత ప్రపంచానికి ఈ సాంకేతికత మారినప్పుడు, ఆ వాగ్దానం నిలుస్తుందా లేదా అనేది దీని తదుపరి పరీక్ష.
