Wan 3.0 sasa inaweza kuunganisha sekunde themani za video zilizozalishwa na AI bila uso wa mhusika kuyeyuka au kamera kuyumba—hatua kubwa inayovusha video za kutengenezwa (generative video) kutoka kwenye vipande vifupi kuelekea kwenye uundaji wa hadithi unaoweza kutumika.
Mafanikio haya yanategemea mfumo uliounganishwa kwa karibu: causal 3-D variational auto-encoder (VAE) inayochukulia nafasi na muda kama ujazo mmoja, diffusion-based transformers zinazogeuza ujazo huo kuwa patch-tokens, na mixture-of-experts router inayotenganisha upangaji wa kiwango cha tukio (scene-level planning) na uboreshaji wa kiwango cha pikseli (pixel-level polishing). Wan 3.0 pia inakubali maandishi, picha, sauti, na video ya rejea kama mitiririko huru ya masharti (conditioning streams), ikiruhusu kila moja kuathiri matokeo bila kufuta nyingine. Matokeo yake ni ulimwengu thabiti wa sauti na picha ambapo mhusika anaweza kufuatiliwa wakati kamera inazunguka (pan), bidhaa inahifadhi umbo lake wakati inazungushwa, na hatua ya mguu inatokea wakati ule ule sauti inaposikika.
Kwa nini video ndefu za AI zimekuwa kikwazo
Mifano ya awali ya video za kutengenezwa ingeweza kutoa sekunde chache za uhuishaji, lakini kuongeza muda wa video kulionyesha mapungufu mawili ya msingi. Kwanza, utengenezaji wa fremu kwa fremu (frame-by-frame synthesis) ulipuuza utegemezi wa muda (temporal dependencies), hivyo uso uliokuwa unaonekana halisi mwanzoni ulianza kupoteza umbo baada ya fremu chache. Pili, mifumo mingi ilichukulia sauti kama kitu cha ziada, jambo lililopelekea kutolingana kwa miondoko ya midomo (lip-sync) au athari za sauti (Foley effects) kutowekwa mahali sahihi. Kurekebisha matatizo haya kwa kutumia sampuli za nguvu (brute-force sampling) kulisababisha gharama kupanda sana kadiri muda unavyoongezeka, na kufanya chochote kinachozidi sekunde chache kuwa kisichowezekana kwa watayarishaji.
Nguzo za kiufundi za Wan 3.0
Causal 3-D VAE – VAE za kawaida hupunguza picha moja kuwa kodi ya siri (latent code). Toleo la Wan hupunguza ujazo mzima wa video (urefu × upana × muda) kwa wakati mmoja. Kwa sababu encoder na decoder zinaheshimu mpangilio wa kimantiki (causal ordering) wa fremu, uwakilishi wa siri (latent representation) tayari imeingiza "nini kitafuata," ikiruhusu moduli za baadaye kufanya kazi na msingi unaozingatia muda badala ya picha zilizojitenga.
Diffusion Transformers – Baada ya kuingiza (encoding), video hugawanywa katika patch za 3-D zinazofanya kazi kama maneno katika sentensi. Transformer inatabiri mwelekeo wa diffusion kwa kila patch, ikijifunza jinsi vitu vinavyosogea, jinsi mwanga unavyobadilika, na jinsi mtazamo unavyobadilika katika fremu mbalimbali. Mtazamo huu unaozingatia token unatoa uwezo wa modeli kuelewa mwendo wa jumla huku bado ikishughulikia maelezo madogo madogo.
Mixture-of-Experts (MoE) – Badala ya kulazimisha mtandao mmoja kujifunza mpangilio mkubwa (macro layout) na muundo mdogo (micro texture), Wan inaelekeza hatua za mapema za diffusion kwa "mtaalamu" anayelenga mpangilio wa tukio na mwendo mpana, kisha inahamishia hatua za baadaye kwa mtaalamu wa pili anayeboresha matundu ya ngozi, mwangaza (reflections), na vivuli vidogo. Mgawanyo huu unazuia upotezaji wa nguvu ya kompyuta kwenye kazi ambazo hazihitaji utata (resolution) wa juu, na kuweka muda wa utendaji (inference time) katika kiwango kinachoweza kudhibitiwa.
Multimodal Conditioning – Maelekezo ya maandishi (text prompts), picha za rejea, vipande vifupi vya video, na nyimbo za sauti kila moja inatengeneza embedding yake. Modeli inaunganisha embeddings hizi huku ikihifadhi utambulisho wa kila moja, hivyo maelekezo ya maandishi ya "tembea kushoto" hayatafuta picha ya rejea ya uso wa mhusika iliyotolewa, na wimbo wa muziki wa nyuma hautafuta sauti ya maneno yanayozungumzwa.
Identity and Camera Control – Sifa za rejea zinazotolewa kutoka kwenye picha au kipande kilichotolewa hufanya kazi kama nanga (anchors) katika mchakato mzima wa uundaji. Wakati kamera ya kidijitali inazunguka (pan), mfumo unachukulia mwendo huo kama mabadiliko ya kijiometri ya nafasi ya siri (latent space) badala ya kichujio cha baada ya mchakato (post-process filter), hivyo kuweka utambulisho wa mhusika thabiti licha ya mabadiliko ya mitazamo au mwanga.
Audiovisual Sync – Kichwa maalum cha ulinganishaji (alignment head) kinatabiri ni lini matukio ya sauti yanapaswa kuonekana katika mtiririko wa video. Hatua za miguu, makofi, au ishara za mazungumzo huangukia kwenye fremu sahihi ambapo mawimbi ya sauti (sound waveform) yanafika kilele, na hivyo kuleta muunganiko thabiti kati ya picha na sauti bila kuhitaji uhariri wa mikono.
Nani atafaidika
Watayarishaji wa maudhui, watangazaji, na watengenezaji wa michezo ya video sasa wanaweza kutengeneza mifano ya mfuatano mrefu bila kuhitaji kuunganisha vipande vingi vifupi. Kwa sababu usanifu wa MoE unapunguza hesabu zisizo za lazima, gharama kwa kila dakika inayozalishwa inabaki katika uwezo wa studio za wastani ambazo hapo awali zilitegemea mifumo ya uhuishaji iliyotengenezwa kwa mikono. Watafiti pia wanaweza kuboresha (fine-tune) nafasi ya siri inayoweza kutumika tena ya causal 3-D VAE kwa kazi mahususi kama vile picha za kitabibu au uonyeshaji wa kisayansi.
Changamoto na maswali yaliyosalia
Usofistiki wa usanifu huu unakuja na gharama ya vifaa: kufundisha diffusion transformer kwenye vipande vya 3-D bado kunahitaji GPUs za hali ya juu au viwezeshi maalum (specialized accelerators). MoE inapunguza upotevu wa inference, lakini mantiki ya uelekezaji (routing logic) huongeza ucheleweshaji (latency) ambao unaweza kuonekana katika programu za wakati halisi (real-time applications). Multimodal conditioning, ingawa ina nguvu, inaweza kusababisha migongano wakati maelekezo (prompts) yanapokuwa na utata; modeli inaweza kupendelea modality moja kuliko nyingine, jambo linalopelekea mabadiliko madogo ya utambulisho (identity drift) katika hali zisizo za kawaida (edge cases).
Wakosoaji pia wanabainisha kuwa ulimwengu wenye mshikamano hauhakikishii mshikamano wa simulizi. Wan 3.0 inafanya vizuri katika mwendelezo wa picha na sauti, lakini bado haielewi mtiririko wa hadithi (story arcs), motisha ya wahusika, au kasi ya simulizi (pacing). Vipengele hivyo vya juu vya usimulizi wa hadithi vinabaki mikononi mwa wahariri wa kibinadamu.
Nini cha kufuatilia baadaye
Timu iliyo nyuma ya Wan 3.0 imeashiria toleo linalokuja ambalo litajaribu hierarchical diffusion, likiruhusu hatua moja kuandaa storyboard ya awali kabla ya kuboresha maelezo. Muunganisho na programu maarufu za kuhariri (editing suites) pia upo kwenye mpango wa kazi (roadmap), jambo ambalo linaweza kugeuza mfano huu wa utafiti kuwa plug-in ambayo watumiaji wasio na ujuzi wa kiufundi wanaweza kuitumia moja kwa moja.
Ikiwa toleo la sasa litathibitika kuwa imara kwenye vifaa mbalimbali, tunaweza kuona wimbi la studio huru (indie studios) likiepuka mifumo ya jadi ya motion-capture, badala yake likitegemea picha chache za rejea na maandishi ya simulizi (textual script) ili kutengeneza matukio marefu. Miezi michache ijayo itafichua ikiwa mafanikio haya ya kiufundi yatageuka kuwa mabadiliko katika mifumo ya kazi ya uzalishaji (production workflows) au yatabaki kuwa kitu cha ajabu chenye gharama kubwa kwa jamii ya utafiti.
