Google DeepMind imetangaza GenCeption, modeli inayobadilisha kizalishaji cha maandishi-kwenda-video (text-to-video generator) kuwa modeli msingi (foundation model) moja kwa kazi mbalimbali za uoni (vision tasks), ikitumia video za kutengenezwa (synthetic videos) 7,500 pekee. Dai ni rahisi: kizalishaji cha video ambacho tayari kinajua jinsi vitu vinavyosogea na kuingiliana kinaweza kutumika upya kutabiri kina (depth), hali ya uso (surface normals), mask za utengaji (segmentation masks) na mkao wa 3D (3D pose) bila kujenga mtandao tofauti kwa kila moja.

Kutoka mifumo ya uoni iliyovunjika-vunjika hadi modeli iliyounganishwa

Modeli kubwa za lugha (Large language models) zilipata uwezo wa kufanya mambo mengi kwa kujifunza kutabiri neno linalofuata. Kwa upande mwingine, utafiti wa uoni wa kompyuta (computer-vision research) bado unatumia mifumo maalum—mmoja kwa utengaji (segmentation), mwingine kwa kina (depth), na mwingine tena kwa mkao (pose). GenCeption inaruka mchakato huo wa kutumia vipande vipande. Maelekezo ya maandishi (text prompt) humwambia modeli aina ya matokeo yanayopaswa kuzalishwa, na usanifu uleule wenye vigezo bilioni 14 unatoa ramani za kina (depth maps), ramani za hali ya uso (normal maps), mask za utengaji (segmentation masks) au utabiri wa nukta muhimu (keypoint predictions). Kwa kuchukulia kila matokeo kama picha ya kawaida ya RGB yenye chaneli tatu, mfumo huu unaweka mtiririko (pipeline) kuwa thabiti; kwa kazi ambazo hazizalishi picha kiasili, watafiti waliongeza moduli ndogo zinazoweza kufundishwa.

Kufundishwa kwenye mkusanyiko mdogo wa data za kutengenezwa

Timu hiyo ilitengeneza seti ya data ya kutengenezwa (synthetic dataset) kwenye Blender, ikitoa video fupi 7,500 kutoka kwa mifano 800 ya binadamu wa kidijitali inayoendeshwa na mfuatano 200 wa kurekodi mienendo (motion-capture sequences). Modelia za kawaida za uzalishaji wa video kama D4RT au VGGT Omega hufundishwa kwa mamilioni ya vipande; GenCeption inafikia utendaji unaolingana au bora zaidi huku ikitumia kati ya sehemu moja ya saba na sehemu moja ya mia tano ya data hiyo. Viwango vya utendaji vilivyoripotiwa ni pamoja na:

  • Makadirio ya kina (Depth estimation) yanayolingana na modeli maalum kama DepthAnything 3.
  • Utabiri wa hali ya uso (Surface-normal prediction) unaozidi NormalCrafter na Lotus-2.
  • Utambuzi wa mkao wa 3D (3D pose recognition) unaozidi Genmo na TRAM.
  • Utengaji unaoongozwa na lugha (Language-guided segmentation) unaolingana na nguvu ya pamoja ya SAM 3 ya Meta na Gemini 3.5 Flash.

Waandishi wanasema lengo la uzalishaji (generative objective) linailazimisha mtandao kuingiza ndani ya mfumo jiometri na fizikia ya mandhari, jambo ambalo kisha huhamishiwa kwenye kazi za utambuzi za hatua inayofuata (downstream perception tasks).

Njia za mkato za usanifu kwa ajili ya kasi

GenCeption imejengwa juu ya modeli ya video ya Wan2.1 ya Alibaba iliyo wazi (open-source). Badala ya mchakato wa kawaida wa diffusion unaoboresha fremu kupitia marudio mengi, watafiti waliboresha mfumo ili kutoa utabiri katika hatua moja ya mbele (single forward pass). Matokeo yake: modeli inachakata kipande cha fremu 81 kwa takriban sekunde kumi kwenye vifaa vya sasa. Ukubwa wa vigezo bilioni 14 unabaki kuwa mkubwa, lakini akiba ya mafunzo na kuondolewa kwa mitandao mingi mahususi kwa kazi fulani kunaleta ongezeko kubwa la ufanisi.

Kwa nini jamii ya AI inapaswa kutilia maanani

Ikiwa kizalishaji cha video kinaweza kutumika pia kama “modeli ya dunia” (world model)—uwakilishi unaonasia jinsi vitu vinavyochukua nafasi na kusogea kwa muda—basi hatua inayofuata kubwa katika AI ya uoni inaweza kutoka katika kuongeza uwezo wa uzalishaji badala ya kuweka alama (annotating) kwenye seti kubwa zaidi za data. Modeli moja inayoongozwa na maelekezo inaweza kurahisisha mifumo ya bidhaa, kupunguza gharama za uhandisi, na kushusha kizuizi kwa watengenezaji wanaohitaji vipengele vya uoni lakini hawana rasilimali za kufundisha mitandao mingi maalum.

Tahadhari na maswali ambayo hayajajibiwa

Namba za utendaji zinatokana na data za kutengenezwa na seti za majaribio ambazo zinaweza zisielezee hali halisi ya video za ulimwengu halisi. Uwezo wa kutumika katika mwanga usiodhibitiwa, hali ya hewa, au mwendo wa kamera bado haujathibitishwa. Utoaji wa matokeo (inference) wa sekunde kumi kwa kipande cha fremu 81, ingawa ni haraka kuliko diffusion ya marudio, bado iko mbali na muda halisi (real-time) kwa ajili ya roboti au AR. Aidha, vigezo 14 bilioni vya modeli hiyo vinahitaji bajeti kubwa ya kompyuta kwa ajili ya utumiaji, jambo ambalo linaweza kuzuia upatikanaji nje ya maabara zenye ufadhili mzuri.

Nini cha kufuatilia baadaye

  • Uthibitisho wa ulimwengu halisi: tafiti zinazojaribu GenCeption kwenye video za uendeshaji nje, video za simu za mkononi, au matukio ya ukaguzi wa viwandani.
  • Upanuzi wa modeli: ikiwa matoleo makubwa zaidi au yaliyofundishwa kwa ufanisi zaidi yanaweza kuziba pengo la ucheleweshaji (latency) huku yakihifadhi ufanisi wa data.
  • Njia za ushirikiano: jinsi watoa huduma za wingu (cloud providers) au mifumo ya edge-AI inavyoweza kutoa API moja inayokubali maelezo ya kazi ya maandishi na kutoa matokeo ya uoni yanayofaa.
  • Vyanzo mbadala vya mafunzo: juhudi za kuchanganya vipande vya kutengenezwa na kiasi kidogo cha video halisi ili kuboresha uimara (robustness).

Hitimisho

GenCeption inaonyesha kuwa injini ya kutengeneza video inaweza kutumika pia kama modeli ya msingi ya uono inayotekeleza kazi nyingi (multi-task vision foundation model), ikitoa uwezo wa hali ya juu wa kina (depth), normals, mkao (pose), na utenganishaji (segmentation) huku ikijifunza kutoka kwa seti ya data ambayo ni ndogo mara nyingi zaidi kuliko mbinu za kawaida. Ahadi yake ipo katika kuunganisha mkusanyiko mkubwa wa mitandao ya kitaalamu kuwa mfumo mmoja unaoendeshwa na maelekezo (prompt-driven system); jaribio lake linalofuata litakuwa ni kuona kama ahadi hiyo itastahimili mpito kutoka maabara za kutengenezwa kwenda kwenye ulimwengu wa nje usiotabirika.