Mfumo wa usambazaji wa maarifa wa cross-modal ulipunguza muda wa matengenezo ya roboti laini (soft-robotics) kwa 34 % kwa timu zinazozungumza lugha nyingi, ukipunguza injini ya upatikanaji wa matokeo (inference engine) kwa 60 % na kutoa maelekezo kwa chini ya ms 45. Hatua hii ni muhimu kwa sababu roboti laini—zilizoundwa kwa polima zinazonyumbulika na vichochezi vya majimaji (fluidic actuators)—zinaenea katika utengenezaji, vifaa vya matibabu na maeneo hatarishi, lakini vizuizi vya lugha na mfululizo wa data za sensa zilizotengana vinachelewesha matengenezo yake.

Kwa nini matengenezo ya roboti laini ni tatizo la multimodal

Roboti laini hutofautiana na mikono ya chuma: elastomer, ngozi za silikoni na mifereji iliyojengwa ndani husukuma majimaji. Nyufa kwenye utando, uvujaji katika mstari wa pneumatic, au mabadiliko madogo katika mlio wa pampu vyote vinaweza kuashiria kuharibika hivi karibuni. Kutambua ishara hizo kunahitaji zaidi ya chanzo kimoja cha data.

  • Visual (Picha) hutoa data za mabadiliko ya uso au mabadiliko ya rangi.
  • Tactile (Miguso) hutoa ripoti za ulegevu au kuteleza kutiliwa shaka.
  • Acoustic (Sauti) huchukua masafa yasiyo ya kawaida ya pampu kupitia maikrofoni.
  • Linguistic (Lugha) hutoa maelekezo ya matengenezo katika lugha ya asili ya fundi.

Wakati mtendaji anayezungumza Kihispania alipofuata maelekezo ya Kiingereza pekee kutoka kwa mfano wa kawaida wa tafsiri, mfano huo ulitoa maandishi kwa usahihi lakini ukakosa ishara ya picha ya nyufa zinazokua. Matengenezo yalichelewa na kusimama kwa kazi kuligharimu pesa. Tukio hilo lilionyesha changamoto tatu zilizoungana: aina za data (modalities) zisizoendana, istilahi za kiufundi ambazo ni ngumu kutafsiriwa neno kwa neno, na hitaji la maoni ya papo hapo ya eneo la kazi.

Jinsi usambazaji wa maarifa wa cross-modal unavyofanya kazi

Watafiti walibadilisha AI ya monolithic kwa seti ya mifano ya "mwalimu" (teacher models), ambapo kila mmoja ni mtaalamu katika modality moja, na "mwanafunzi" (student) mwepesi ambaye huunganisha maarifa yao. Mchakato huo una hatua tatu:

  1. Mwalimu mahususi wa modality – mitandao ya neva (neural networks) tofauti iliyofundishwa kwenye uoni, sauti na maandishi. Mwalimu wa uoni hutambua nyufa, mwalimu wa sauti huashiria sauti zisizo za kawaida za pampu, na mwalimu wa lugha huchanganua miongozo ya kiufundi.
  2. Moduli ya uoanishaji (Alignment module) – daraja la neva linalohamisha matokeo tofauti kwenda kwenye nafasi ya pamoja ya uwekaji wa data (shared embedding space). Ujifunzaji wa kulinganisha (Contrastive learning) unalazimisha mfumo kuhusisha, kwa mfano, nyufa za picha na sauti yake ya pampu, ili uwekaji wa data (embeddings) ukamate maana za cross-modal.
  3. Mwanafunzi wa lugha nyingi – mfano mdogo (compact model) unaotumia uwekaji wa data uliounganishwa na kutoa maelekezo ya matengenezo katika lugha yoyote inayosupportwa. Chati ya maarifa (knowledge graph) mahususi ya sekta hutoa tafsiri sahihi kwa istilahi za kipekee kama vile “pneumatic diaphragm” au “hydrogel actuator”.

Quantization—kupunguza usahihi wa uzito—hupunguza ukubwa wa mwanafunzi kwa 60 %, ikimruhusu kufanya kazi kwenye vifaa vya mwisho (edge devices) vyenye uwezo mdogo wa kompyuta. Ucheleweshaji wa upatikanaji wa matokeo (inference latency) wa ms 45 unakidhi mahitaji ya papo hapo ya mtendaji anayetazama picha ya kamera ya moja kwa moja huku akisikiliza sauti za pampu.

Mafanikio ya utendaji na athari katika ulimwengu halisi

Mfumo huu ulifanyiwa majaribio katika kituo cha washirika.

  • Akiba ya muda: Timu za lugha nyingi zilimaliza ukaguzi wa kawaida kwa kasi ya 34 % zaidi, shukrani kwa mwongozo wa papo hapo unaoendana na lugha ambao uliangazia hitilafu za picha na sauti kwa pamoja.

Namba hizi zinaonyesha kuwa kuunganisha mfululizo wa sensa na uchakataji wa lugha kunaweza kubadilisha matengenezo ya roboti laini kutoka ya kurekebisha baada ya kuharibika (reactive) kwenda ya kutabiri (predictive).

Changamoto zinazoweza kutokea

Njia hii inabadilisha urahisi wa mfano mmoja mkubwa kwa uongozaji tata zaidi wa walimu na tabaka la uoanishaji. Kudumisha mifano kadhaa ya wataalamu kunahitaji data nyingi zaidi za mafunzo kwa kila modality na udhibiti makini wa matoleo (version control).

Nini kinafuata

Muhtasari: Kumfundisha mfano mwepesi wa lugha nyingi kusikiliza uoni, sauti na maandishi kwa pamoja kunawawezesha wahandisi kupunguza mizunguko ya matengenezo na kuleta uaminifu wa roboti laini kwa wafanyakazi wa aina mbalimbali. Kanuni hii inathibitisha kuwa AI yenye akili zaidi, na si kubwa zaidi, inaweza kuziba pengo la lugha na mifumo ya sensa iliyotengana kwa wakati halisi.