Mifumo ya lugha na taswira (VLMs) bado inashindwa katika kazi za msingi za kuona. Tathmini mpya ya PerceptionBench imegundua kuwa hakuna hata mmoja kati ya mifumo kumi na sita inayotangulia inayozidi usahihi wa 60% kwa ujumla, na hata yenye nguvu zaidi inabaki chini ya 80% katika ujuzi wowote wa kipekee. Matokeo haya yanawaonya watengenezaji kuwa alama za juu kwenye majaribio maarufu ya maelezo (captioning) au mantiki hazihakikishii uwezo wa kuona wa kuaminika.

Kwa nini majaribio yaliyopo yanaficha tatizo

Viwango vingi vya kulinganishia (benchmarks) vya umma vinachanganya maelezo ya picha, kujibu maswali, na mantiki ya kawaida. Wakati mfumo unatoa maelezo (caption) yasiyo sahihi, kosa hilo linaweza kuwa ni kuteleza kwa lugha, kosa la mantiki, au kushindwa tu kutambua kitu. Kwa sababu vipengele hivyo vitatu vimechanganyikana, alama duni haitoi dalili yoyote kuhusu upungufu wa uwezo wa kuona. Hivyo basi, timu zinazojenga programu hupata imani isiyo na msingi kutokana na namba zinazoonekana kubwa, zikidhania kuwa mfumo "unaona" kwa usahihi.

PerceptionBench inafanya nini tofauti

PerceptionBench hutenga uwezo kumi wa kuona na kutathmini kila mfumo kwenye seti ya kazi za kuona pekee. Kwa kuondoa lugha na mantiki, kiwango hiki kinaonyesha jinsi sehemu ya awali ya kuona (visual front-end) inavyofanya kazi yenyewe. Kwa ujumla, VLMs kumi na sita bora zinashindwa kufikia kiwango cha usahihi cha 60%, na mfumo unaofanya vizuri zaidi haufikii hata 80% katika ujuzi wowote mmoja. Hallucination—kutoa maelezo ambayo hayapo kwenye picha—ndiyo kosa la kawaida zaidi, huku mpangilio wa nguvu na udhaifu ukitofautiana sana kati ya mifumo.

Nani anayestahili kupoteza

Watengenezaji hawapaswi kuchukua nafasi ya mifumo maalum ya kutambua picha (visual classifiers) kwa kutumia mifumo ya jumla ya AI.

Sehemu ambapo hoja inashindwa

Data ya PerceptionBench inaonyesha matokeo yanayopungua: hata mifumo mikubwa zaidi bado inajikwaa katika kazi za msingi za utambuzi.

Hatua za vitendo kwa watengenezaji

  • Tumia mifumo maalum ya kutambua picha (visual classifiers) kwa kazi zinazohitaji usahihi mkubwa; chukulia VLMs kama nyongeza badala ya mbadala.
  • Ongeza tabaka la uhakiki linalolinganisha matokeo ya mfumo na kifaa cha utambuzi kinachoaminika kabla hayajamfikia mtumiaji.
  • Tumia kichujio chepesi cha kuona (lightweight vision filter) ili kukamata hallucination zinazoonekana wazi au makosa ya utambuzi mapema katika mchakato.

Kuunganisha VLM ya matumizi ya jumla na sehemu ya kuona iliyoundwa kwa madhumuni maalum kunaruhusu timu kutumia uwezo wa mantiki wa mfumo huo huku zikilinda dhidi ya upofu wake wa kuona.

Chanzo: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1