കഴിഞ്ഞ കുറച്ചു വർഷങ്ങളായി ചിത്രങ്ങൾ നിർമ്മിക്കുന്ന AI സംവിധാനങ്ങളാണ് ആധിപത്യം പുലർത്തുന്നത്. കുറച്ചുകൂടി ആകർഷകമല്ലെങ്കിലും, യഥാർത്ഥത്തിൽ കൂടുതൽ പ്രയാസകരമായ വെല്ലുവിളി എന്നത് യന്ത്രങ്ങളെ അവ കാണുന്ന കാര്യങ്ങൾ ശരിയായി മനസ്സിലാക്കാൻ പഠിപ്പിക്കുക എന്നതാണ്. ഒരു യഥാർത്ഥ ഫോട്ടോ പോലെ തോന്നിക്കുന്ന ചിത്രം നിർമ്മിക്കുന്നത് ശ്രദ്ധേയമാണ്, എന്നാൽ ആ ചിത്രത്തിലെ മുന്നറിയിപ്പ് ലേബൽ വായിക്കാനും, പശ്ചാത്തലവുമായി താരതമ്യം ചെയ്യുമ്പോൾ വസ്തു എവിടെയാണെന്ന് പറയാനും, ആ രംഗത്തെക്കുറിച്ചുള്ള ഒരു ലോജിക് ചോദ്യത്തിന് ഉത്തരം നൽകാനും ഒരു AI-യോട് ആവശ്യപ്പെടുന്നത് ഇപ്പോഴും വലിയൊരു എഞ്ചിനീയറിംഗ് വെല്ലുവിളിയാണ്. സമീപകാലത്തെ ഒരു സാങ്കേതിക റിപ്പോർട്ടിൽ വിശദീകരിച്ചിട്ടുള്ള പുതിയ വിഷൻ-ലാംഗ്വേജ് മോഡലായ Qwen-Image ഈ മേഖലയിലേക്ക് കടന്നുവരുന്നത് ഒരു പ്രത്യേക ലക്ഷ്യത്തോടെയാണ്: ഉപരിപ്ലവമായ വിവരണങ്ങൾക്കപ്പുറം, ദൃശ്യപരവും പാഠപരവുമായ (visual and textual) വിവരങ്ങളെ ഒരു ഏകീകൃത പ്രവാഹമായി (unified stream) പ്രോസസ്സ് ചെയ്യുക എന്നത്.
What Qwen-Image Does Differently
മിക്ക പഴയ വിഷൻ സംവിധാനങ്ങളും ഒരു പോസ്റ്ററിലേക്ക് ഒരാൾ പെട്ടെന്ന് നോക്കുന്നതുപോലെയാണ് ചിത്രങ്ങളെ സമീപിക്കുന്നത്. അവ പ്രധാന വിഷയം തിരിച്ചറിയുകയും ഒരു പൊതുവായ ക്യാപ്ഷൻ നൽകുകയും ചെയ്യുന്നു. തിരക്കുള്ള ഒരു തെരുവിലെ ഫോട്ടോ വെറും "റോഡിലെ കാറുകളും കാൽനടയാത്രക്കാരും" എന്ന് മാത്രംയായി മാറുന്നു. ഫോട്ടോ ആൽബങ്ങൾ തരംതിരിക്കാൻ ഇത്തരത്തിലുള്ള ഔട്ട്പുട്ട് ഉപകാരപ്രദമാണെങ്കിലും, കൃത്യത ആവശ്യമായി വരുമ്പോൾ ഇത് പരാജയപ്പെടുന്നു.
Qwen-Image ഇതിനപ്പുറം പ്രവർത്തിക്കാൻ രൂപകൽപ്പന ചെയ്തിട്ടുള്ളതാണ്. ഇമേജ് റെക്കഗ്നിഷനും (image recognition) ലാംഗ്വേജ് അണ്ടർസ്റ്റാൻഡിംഗും (language understanding) വെവ്വേറെ ജോലികളായി കണ്ട് കൂട്ടിച്ചേർക്കുന്നതിന് പകരം, ഇത് ദൃശ്യവിവരങ്ങളും ടെക്സ്റ്റും തുടക്കം മുതൽ ഒന്നിച്ച് കൈകാര്യം ചെയ്യുന്നു. ഈ ഏകീകൃത പ്രോസസ്സിംഗ് വളരെ പ്രധാനമാണ്, കാരണം രംഗത്തിന്റെ ഒരു ഏകദേശ രൂപം വെച്ച് ഊഹിക്കുന്നതിന് പകരം, യഥാർത്ഥത്തിൽ കാണുന്ന കാര്യങ്ങളെ അടിസ്ഥാനമാക്കി ഭാഷയെ ബന്ധിപ്പിക്കാൻ ഇത് മോഡലിനെ അനുവദിക്കുന്നു. മോഡൽ ഒരു ചിത്രത്തിന് ക്യാപ്ഷൻ നൽകുമ്പോഴോ, ഒരു ചോദ്യത്തിന് ഉത്തരം നൽകുമ്പോഴോ, അല്ലെങ്കിൽ ഒരു ഫോട്ടോയിൽ ഉൾപ്പെടുത്തിയിരിക്കുന്ന ടെക്സ്റ്റ് വായിക്കുമ്പോഴോ, അത് ദൃശ്യവിവരങ്ങളുടെ ഒരേ പങ്കിട്ട രൂപത്തെയാണ് (shared representation) ഉപയോഗിക്കുന്നത്.
Four Capabilities Worth Watching
വെറുതെ വസ്തുക്കളെ അടയാളപ്പെടുത്തുന്ന മോഡലുകളിൽ നിന്ന് Qwen-Image-നെ വേർതിരിക്കുന്ന നാല് പ്രധാന സവിശേഷതകളെ സാങ്കേതിക റിപ്പോർട്ട് എടുത്തുപറയുന്നു.
High-accuracy image captioning. ഒരു നല്ല ക്യാപ്ഷൻ എന്നത് വസ്തുക്കളുടെ ഒരു പട്ടിക മാത്രമല്ല. അത് സന്ദർഭം (context), പ്രവർത്തനം (action), ബന്ധങ്ങൾ (relationships) എന്നിവ കൂടി ഉൾക്കൊള്ളുന്നു. പ്രായോഗികമായി പറഞ്ഞാൽ, പച്ചക്കറികൾ അരിയുന്ന ഒരു ഷെഫിന്റെ ചിത്രവും കൗണ്ടറിൽ വെച്ചിരിക്കുന്ന ചേരുവകളുടെ ചിത്രവും തമ്മിലുള്ള വ്യത്യാസം തിരിച്ചറിയുക എന്നാണ് ഇതിനർത്ഥം. കണ്ടന്റ് മോഡറേറ്റർമാർ, ആക്സസിബിലിറ്റി ടൂളുകൾ അല്ലെങ്കിൽ ഓട്ടോമേറ്റഡ് മെറ്റാഡാറ്റ ജനറേറ്ററുകൾ എന്നിവ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാരെ സംബന്ധിച്ചിടത്തോളം, വിവരണത്തിലെ ഈ കൃത്യത മാനുവൽ പരിശോധനയ്ക്കുള്ള സമയം കുറയ്ക്കാനും പിശകുകൾ ഒഴിവാക്കാനും സഹായിക്കുന്നു.
Strong text recognition inside images. യഥാർത്ഥ ലോകത്തെ പല ദൃശ്യദൗത്യങ്ങൾക്കും ഫോട്ടോകളിൽ സ്വാഭാവികമായി കാണപ്പെടുന്ന വാക്കുകൾ വായിക്കേണ്ടതുണ്ട്. വ്യത്യസ്ത കോണുകളിൽ നിന്ന് എടുത്ത കടകളുടെ ബോർഡുകൾ, എറർ മെസ്സേജുകളുടെ സ്ക്രീൻഷോട്ടുകൾ, കൈപ്പടയിലുള്ള കുറിപ്പുകൾ അല്ലെങ്കിൽ ഫോൺ ക്യാമറയിൽ പകർത്തിയ പ്രിന്റഡ് ഡോക്യുമെന്റുകൾ എന്നിവ ഇതിന് ഉദാഹരണങ്ങളാണ്. ഒരു പ്രത്യേക OCR പൈപ്പ്ലൈൻ ഇല്ലാതെ തന്നെ ഈ ടെക്സ്റ്റ് വിശ്വസനീയമായി വേർതിരിച്ചെടുക്കാനും മനസ്സിലാക്കാനും കഴിയുന്ന ഒരു മോഡൽ, ആപ്ലിക്കേഷൻ ആർക്കിടെക്ചർ വളരെയധികം ലളിതമാക്കുന്നു. ഡെവലപ്പർമാർക്ക് ഇനി ഒരു എക്സ്റ്റേണൽ റീഡർ കൂടി ഘടിപ്പിച്ച് രണ്ട് സിസ്റ്റങ്ങളും ഒരേ കാര്യമാണോ പറയുന്നത് എന്ന് പ്രതീക്ഷിക്കേണ്ടി വരില്ല.
Improved reasoning for visual questions. "പന്തിന്റെ നിറം എന്താണ്?" എന്നത് പോലെ ഉത്തരം നേരിട്ട് കാണാൻ കഴിയുന്ന ചോദ്യങ്ങൾക്ക് മറുപടി നൽകുന്നത് എളുപ്പമാണ്. എന്നാൽ കൂടുതൽ പ്രയാസകരമായ ചോദ്യങ്ങൾക്ക് ലോജിക് ആവശ്യമാണ്: അളവുകൾ താരതമ്യം ചെയ്യുക, ഒരു ക്രമത്തിലെ മാറ്റങ്ങൾ നിരീക്ഷിക്കുക, അല്ലെങ്കിൽ രൂപം കണ്ട് അതിന്റെ ഉപയോഗം ഊഹിക്കുക എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. ഒരു മെയിന്റനൻസ് ടെക്നീഷ്യന് ഒരു കപ്പാസിറ്റർ ശരിയായി ഇരുന്നോ എന്ന് ചോദിക്കാം, അല്ലെങ്കിൽ ഒരു ഉപഭോക്താവിന് രണ്ട് ഉൽപ്പന്നങ്ങളിൽ ഏതിനാണ് കാലാവധി കൂടുതൽ എന്ന് ഫോട്ടോ നോക്കി ചോദിക്കാം. വെറുതെ കീവേഡുകൾ ചിത്രവുമായി യോജിപ്പിക്കുന്ന മോഡലുകളേക്കാൾ മികച്ച രീതിയിൽ Qwen-Image ഇത്തരം സങ്കീർണ്ണമായ ദൃശ്യദൗത്യങ്ങൾ കൈകാര്യം ചെയ്യുന്നു.
Better grasp of spatial relationships. മനുഷ്യന്റെ കാഴ്ചപ്പാട് സ്പേഷ്യൽ (spatial) ആണ്. കോഫി മഗ്ഗ് ലാപ്ടോപ്പിന് പിന്നിലാണെന്നോ, സൈക്കിൾ വേലിയും റോഡരികും ഇടയിലാണെന്നോ നമുക്ക് പെട്ടെന്ന് മനസ്സിലാകും. എന്നാൽ യന്ത്രങ്ങൾ പലപ്പോഴും "ഇടത് വശത്ത്", "താഴെ", അല്ലെങ്കിൽ "ഭാഗികമായി മറയ്ക്കപ്പെട്ടത്" തുടങ്ങിയ കാര്യങ്ങളിൽ ബുദ്ധിമുട്ടാറുണ്ട്, പ്രത്യേകിച്ച് രംഗം സങ്കീർണ്ണമാകുമ്പോൾ. ശക്തമായ സ്പേഷ്യൽ റീസണിംഗ് ഒരു വിഷൻ മോഡലിനെ റോബോട്ടിക് നാവിഗേഷൻ, വെയർഹൗസ് ഇൻവെന്ററി സിസ്റ്റങ്ങൾ, ഓഗ്മെന്റഡ് റിയാലിറ്റി ഓവർലേകൾ എന്നിവയ്ക്കും വസ്തുക്കളുടെ ക്രമീകരണം പ്രധാനമായ മറ്റേതൊരു ആപ്ലിക്കേഷനും കൂടുതൽ ഉപയോഗപ്രദമാക്കുന്നു.
Closing the Gap Between Seeing and Understanding
പക്സൽ തിരിച്ചറിയുന്നതിനും (pixel recognition) യഥാർത്ഥമായ ഗ്രഹണശേഷിക്കും (comprehension) ഇടയിൽ വലിയൊരു വ്യത്യാസമുണ്ട്. ഒരു സെക്യൂരിറ്റി ക്യാമറയ്ക്ക് ഒരു വെയർഹൗസ് തറ "കാണാൻ" കഴിയും (അതായത് അത് ഫോട്ടോൺ റെക്കോർഡ് ചെയ്യുന്നു), എന്നാൽ ഒരു പാലെറ്റ് നീക്കി വെച്ചിട്ടുണ്ടെന്നും, ഒരു മുന്നറിയിപ്പ് ബോർഡ് ഇപ്പോൾ മറയ്ക്കപ്പെട്ടിട്ടുണ്ടെന്നും, ഒരു തൊഴിലാളിയുടെ ഉയരത്തെക്കുറിച്ചുള്ള ചോദ്യത്തിന് അടുത്തുള്ള റാക്കിലെ ലേബൽ വായിച്ച് ഉത്തരം നൽകാൻ കഴിയുമെന്നും മനസ്സിലാക്കാൻ കൂടുതൽ പരിഷ്കൃതമായ സംവിധാനം ആവശ്യമാണ്.
Qwen-Image-ന് പിന്നിലെ ഗവേഷകർ ആ വിടവ് നികത്തുന്നതിനായി പ്രത്യേകം രൂപകൽപ്പന ചെയ്തതാണ് ഇത്. കാഴ്ചയും (vision) ഭാഷാ പ്രക്രിയയും (language processing) ഏകോപിപ്പിക്കുന്നതിലൂടെ, കമ്പ്യൂട്ടർ വിഷൻ വെറും ചെറിയ പരീക്ഷണങ്ങളിൽ മാത്രം ഒതുങ്ങാതെ, സങ്കീർണ്ണമായ പ്രവർത്തനങ്ങളിൽ പ്രായോഗികമായി ഉപയോഗിക്കാൻ കഴിയുന്ന തരത്തിലുള്ള ആഴത്തിലുള്ള അറിവ് നൽകാൻ ഈ മോഡൽ ലക്ഷ്യമിടുന്നു.
ഡെവലപ്പർമാർക്ക് ബെഞ്ച്മാർക്കുകൾ പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്?
തിരഞ്ഞെടുത്ത ചില ഉദാഹരണങ്ങളിൽ ഒരു മോഡൽ പ്രദർശിപ്പിക്കുന്നത് ഒരു കാര്യമാണ്. എന്നാൽ ഉപയോക്താക്കൾ അവ്യക്തമായതും, വെളിച്ചം കുറഞ്ഞതും, വിചിത്രമായ രീതിയിൽ ചിത്രീകരിച്ചതുമായ ചിത്രങ്ങൾ അപ്ലോഡ് ചെയ്യുന്ന യഥാർത്ഥ പ്രൊഡക്ഷൻ സാഹചര്യങ്ങളിൽ അത് ഉപയോഗിക്കുന്നത് തികച്ചും വ്യത്യസ്തമാണ്. Qwen-Image സാധാരണ ബെഞ്ച്മാർക്കുകളിൽ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നുവെന്ന് റിപ്പോർട്ട് സൂചിപ്പിക്കുന്നു. നിയന്ത്രിത സാഹചര്യങ്ങളിൽ വൈവിധ്യമാർന്ന ചിത്രങ്ങൾ, അഡ്വേഴ്സേറിയൽ ഉദാഹരണങ്ങൾ (adversarial examples), വ്യത്യസ്ത ചോദ്യ രീതികൾ എന്നിവയിലൂടെ മോഡലുകളെ പരീക്ഷിക്കാൻ ബെഞ്ച്മാർക്കുകൾ സഹായിക്കുന്നതുകൊണ്ടാണ് അവ പ്രധാനമാകുന്നത്.
ഡെവലപ്പർമാരെ സംബന്ധിച്ചിടത്തോളം, മികച്ച ബെഞ്ച്മാർക്ക് പ്രകടനം എന്നത് പ്രവചനാതീതമല്ലാത്ത (predictability) പ്രവർത്തനങ്ങളെയാണ് സൂചിപ്പിക്കുന്നത്. വെളിച്ചം മാറുന്നအခോ, അപ്രതീക്ഷിതമായ ഫോണ്ടുകളിൽ ടെക്സ്റ്റ് വരുമ്പോഴോ, അല്ലെങ്കിൽ ഒന്നിലധികം കാഴ്ചാ വസ്തുതകൾ കൂട്ടിച്ചേർത്ത് വിശകലനം ചെയ്യേണ്ട ചോദ്യങ്ങൾ ഉപയോക്താക്കൾ ചോദിക്കുമ്പോഴോ ഉണ്ടാകാൻ സാധ്യതയുള്ള അപ്രതീക്ഷിത പരാജയങ്ങൾ കുറയ്ക്കാൻ ഇത് സഹായിക്കുന്നു. ഒരു കമ്പ്യൂട്ടർ വിഷൻ ആപ്ലിക്കേഷനായി നിങ്ങൾ ഒരു ഫൗണ്ടേഷൻ മോഡൽ തിരഞ്ഞെടുക്കുമ്പോൾ, ആകർഷകമായ ഫീച്ചറുകളേക്കാൾ പലപ്പോഴും ആ വിശ്വാസ്യതയാണ് പ്രധാനം.
യഥാർത്ഥ സംഗ്രഹം
ഒരു ചിത്രം നോക്കി അതിനെക്കുറിച്ച് എന്തെങ്കിലും പറയാൻ കഴിയുന്ന മോഡലുകൾക്ക് ഒട്ടും കുറവില്ല. എന്നാൽ ചിത്രത്തിനുള്ളിലെ ടെക്സ്റ്റ് വായിക്കാനും, സങ്കീർണ്ണമായ ചോദ്യങ്ങളിലൂടെ യുക്തിപൂർവ്വം ചിന്തിക്കാനും, സ്ഥലവിന്യാസം (spatial layouts) കൃത്യമായി വിവരിക്കാനും, സംഭവിക്കുന്ന കാര്യങ്ങളെ യഥാർത്ഥത്തിൽ പ്രതിഫലിപ്പിക്കുന്ന ക്യാപ്ഷനുകൾ നൽകാനും കഴിയുന്നവയാണ് യഥാർത്ഥത്തിൽ ഉപയോഗപ്രദമായവ. Qwen-Image രണ്ടാമത്തെ വിഭാഗത്തിലുള്ള ജോലികൾക്കായി നിർമ്മിക്കപ്പെട്ടതാണെന്ന് കാണപ്പെടുന്നു.
ഒരു പ്രൊഡക്ഷൻ പ്രോജക്റ്റിനായി നിങ്ങൾ വിഷൻ-ലാംഗ്വേജ് മോഡലുകൾ വിലയിരുത്തുകയാണെങ്കിൽ, കൃത്യമായ താരതമ്യം നടത്താൻ ആവശ്യമായ രീതിശാസ്ത്രം (methodology), ഡാറ്റാസെറ്റ് വിവരങ്ങൾ, ടെസ്റ്റ് ഫലങ്ങൾ എന്നിവ പൂർണ്ണമായ സാങ്കേതിക റിപ്പോർട്ടിൽ അടങ്ങിയിട്ടുണ്ട്. നിങ്ങൾക്ക് മുഴുവൻ റിപ്പോർട്ടും ഇവിടെ വായിക്കാം. ഈ വികസനങ്ങളെക്കുറിച്ച് മറ്റ് ബിൽഡർമാരുമായും ഗവേഷകരുമായും ചർച്ച ചെയ്യാൻ ആഗ്രഹിക്കുന്നുവെങ്കിൽ, GyaanSetu learning community നിങ്ങൾക്ക് ഉപയോഗിക്കാം.
