கடந்த சில ஆண்டுகள் படங்களை உருவாக்கும் AI அமைப்புகளால் ஆதிக்கம் செலுத்தப்பட்டுள்ளன. இது அவ்வளவு கவர்ச்சிகரமானதாக இல்லாவிட்டாலும், இயந்திரங்களுக்கு அவை பார்ப்பதை உண்மையிலேயே புரிந்துகொள்ளக் கற்பிப்பது ஒரு கடினமான சவாலாகும். ஒரு நிஜமான புகைப்படத்தைப் போன்ற உருவப்படத்தை உருவாக்குவது வியப்பளிக்கிறது, ஆனால் அந்த உருவப்படத்தில் உள்ள எச்சரிக்கை லேபிளைப் படிக்கவும், பின்னணியுடன் ஒப்பிடும்போது அந்தப் பொருள் எங்கே உள்ளது என்று சொல்லவும், பின்னர் அந்தச் சூழலைப் பற்றிய ஒரு தர்க்கரீதியான கேள்விக்கு பதிலளிக்கவும் ஒரு AI-யிடம் கேட்பது என்பது உண்மையான கடினமான பொறியியல் சிக்கலாகவே உள்ளது. சமீபத்திய தொழில்நுட்ப அறிக்கையில் விவரிக்கப்பட்டுள்ள புதிய vision-language மாடலான Qwen-Image, ஒரு குறிப்பிட்ட இலக்குடன் இந்தத் துறையில் நுழைகிறது: அதாவது மேலோட்டமான விவரிப்புகளைத் தாண்டி, காட்சி மற்றும் உரைத் தகவல்களை ஒரு ஒருங்கிணைந்த ஓட்டமாக (unified stream) செயலாக்குவது.

Qwen-Image எவ்வாறு மாறுபடுகிறது

பெரும்பாலான முந்தைய vision அமைப்புகள், ஒரு சாதாரணப் பார்வையாளர் ஒரு போஸ்டரைப் பார்ப்பது போலவே ஒரு படத்தைப் அணுகுகின்றன. அவை முக்கியப் பொருளை அடையாளம் கண்டு, ஒரு பொதுவான தலைப்பை (caption) இணைத்துவிட்டு அடுத்ததாகச் சென்றுவிடுகின்றன. ஒரு பரபரப்பான தெரு முனையின் புகைப்படம் என்பது வெறும் "சாலையில் உள்ள கார்கள் மற்றும் பாதசாரிகள்" என்று மட்டுமே மாறிவிடும். அந்த அளவிலான வெளியீடு புகைப்பட ஆல்பங்களை வகைப்படுத்தப் பயனுள்ளதாக இருக்கும், ஆனால் உங்களுக்குத் துல்லியம் தேவைப்படும்போது அது விரைவாகத் தோல்வியடைகிறது.

Qwen-Image இன்னும் ஒரு படி மேலே செல்லுமாறு உருவாக்கப்பட்டுள்ளது. பட அங்கீகாரம் (image recognition) மற்றும் மொழிப் புரிதலைத் தனித்தனிப் பணிகளாக இணைப்பதற்குப் பதிலாக, இது ஆரம்பத்திலிருந்தே காட்சித் தரவு மற்றும் உரையை ஒன்றாகக் கையாள்கிறது. இந்த ஒருங்கிணைந்த செயலாக்கம் முக்கியமானது, ஏனெனில் இது ஒரு சூழலின் மேலோட்டமான வரைபடத்தின் அடிப்படையில் ஊகிப்பதற்குப் பதிலாக, மாடல் உண்மையில் பார்ப்பதில் மொழியை நிலைநிறுத்த (ground language) அனுமதிக்கிறது. மாடல் ஒரு படத்திற்குத் தலைப்பு இடும்போது, ஒரு கேள்விக்குப் பதிலளிக்கும்போது அல்லது ஒரு புகைப்படத்தில் உள்ள உரையைப் படிக்கும்போது, அது காட்சி உள்ளீட்டின் (visual input) ஒரே பொதுவான பிரதிநிதித்துவத்தைப் பயன்படுத்துகிறது.

கவனிக்கத்தக்க நான்கு திறன்கள்

பொருட்களை வெறும் பெயரிடும் மாடல்களிலிருந்து Qwen-Image-ஐ வேறுபடுத்திக் காட்டும் நான்கு குறிப்பிட்ட பலங்களை இந்தத் தொழில்நுட்ப அறிக்கை முன்னிலைப்படுத்துகிறது.

அதிக துல்லியமான படத் தலைப்பிடுதல் (image captioning). ஒரு பயனுள்ள தலைப்பு என்பது பொருட்களின் பட்டியலை விட மேலானது. அது சூழல், செயல் மற்றும் உறவுகளைப் படம்பிடிக்கிறது. நடைமுறையில், ஒரு சமையல்காரர் காய்கறிகளைத் துரிதமாக நறுக்கும் புகைப்படம் மற்றும் ஒரு மேடையின் மீது உள்ள பொருட்களின் நிலையான புகைப்படம் ஆகியவற்றிற்கு இடையிலான வேறுபாட்டைக் கண்டறிவதைக் குறிக்கிறது. உள்ளடக்கக் கண்காணிப்பாளர்கள் (content moderators), அணுகல்தன்மை கருவிகள் (accessibility tools) அல்லது தானியங்கி மெட்டாடேட்டா உருவாக்குநர்களை உருவாக்கும் டெவலப்பர்களுக்கு, அந்த கூடுதல் விவரிப்புத் துல்லியம் கைமுறை ஆய்வு நேரத்தைக் குறைப்பதோடு பிழைகளையும் குறைக்கிறது.

படங்களுக்குள் வலுவான உரை அங்கீகாரம் (text recognition). பல நிஜ உலக காட்சித் பணிகள் புகைப்படங்களில் இயல்பாகத் தோன்றும் சொற்களைப் படிப்பதைக் கோருகின்றன. விசித்திரமான கோணங்களில் புகைப்படம் எடுக்கப்பட்ட கடை முகப்புப் பலகைகள், பிழைச் செய்திகளின் ஸ்கிரீன்ஷாட்டுகள், கையால் எழுதப்பட்ட குறிப்புகள் அல்லது போன் கேமராவில் எடுக்கப்பட்ட அச்சிடப்பட்ட ஆவணங்களை நினைவில் கொள்ளுங்கள். ஒரு தனி OCR குழாய்முறை (pipeline) தேவையின்றி இந்த உரையை நம்பகமான முறையில் பிரித்தெடுத்துப் புரிந்துகொள்ளும் ஒரு மாடல், பயன்பாட்டு கட்டமைப்பை (application architecture) கணிசமாகக் எளிதாக்குகிறது. டெவலப்பர்கள் இனி ஒரு வெளிப்புற வாசகத்தை (external reader) இணைத்து, அந்த இரண்டு அமைப்புகளும் படத்தில் உள்ளதைப் பற்றி ஒத்துக்கொள்ளும் என்று நம்ப வேண்டிய அவசியமில்லை.

காட்சித் கேள்விகளுக்கான மேம்படுத்தப்பட்ட தர்க்கம் (reasoning). "பந்து என்ன நிறம்?" என்பது போன்ற பதில் நேரடியாகத் தெரியும் போது, ஒரு படத்தைப் பற்றிய கேள்விக்குப் பதிலளிப்பது எளிது. கடினமான கேள்விகள் தர்க்கத்தைக் கோருகின்றன: அளவுகளை ஒப்பிடுவது, ஒரு தொடர்ச்சியான மாற்றங்களைக் கண்காணிப்பது அல்லது தோற்றத்திலிருந்து செயல்பாட்டைக் கண்டறிவது போன்றவை. ஒரு பராமரிப்புத் தொழில்நுட்ப வல்லுநர் ஒரு குறிப்பிட்ட மின்தேக்கி (capacitor) சரியாகப் பொருத்தப்பட்டுள்ளதா என்று கேட்கலாம், அல்லது ஒரு வாடிக்கையாளர் ஒரு புகைப்படத்தின் அடிப்படையில் இரண்டு தயாரிப்புகளில் எது சிறந்த காலாவதி தேதியைக் கொண்டுள்ளது என்று கேட்கலாம். வெறும் முக்கியச் சொற்களைப் படத்தின் பகுதிகளுடன் ஒப்பிடும் மாடல்களை விட, Qwen-Image இந்த சிக்கலான காட்சிப் பணிகளை அதிகத் துல்லியத்துடன் கையாள்கிறது.

இடஞ்சார்ந்த உறவுகளை (spatial relationships) சிறப்பாகப் புரிந்துகொள்ளுதல். மனிதப் பார்வை என்பது ஆழமான இடஞ்சார்ந்தத் தன்மை கொண்டது. காபி மக் லேப்டாப் மூடியின் பின்னால் உள்ளது அல்லது மிதிவண்டி வேலிக்கும் நடைபாதையின் விளிம்புக்கும் இடையில் உள்ளது என்பதை நாம் உடனடியாகப் புரிந்துகொள்கிறோம். குறிப்பாக ஒரு சூழல் குழப்பமாக இருக்கும்போது, இயந்திரங்கள் "இடதுபுறம்", "கீழே" அல்லது "பகுதியளவு மறைக்கப்பட்டுள்ளது" போன்றவற்றைச் சரியாகக் கண்டறிவதில் சிரமப்படுகின்றன. வலுவான இடஞ்சார்ந்த தர்க்கம், ரோபோட்டிக்ஸ் வழிசெலுத்தல் (robotics navigation), கிடங்கு இருப்பு அமைப்புகள் (warehouse inventory systems), ஆக்மென்டட் ரியாலிட்டி (augmented reality) மற்றும் பொருட்களின் இயற்பியல் அமைப்பு முக்கியத்துவம் வாய்ந்த எந்தவொரு பயன்பாட்டிற்கும் ஒரு vision மாடலை மிகவும் பயனுள்ளதாக மாற்றுகிறது.

பார்ப்பதற்கும் புரிந்துகொள்வதற்கும் இடையிலான இடைவெளியைக் குறைத்தல்

வெறும் பிக்சல் அங்கீகாரத்திற்கும் (pixel recognition) உண்மையான புரிதலுக்கும் இடையே ஒரு நீண்ட தூரம் உள்ளது. ஒரு பாதுகாப்பு கேமரா ஃபோட்டான்களைப் பதிவு செய்யும் வகையில் ஒரு கிடங்குத் தளத்தைப் "பார்க்க" முடியும், ஆனால் ஒரு பேலட் (pallet) நகர்த்தப்பட்டுள்ளது என்பதையும், ஒரு எச்சரிக்கை பலகை இப்போது மறைக்கப்பட்டுள்ளது என்பதையும், ஒரு பணியாளரின் உயரம் குறித்த கேள்விக்கு அருகிலுள்ள ரேக்கில் உள்ள லேபிளைப் படிப்பதன் மூலம் பதிலளிக்க முடியும் என்பதையும் புரிந்துகொள்ள மிகவும் மேம்பட்ட தொழில்நுட்பம் தேவைப்படுகிறது.

Qwen-Image-ன் பின்னணியில் உள்ள ஆராய்ச்சியாளர்கள் அந்த இடைவெளியைக் குறைப்பதற்காகவே அதை வடிவமைத்துள்ளனர். காட்சி மற்றும் மொழி செயலாக்கத்தை (vision and language processing) ஒன்றிணைப்பதன் மூலம், இந்த மாதிரி வெறும் சிறிய விளக்கக்காட்சிகளாக மட்டுமன்றி, சிக்கலான பணிப்பாய்வுகளுக்கு (workflows) கணினி பார்வையை (computer vision) நடைமுறைப்படுத்துவதற்குத் தேவையான ஆழமான புரிதலை வழங்குவதை நோக்கமாகக் கொண்டுள்ளது.

டெவலப்பர்களுக்கு பெஞ்ச்மார்க்குகள் (Benchmarks) ஏன் முக்கியம்

தேர்ந்தெடுக்கப்பட்ட சில உதாரணங்களைக் கொண்டு ஒரு மாதிரியை விளக்குவது ஒன்று; ஆனால் பயனர்கள் மங்கலான, குறைந்த வெளிச்சம் கொண்ட மற்றும் விசித்திரமான அமைப்பைக் கொண்ட படங்களைப் பதிவேற்றும் உண்மையான production சூழலில் அதைச் செயல்படுத்துவது முற்றிலும் வேறானது. Qwen-Image தரமான பெஞ்ச்மார்க்குகளில் சிறப்பாகச் செயல்படுவதாக அறிக்கை குறிப்பிடுகிறது. அந்த பெஞ்ச்மார்க்குகள் முக்கியமானவை, ஏனெனில் அவை கட்டுப்பாட்டுச் சூழலில் பல்வேறு வகையான படங்கள், adversarial examples மற்றும் மாறுபட்ட கேள்வி வடிவங்களை மாதிரிகளுக்கு அறிமுகப்படுத்துகின்றன.

டெவலப்பர்களுக்கு, வலுவான பெஞ்ச்மார்க் செயல்பாடு என்பது கணிக்கக்கூடிய தன்மையைக் (predictability) குறிக்கிறது. வெளிச்சம் மாறும்போது, எதிர்பாராத எழுத்துருவில் (font) உரை தோன்றும் போது அல்லது பல காட்சித் தகவல்களைத் திரட்ட வேண்டிய ஒரு கேள்வியை பயனர் கேட்கும்போது, திடீர் தோல்விகள் ஏற்படுவதைக் குறைக்க இது உதவுகிறது. ஒரு computer vision பயன்பாட்டிற்காக நீங்கள் ஒரு foundation model-ஐத் தேர்ந்தெடுக்கும்போது, கவர்ச்சிகரமான அம்சங்களை விட அந்த நம்பகத்தன்மையே பெரும்பாலும் முக்கியமானது.

உண்மையான பயன்

ஒரு படத்தைப் பார்த்து அதைப் பற்றிச் சொல்லக்கூடிய மாதிரிகள் ஏராளம் உள்ளன. ஆனால், ஒரு சட்டத்திற்குள் இருக்கும் உரையைப் படிப்பது, சிக்கலான கேள்விகளுக்குப் பதிலளிப்பது, இடஞ்சார்ந்த அமைப்புகளை (spatial layouts) துல்லியமாக விவரிப்பது மற்றும் உண்மையில் என்ன நடக்கிறது என்பதைப் பிரதிபலிக்கும் விளக்க உரைகளை (captions) உருவாக்குவது போன்றவற்றைச் செய்யும் மாதிரிகளே பயனுள்ளவை. Qwen-Image அந்த இரண்டாவது வகை வேலைகளுக்காகவே உருவாக்கப்பட்டது போல் தோன்றுகிறது.

நீங்கள் ஒரு production திட்டத்திற்காக vision-language மாதிரிகளை மதிப்பீடு செய்கிறீர்கள் என்றால், முறையான ஒப்பீட்டைச் செய்வதற்குத் தேவையான முறையியல் (methodology), தரவுத்தொகுப்பு விவரங்கள் மற்றும் சோதனை முடிவுகள் முழுமையான தொழில்நுட்ப அறிக்கையில் உள்ளன. முழு அறிக்கையையும் நீங்கள் இங்கே படிக்கலாம். இந்த முன்னேற்றங்களைப் பற்றி மற்ற உருவாக்குநர்கள் மற்றும் ஆராய்ச்சியாளர்களுடன் விவாதிக்க விரும்பினால், GyaanSetu learning community திறந்திருக்கும்.