Google DeepMind, GenCeption என்ற புதிய மாதிரியை அறிவித்துள்ளது. இது வெறும் 7,500 செயற்கை வீடியோக்களை (synthetic videos) மட்டுமே பயன்படுத்தி, ஒரு உரையிலிருந்து வீடியோவை உருவாக்கும் கருவியை (text-to-video generator), பல்வேறு பார்வை சார்ந்த பணிகளுக்கான (vision tasks) ஒரு ஒற்றை அடிப்படை மாதிரியாக (foundation model) மாற்றுகிறது. இதன் நோக்கம் மிகவும் எளிமையானது: பொருட்கள் எவ்வாறு நகர்கின்றன மற்றும் ஒன்றோடொன்று தொடர்பு கொள்கின்றன என்பதை ஏற்கனவே அறிந்த ஒரு வீடியோ உருவாக்கி, ஒவ்வொரு பணிக்காகவும் தனித்தனி நெட்வொர்க்குகளை உருவாக்காமலேயே ஆழம் (depth), மேற்பரப்பு செங்குத்துத் திசைகள் (surface normals), பிரித்தெடுத்தல் முகமூடிகள் (segmentation masks) மற்றும் 3D போஸ் (3D pose) ஆகியவற்றைக் கணிக்கப் பயன்படுத்தப்படலாம்.

சிதறிய பார்வை வழிமுறைகளிலிருந்து ஒரு ஒருங்கிணைந்த மாதிரி வரை

பெரிய மொழி மாதிரிகள் (Large language models) அடுத்த வார்த்தையைக் கணிப்பதைக் கற்றுக்கொண்டதன் மூலம் பன்முகத்தன்மை கொண்டவையாக மாறின. இதற்கு நேர்மாறாக, கணினிப் பார்வை (Computer-vision) ஆராய்ச்சி இன்னும் பிரித்தெடுத்தல் (segmentation), ஆழம் (depth) மற்றும் போஸ் (pose) ஆகியவற்றிற்காகத் தனித்தனி நிபுணத்துவ அமைப்புகளைக் கையாளிக் கொண்டிருக்கிறது. GenCeption இந்தத் தற்காலிகத் தொகுப்பைத் தவிர்க்கிறது. ஒரு உரைத் தூண்டுதல் (text prompt) எந்த வெளியீட்டை உருவாக்க வேண்டும் என்பதை மாதிரியிடம் தெரிவிக்கிறது, மேலும் அதே 14-பில்லியன் அளவுருக்கள் (parameters) கொண்ட கட்டமைப்பு ஆழ வரைபடங்கள் (depth maps), செங்குத்துத் திசை வரைபடங்கள் (normal maps), பிரித்தெடுத்தல் முகமூடிகள் அல்லது முக்கியப்புள்ளி கணிப்புகளை (keypoint predictions) வழங்குகிறது. ஒவ்வொரு வெளியீட்டையும் ஒரு நிலையான மூன்று சேனல் RGB படமாக treating செய்வதன் மூலம், இந்த அமைப்பு வழிமுறையை (pipeline) சீராக வைத்திருக்கிறது; இயல்பாகப் படங்களை உருவாக்காத பணிகளுக்காக, ஆராய்ச்சியாளர்கள் சிறிய பயிற்சியளிக்கக்கூடிய தொகுதிகளை (trainable modules) சேர்த்துள்ளனர்.

மிகச்சிறிய செயற்கை தரவுத் தொகுப்பில் பயிற்சி

இந்தக் குழு Blender மென்பொருளில் ஒரு செயற்கை தரவுத் தொகுப்பை உருவாக்கியது; இதில் 200 மோஷன்-கேப்சர் (motion-capture) வரிசைகளால் இயக்கப்படும் 800 டிஜிட்டல் மனித மாதிரிகளிலிருந்து 7,500 குறுகிய வீடியோக்களை உருவாக்கினர். D4RT அல்லது VGGT Omega போன்ற பாரம்பரிய வீடியோ உருவாக்கும் மாதிரிகள் மில்லியன் கணக்கான கிளிப்களில் பயிற்சி பெறுகின்றன; ஆனால் GenCeption, அந்தத் தரவில் ஒன்றில் ஏழில் ஒரு பங்கு முதல் ஐந்நூரில் ஒரு பங்கு வரை மட்டுமே பயன்படுத்தி, இணையான அல்லது சிறந்த செயல்திறனை எட்டுகிறது. அறிக்கையிடப்பட்ட அளவுகோல்கள் (benchmarks) பின்வருமாறு:

  • DepthAnything 3 போன்ற சிறப்பு மாதிரிகளுக்கு இணையான ஆழத்தைக் கணித்தல் (Depth estimation).
  • NormalCrafter மற்றும் Lotus-2 ஆகியவற்றை விடச் சிறந்த மேற்பரப்பு செங்குத்துத் திசை கணிப்பு (Surface-normal prediction).
  • Genmo மற்றும் TRAM ஆகியவற்றை விடச் சிறந்த 3D போஸ் அங்கீகாரம் (3D pose recognition).
  • Meta-வின் SAM 3 மற்றும் Gemini 3.5 Flash ஆகியவற்றின் கூட்டு வலிமைக்கு இணையான மொழி வழிகாட்டுதல் கொண்ட பிரித்தெடுத்தல் (Language-guided segmentation).

இந்த உருவாக்கும் நோக்கம் (generative objective), நெட்வொர்க்கை காட்சிக் வடிவியல் (scene geometry) மற்றும் இயற்பியலை உள்வாங்கத் தூண்டுகிறது, இது பின்னர் பிற பார்வை சார்ந்த பணிகளுக்குப் பயனுள்ளதாக அமைகிறது என்று ஆசிரியர்கள் கூறுகின்றனர்.

வேகத்திற்கான கட்டமைப்பு குறுக்குவழிகள்

GenCeption, Alibaba-வின் திறந்த மூல Wan2.1 வீடியோ மாதிரியின் அடிப்படையில் உருவாக்கப்பட்டுள்ளது. பல சுழற்சிகள் (iterations) மூலம் பிரேம்களைச் செம்மைப்படுத்தும் வழக்கமான டிஃப்யூஷன் (diffusion) செயல்முறைக்கு பதிலாக, ஆராய்ச்சியாளர்கள் ஒரு ஒற்றை முன்னோக்கிச் செயல்முறையிலேயே (single forward pass) கணிப்பை வெளியிடும் வகையில் அமைப்பை மறுவடிவமைப்பு செய்துள்ளனர். இதன் விளைவாக: தற்போதைய வன்பொருளில் (hardware) இந்த மாதிரி ஒரு 81-பிரேம் கிளிப்பை சுமார் பத்து வினாடிகளில் செயலாக்குகிறது. 14-பில்லியன் அளவுருக்கள் என்பது பெரிய அளவாக இருந்தாலும், பயிற்சியில் கிடைக்கும் சேமிப்பும், பல பணிகளுக்கான தனித்தனி நெட்வொர்க்குகளைத் தவிர்த்ததும் குறிப்பிடத்தக்க செயல்திறன் முன்னேற்றத்தைத் தருகின்றன.

AI சமூகம் ஏன் கவனம் செலுத்த வேண்டும்

ஒரு வீடியோ உருவாக்கி "உலக மாதிரி"யாக (world model) — அதாவது பொருட்கள் எவ்வாறு இடத்தை ஆக்கிரமிக்கின்றன மற்றும் காலப்போக்கில் எவ்வாறு நகர்கின்றன என்பதைப் பிரதிபலிக்கும் ஒரு மாதிரியாக — செயல்பட முடிந்தால், அடுத்தகட்ட காட்சி AI முன்னேற்றம் என்பது மிகப்பெரிய தரவுத் தொகுப்புகளைக் குறிப்பீடு செய்வதிலிருந்து (annotating) மாறாமல், உருவாக்கும் திறனை (generative capabilities) அதிகரிப்பதன் மூலம் வரக்கூடும். ஒரு ஒற்றை, உரைத் தூண்டுதல் மூலம் இயங்கும் மாதிரி, தயாரிப்பு வழிமுறைகளை எளிமையாக்கலாம், பொறியியல் சுமையைக் குறைக்கலாம் மற்றும் பார்வை அம்சங்கள் தேவைப்படும் ஆனால் பல நிபுணத்துவ நெட்வொர்க்குகளைப் பயிற்றுவிக்க வசதி இல்லாத டெவலப்பர்களுக்கான தடையைக் குறைக்கலாம்.

எச்சரிக்கைகள் மற்றும் unanswered questions

இந்தச் செயல்திறன் எண்கள் செயற்கை தரவிலிருந்து பெறப்பட்டவை, இவை நிஜ உலக வீடியோக்களின் சிக்கல்களைப் பிரதிபலிக்காமல் போகலாம். கட்டுப்பாடற்ற ஒளி, வானிலை அல்லது கேமரா இயக்கம் ஆகியவற்றிற்கு இந்த மாதிரி எவ்வாறு பொருந்தும் என்பது இன்னும் நிரூபிக்கப்படவில்லை. 81-பிரேம் கிளிப்பிற்கான பத்து வினாடி அனுமானம் (inference), தொடர்ச்சியான டிஃப்யூஷன் முறையை விட வேகமானது என்றாலும், ரோபோட்டிக்ஸ் அல்லது AR பயன்பாடுகளுக்கு இது இன்னும் நிகழ்நேரத்திற்கு (real-time) மிகத் தொலைவில் உள்ளது. மேலும், மாதிரியின் 14-பில்லியன் அளவுருக்கள் பயன்பாட்டிற்கு வரும்போது கணிசமான கணக்கீட்டுத் திறன் (compute budget) தேவைப்படும், இது போதுமான நிதி வசதி இல்லாத ஆய்வகங்களின் அணுகலைத் தடுத்துவிடக்கூடும்.

அடுத்து என்ன எதிர்பார்க்கலாம்

  • நிஜ உலகச் சரிபார்ப்பு: GenCeption மாதிரியை வெளிப்புற ஓட்டுதல் வீடியோக்கள், கையால் பிடிக்கப்பட்ட போன் வீடியோக்கள் அல்லது தொழில்முறை ஆய்வு காட்சிகளில் சோதிக்கும் ஆய்வுகள்.
  • மாதிரியின் அளவிடுதல் (Model scaling): தரவுத் திறனைப் பாதுகாக்கும் அதே வேளையில், பெரிய அல்லது அதிகத் திறனுடன் பயிற்றுவிக்கப்பட்ட பதிப்புகள் தாமத இடைவெளியைக் (latency gap) குறைக்க முடியுமா என்பது.
  • ஒருங்கிணைப்புப் பாதைகள்: கிளவுட் வழங்குநர்கள் அல்லது எட்ஜ்-AI (edge-AI) தளங்கள் எவ்வாறு ஒரு உரை விளக்கத்தைப் பெற்று அதற்குத் தகுந்த காட்சி வெளியீட்டை வழங்கும் ஒற்றை API-ஐ வழங்கக்கூடும் என்பது.
  • மாற்றுப் பயிற்சி ஆதாரங்கள்: வலிமையை மேம்படுத்த செயற்கை கிளிப்களைச் சிறிய அளவிலான நிஜ வீடியோக்களுடன் இணைக்கும் முயற்சிகள்.

முக்கியக் கருத்து

GenCeption ஒரு வீடியோ உருவாக்கும் இயந்திரம், ஒரு பல்துறை பார்வை அடிப்படை மாதிரியாகவும் (multi-task vision foundation model) செயல்பட முடியும் என்பதைக் காட்டுகிறது. இது பாரம்பரிய அணுகுமுறைகளை விட பல மடங்கு சிறிய தரவுத்தொகுப்பிலிருந்து கற்றுக்கொள்ளும் அதே வேளையில், அதிநவீன ஆழம் (depth), நார்மல்ஸ் (normals), போஸ் (pose) மற்றும் செக்மென்டேஷன் (segmentation) ஆகியவற்றை வழங்குகிறது. பல்வேறு வகையான சிறப்பு நெட்வொர்க்குகளை ஒரே 'prompt-driven' அமைப்பாக ஒன்றிணைப்பதே இதன் முக்கிய வாக்குறுதியாகும்; செயற்கை ஆய்வகங்களிலிருந்து கணிக்க முடியாத வெளி உலகிற்கு மாறும்போது அந்த வாக்குறுதி நிலைத்து நிற்குமா என்பதே இதன் அடுத்த சோதனை.