Google DeepMind نے GenCeption کا اعلان کیا ہے، ایک ایسا ماڈل جو صرف 7,500 مصنوعی (synthetic) ویڈیوز کا استعمال کرتے ہوئے ٹیکسٹ-ٹو-ویڈیو جنریٹر کو بصری کاموں (vision tasks) کے ایک وسیع سلسلے کے لیے ایک واحد فاؤنڈیشن ماڈل میں تبدیل کر دیتا ہے۔ اس کا دعویٰ سادہ ہے: ایک ویڈیو جنریٹر جو پہلے سے ہی جانتا ہے کہ اشیاء کیسے حرکت کرتی ہیں اور ایک دوسرے کے ساتھ کیسے تعامل کرتی ہیں، اسے ہر کام کے لیے الگ نیٹ ورک بنانے کے بجائے ڈیپتھ (depth)، سطح کے نارملز (surface normals)، سیگمنٹیشن ماسک (segmentation masks) اور 3D پوز (pose) کی پیش گوئی کے لیے استعمال کیا جا سکتا ہے۔
بکھرے ہوئے ویژن پائپ لائنز سے ایک متحد ماڈل تک
بڑے لینگویج ماڈلز (Large language models) اگلے لفظ کی پیش گوئی کرنا سیکھ کر ہمہ گیر بن گئے۔ اس کے برعکس، کمپیوٹر ویژن کی تحقیق اب بھی ماہرانہ نظاموں کے گرد گھومتی ہے—سیگمنٹیشن کے لیے ایک، ڈیپتھ کے لیے دوسرا، اور پوز کے لیے ایک اور۔ GenCeption اس patchwork (ٹکڑوں میں بکھرے نظام) کو ختم کر دیتا ہے۔ ایک ٹیکسٹ پرامپٹ ماڈل کو بتاتا ہے کہ اسے کون سا آؤٹ پٹ تیار کرنا ہے، اور وہی 14-بلین پیرامیٹر والا آرکیٹیکچر ڈیپتھ میپس، نارمل میپس، سیگمنٹیشن ماسک یا کی پوائنٹ (keypoint) کی پیش گوئیاں فراہم کرتا ہے۔ ہر آؤٹ پٹ کو ایک معیاری تھری-چینل RGB امیج کے طور پر استعمال کرتے ہوئے، یہ سسٹم پائپ لائن کو یکساں رکھتا ہے؛ ان کاموں کے لیے جو قدرتی طور پر تصاویر پیدا نہیں کرتے، محققین نے چھوٹے قابلِ تربیت ماڈیولز (trainable modules) شامل کیے ہیں۔
ایک انتہائی چھوٹے مصنوعی ڈیٹا سیٹ پر تربیت
ٹیم نے Blender میں ایک مصنوعی ڈیٹا سیٹ تیار کیا، جس میں 200 موشن-کیپچر سیکوئنسز کے ذریعے چلنے والے 800 ڈیجیٹل ہیومن ماڈلز سے 7,500 مختصر ویڈیوز تیار کی گئیں۔ روایتی ویڈیو جنریشن ماڈلز جیسے کہ D4RT یا VGGT Omega لاکھوں کلپس پر تربیت حاصل کرتے ہیں؛ GenCeption اس ڈیٹا کے ساتویں حصے سے لے کر پچاسویں حصے کے درمیان استعمال کرتے ہوئے اسی کے برابر یا اس سے بہتر کارکردگی حاصل کر لیتا ہے۔ رپورٹ شدہ بینچ مارکس میں شامل ہیں:
- DepthAnything 3 جیسے مخصوص ماڈلز کے برابر ڈیپتھ کا تخمینہ (Depth estimation)۔
- سطح کے نارمل کی پیش گوئی (Surface-normal prediction) جو NormalCrafter اور Lotus-2 سے بہتر ہے۔
- 3D پوز کی شناخت جو Genmo اور TRAM سے آگے ہے۔
- زبان کے ذریعے رہنمائی شدہ سیگمنٹیشن (Language-guided segmentation) جو Meta کے SAM 3 اور Gemini 3.5 Flash کی مجموعی طاقت کے برابر ہے۔
مصنفین کا کہنا ہے کہ جنریٹیو مقصد نیٹ ورک کو منظر کی جیومیٹری اور فزکس کو اندرونی طور پر سمجھنے پر مجبور کرتا ہے، جو بعد میں دیگر ادراک کے کاموں (downstream perception tasks) میں منتقل ہو جاتا ہے۔
رفتار کے لیے آرکیٹیکچرل شارٹ کٹس
GenCeption، Alibaba کے اوپن سورس Wan2.1 ویڈیو ماڈل پر مبنی ہے۔ کئی تکراروں (iterations) کے ذریعے فریموں کو بہتر بنانے والے عام ڈیفیوژن عمل کے بجائے، محققین نے سسٹم کو اس طرح دوبارہ ترتیب دیا ہے کہ یہ ایک ہی فارورڈ پاس (forward pass) میں پیش گوئی جاری کر سکے۔ نتیجہ: ماڈل موجودہ ہارڈ ویئر پر تقریباً دس سیکنڈ میں 81 فریمز والی کلپ کو پروسیس کرتا ہے۔ 14-بلین پیرامیٹر کا سائز اب بھی بڑا ہے، لیکن تربیت میں بچت اور متعدد کاموں کے لیے مخصوص نیٹ ورکس کے خاتمے سے کارکردگی میں نمایاں اضافہ ہوتا ہے۔
AI کمیونٹی کو اس پر توجہ کیوں دینی چاہیے
اگر ایک ویڈیو جنریٹر 'ورلڈ ماڈل' (world model) کے طور پر بھی کام کر سکتا ہے—یعنی ایک ایسی نمائندگی جو یہ بیان کرے کہ اشیاء کس طرح جگہ گھیرتی ہیں اور وقت کے ساتھ کیسے حرکت کرتی ہیں—تو بصری AI میں اگلی بڑی چھلانگ ڈیٹا سیٹس کو مزید بڑا کرنے کے بجائے جنریٹیو صلاحیتوں کو بڑھانے سے آ سکتی ہے۔ ایک واحد، پرامپٹ پر مبنی ماڈل پروڈکٹ پائپ لائنز کو سادہ بنا سکتا ہے، انجینئرنگ کے اخراجات کو کم کر سکتا ہے، اور ان ڈویلپرز کے لیے رکاوٹیں دور کر سکتا ہے جنہیں ویژن فیچرز کی ضرورت ہے لیکن ان کے پاس متعدد ماہرانہ نیٹ ورکس کی تربیت کے لیے وسائل نہیں ہیں۔
احتیاطی تدابیر اور ان کہے سوالات
کارکردگی کے اعداد و شمار مصنوعی ڈیٹا اور بینچ مارک سویٹس سے لیے گئے ہیں جو شاید حقیقی دنیا کے فوٹیج کی پیچیدگیوں کی عکاسی نہ کریں۔ غیر منظم روشنی، موسم یا کیمرہ موشن کے ساتھ اس کی عمومی کارکردگی (Generalisation) ابھی ثابت نہیں ہے۔ 81 فریمز والی کلپ کے لیے دس سیکنڈ کا انفرنس (inference)، اگرچہ تکراری ڈیفیوژن سے تیز ہے، لیکن روبوٹکس یا AR کے لیے ریئل ٹائم سے اب بھی بہت دور ہے۔ مزید برآں، ماڈل کے 14-بلین پیرامیٹرز کی تعیناتی کے لیے ایک بڑے کمپیوٹ بجٹ کی ضرورت ہے، جو فنڈز یافتہ لیبارٹریوں سے باہر اس تک رسائی کو محدود کر سکتا ہے۔
آگے کیا دیکھنا ہے
- حقیقی دنیا میں تصدیق: ایسے مطالعے جو GenCeption کا آؤٹ ڈور ڈرائیونگ ویڈیوز، ہاتھ سے پکڑے گئے فون کے فوٹیج، یا صنعتی معائنہ کے مناظر پر تجربہ کریں۔
- ماڈل اسکیلنگ: کیا بڑے یا زیادہ مؤثر طریقے سے تربیت یافتہ ورژن ڈیٹا کی کارکردگی کو برقرار رکھتے ہوئے لیٹنسی (latency) کے فرق کو ختم کر سکتے ہیں۔
- انٹیگریشن کے راستے: کلاؤڈ فراہم کنندگان یا ایج-AI پلیٹ فارمز کس طرح ایک واحد API پیش کر سکتے ہیں جو ٹیکسٹ پر مبنی کام کی تفصیل قبول کرے اور مناسب بصری آؤٹ پٹ فراہم کرے۔
- متبادل تربیت کے ذرائع: مضبوطی (robustness) کو بہتر بنانے کے لیے مصنوعی کلپس کو معمولی مقدار میں حقیقی ویڈیو کے ساتھ ملانے کی کوششیں۔
خلاصہ
GenCeption ظاہر کرتا ہے کہ ایک ویڈیو جنریشن انجن ایک ملٹی ٹاسک ویژن فاؤنڈیشن ماڈل کے طور پر بھی کام کر سکتا ہے، جو روایتی طریقوں کے مقابلے میں کئی گنا چھوٹے ڈیٹا سیٹ سے سیکھتے ہوئے جدید ترین ڈیپتھ، نارملز، پوز اور سیگمنٹیشن فراہم کرتا ہے۔ اس کا وعدہ ماہر نیٹ ورکس کے ایک وسیع مجموعے کو ایک پرامپٹ پر مبنی نظام میں یکجا کرنے میں ہے؛ اس کا اگلا امتحان یہ ہوگا کہ آیا یہ وعدہ مصنوعی لیبز سے نکل کر باہر کی غیر متوقع دنیا میں برقرار رہ پاتا ہے یا نہیں۔
