Google DeepMind הכריזה על GenCeption, מודל שהופך מחולל טקסט-לווידאו למודל יסוד (foundation model) יחיד למגוון משימות ראייה (vision tasks), תוך שימוש ב-7,500 סרטוני וידאו סינתטיים בלבד. הטענה היא פשוטה: מחולל וידאו שכבר יודע כיצד אובייקטים נעים ומתקשרים ביניהם יכול לשמש למטרות אחרות כדי לחזות עומק, נורמלים של משטחים (surface normals), מסיכות סגמנטציה (segmentation masks) ותנוחה בתלת-ממד (3D pose), מבלי לבנות רשת נפרדת לכל אחת מהן.
מצינורות עיבוד ראייה מקוטעים למודל מאוחד
מודלי שפה גדולים (LLMs) הפכו לוורסטיליים על ידי למידה של חיזוי המילה הבאה. מחקר בתחום הראייה הממוחשבת, לעומת זאת, עדיין מתמודד עם מערכות מומחיות – אחת לסגמנטציה, אחרת לעומק, ועוד אחת לתנוחה. GenCeption מדלגת על הטלאים הללו. הנחיה טקסטואלית (text prompt) אומרת למודל איזה פלט להפיק, וארכיטקטורה זהה בעלת 14 מיליארד פרמטרים מספקת מפות עומק, מפות נורמלים, מסיכות סגמנטציה או תחזיות נקודות מפתח (keypoints). על ידי התייחסות לכל פלט כתמונת RGB סטנדרטית בעלת שלושה ערוצים, המערכת שומרת על צינור עיבוד (pipeline) אחיד; עבור משימות שאינן מייצרות תמונות באופן טבעי, החוקרים הוסיפו מודולים קטנים הניתנים לאימון.
אימון על קורפוס סינתטי זעיר
הצוות בנה מערך נתונים סינתטי ב-Blender, תוך רינדור של 7,500 סרטונים קצרים מתוך 800 מודלים של בני אדם דיגיטליים המונעים על ידי 200 רצפי לכידת תנועה (motion-capture). מודלים מסורתיים ליצירת וידאו, כגון D4RT או VGGT Omega, מתאמנים על מיליוני קליפים; GenCeption משיג ביצועים דומים או טובים יותר תוך צריכת בין שביעית לחמש מאותית מכמות הנתונים הזו. מדדי הביצוע (benchmarks) שדווחו כוללים:
- הערכת עומק השווה למודלים ייעודיים כמו DepthAnything 3.
- חיזוי נורמלים של משטחים (surface-normal) שעוקף את NormalCrafter ו-Lotus-2.
- זיהוי תנוחה בתלת-ממד (3D pose) שעולה על Genmo ו-TRAM.
- סגמנטציה מונחית שפה התואמת את העוצמה המשולבת של SAM 3 של Meta ו-Gemini 3.5 Flash.
המחברים מציינים כי היעד הגנרטיבי מאלץ את הרשת להפנים את הגיאומטריה והפיזיקה של הסצנה, מה שמועבר לאחר מכן למשימות תפיסה (perception) המשך.
קיצורי דרך ארכיטקטוניים למהירות
GenCeption מתבסס על מודל הווידאו בקוד פתוח Wan2.1 של Alibaba. במקום תהליך הדיפוזיה (diffusion) הרגיל המשפר פריימים לאורך איטרציות רבות, החוקרים תכננו מחדש את המערכת כך שתפיק תחזית במעבר קדימה (forward pass) יחיד. התוצאה: המודל מעבד קליפ של 81 פריימים בערך בעשר שניות על חומרה קיימת. הגודל של 14 מיליארד פרמטרים נותר גדול, אך החיסכון באימון והביטול של רשתות מרובות ייעודיות למשימות מסוימות מספקים שיפור משמעותי ביעילות.
מדוע קהילת ה-AI צריכה לשים לב
אם מחולל וידאו יכול לשמש גם כ"מודל עולם" (world model) – ייצוג הלוכד כיצד אובייקטים תופסים מרחב ונעים לאורך זמן – הרי שהקפיצה הבאה בבינה מלאכותית חזותית עשויה להגיע מהרחבת היכולות הגנרטיביות ולא מתיעוד (annotation) של מערכי נתונים גדולים יותר ויותר. מודל יחיד מונחה הנחיות יכול לפשט צינורות מוצר, לצמצם הוצאות הנדסיות ולהוריד את רף הכניסה למפתחים הזקוקים לתכונות ראייה אך חסרים משאבים לאימון רשתות מומחיות מרובות.
סייגים ושאלות ללא מענה
נתוני הביצועים מגיעים מנתונים סינתטיים וממערכי בדיקה שעשויים שלא לשקף את המורכבות של צילומים מהעולם האמיתי. יכולת ההכללה לתאורה לא מבוקרת, מזג אוויר או תנועת מצלמה נותרה בלתי מוכחת. זמן הסקה (inference) של עשר שניות לקליפ של 81 פריימים, למרות שהוא מהיר יותר מדיפוזיה איטרטיבית, עדיין רחוק מלהיות בזמן אמת עבור רובוטיקה או AR. יתרה מכך, 14 מיליארד הפרמטרים של המודל דורשים תקציב מחשוב משמעותי לפריסה, מה שעלול להגביל את הנגישות מחוץ למעבדות ממומנות היטב.
מה כדאי לעקוב אחריו בהמשך
- תיקוף בעולם האמיתי: מחקרים שיבחנו את GenCeption על סרטוני נהיגה בחוץ, צילומי טלפון ניידים או סצנות בדיקה תעש
GenCeption מראה כי מנוע ליצירת וידאו יכול לשמש גם כמודל יסוד ראייה רב-משימתי, המספק יכולות עומק, נורמלים, תנוחה וסגמנטציה ברמה הגבוהה ביותר, וכל זאת תוך למידה ממאגר נתונים קטן בכמה סדרי גודל מהגישות המסורתיות. ההבטחה שלה טמונה בצמצום "גן חיות" של רשתות מומחיות למערכת אחת מונחית פרומפטים; המבחן הבא שלה יהיה האם הבטחה זו תשרוד את המעבר ממעבדות סינתטיות אל העולם הבלתי צפוי שבחוץ.
