בשנים האחרונות שלטו במרכז מערכות AI היוצרות תמונות. פחות זוהר, אך ככל הנראה קשה יותר, הוא האתגר של ללמד מכונות להבין באמת את מה שהן רואות. יצירת דיוקן פוטו-ריאליסטי היא מרשימה, אך לבקש מ-AI לקרוא את תווית האזהרה בדיוקן הזה, לומר לך היכן האובייקט ממוקם ביחס לרקע, ואז לענות על שאלה לוגית לגבי הסצנה, נותר בעיה הנדסית קשה באמת. Qwen-Image, מודל vision-language חדש שפורט בדו"ח טכני שנערך לאחרונה, נכנס לתחום זה עם מטרה ספציפית: להתקדם מעבר לתיאור ברמת השטח ולעבד מידע חזותי וטקסטואלי כזרם מאוחד אחד.
מה Qwen-Image עושה אחרת
רוב מערכות הראייה המוקדמות ניגשות לתמונה כפי שצופה מזדמן עשוי להעיף מבט בפוסטר. הן מזהות את הנושא העיקרי, מצמידות כיתוב גנרי וממשיכות הלאה. תמונה של פינת רחוב עמוסה הופכת פשוט ל"מכוניות והולכי רגל על כביש". רמת פלט כזו שימושית למיון אלבומי תמונות, אך היא קורסת במהירות כשצריך דיוק.
Qwen-Image נבנה כדי ללכת רחוק יותר. במקום להתייחס לזיהוי תמונה ולהבנת שפה כמשימות נפרדות שנתפרו יחד, הוא מטפל בנתונים חזותיים ובטקסט יחד מההתחלה. לעיבוד מאוחד זה יש חשיבות מכיוון שהוא מאפשר למודל לעגן את השפה במה שהוא באמת רואה, במקום לנחש על בסיס סקיצה גסה של הסצנה. כאשר המודל מצמיד כיתוב לתמונה, עונה על שאלה או קורא טקסט המוטמע בתצלום, הוא נשען על אותו ייצוג משותף של הקלט החזותי.
ארבע יכולות ששווה לשים לב אליהן
הדו"ח הטכני מדגיש ארבע חוזקות ספציפיות המבדילות את Qwen-Image ממודלים שרק מתייגים אובייקטים.
כיתוב תמונות בדיוק גבוה. כיתוב שימושי הוא יותר מרשימה של אובייקטים. הוא לוכד הקשר, פעולה ומערכות יחסים. בפועל, המשמעות היא הבחנה בין תצלום של שף שחותך ירקות באופן פעיל לבין צילום סטטי של מרכיבים על השיש. עבור מפתחים שבונים מודרטורים של תוכן, כלי נגישות או מחוללי מטא-דאטה אוטומטיים, שכבת הדיוק התיאורית הנוספת הזו מקצרת את זמן הבדיקה הידנית ומפחיתה שגיאות.
זיהוי טקסט חזק בתוך תמונות. משימות חזותיות רבות בעולם האמיתי דורשות קריאת מילים המופיעות באופן טבעי בתצלומים. חשבו על שלטי חנויות שצולמו בזוויות מוזרות, צילומי מסך של הודעות שגיאה, הערות בכתב יד או מסמכים מודפסים שצולמו במצלמת טלפון. מודל שיכול לחלץ ולהבין את הטקסט הזה באופן אמין, מבלי לדרוש pipeline נפרד של OCR, מפשט את ארכיטקטורת האפליקציה באופן משמעותי. מפתחים כבר לא צריכים "להלביש" קורא חיצוני ולקוות ששתי המערכות יסכימו על מה שהתמונה מכילה.
שיפור ההסקה עבור שאלות חזותיות. מענה על שאלה לגבי תמונה הוא קל כאשר התשובה גלויה ממש לעין, כמו "מה הצבע של הכדור?". שאלות קשות יותר דורשות לוגיקה: השוואת כמויות, מעקב אחר שינויים לאורך רצף, או הסקת תפקוד מתוך המראה. טכנאי תחזוקה עשוי לשאול האם קבל מסוים נראה יושב במקומו כראוי, או קונה עשוי לשאול איזה משני המוצרים הוא בעל תאריך תפוגה טוב יותר על סמך תמונה. Qwen-Image מטפל במשימות חזותיות מורכבות אלו בדיוק רב יותר ממודלים שרק מתאימים מילות מפתח לאזורים בתמונה.
הבנה טובה יותר של יחסים מרחביים. הראייה האנושית היא מרחבית עמוקה. אנחנו מבינים באופן מיידי שהספל נמצא מאחורי מכסה הלפטופ, או שהאופניים נמצאים בין הגדר לשפה. מכונות מתקשות לעיתים קרובות עם "משמאל ל-", "מתחת ל-" או "מוסתר חלקית על ידי", במיוחד כשהסצנה עמוסה. יכולת הסקה מרחבית חזקה יותר הופכת מודל ראייה לשימושי הרבה יותר עבור ניווט רובוטי, מערכות מלאי במחסנים, שכבות מציאות רבודה וכל אפליקציה שבה הסידור הפיזי של האובייקטים נושא משמעות.
צמצום הפער בין ראייה להבנה
קיים מרחק גדול בין זיהוי פיקסלים גולמי לבין הבנה אמיתית. מצלמת אבטחה יכולה "לראות" רצפת מחסן במובן זה שהיא מקליטה פוטונים, אך הבנה שמשטח (pallet) הוזז, ששלט אזהרה מוסתר כעת, וששאלה של עובד לגבי גובה המעבר יכולה להיענות על ידי קריאת התווית על המדף הקרוב ביותר, דורשת משהו מתוחכם יותר.
החוקרים שעומדים מאחורי Qwen-Image תכננו אותו במיוחד כדי לגשר על הפער הזה. על ידי איחוד עיבוד ראייה ושפה, המודל שואף לספק סוג של הבנה מבוססת (grounded understanding) שהופכת את הראייה הממוחשבת לפרקטית עבור תהליכי עבודה מורכבים, במקום להיות מוגבלת להדגמות בסיסיות בלבד.
למה מדדי ביצוע (Benchmarks) חשובים למפתחים
זה דבר אחד להציג הדגמה של מודל על דוגמאות שנבחרו בקפידה. זה דבר אחר לגמרי לפרוס אותו בסביבת ייצור (production), שבה משתמשים מעלים תמונות מטושטשות, עם תאורה דלה או עם קומפוזיציה מוזרה. הדו"ח מציין כי Qwen-Image מציג ביצועים טובים במדדי ביצוע סטנדרטיים. מדדים אלו חשובים מכיוון שהם חושפים את המודלים לסוגי תמונות מגוונים, לדוגמאות אדברסריות (adversarial examples) ולפורמטים שונים של שאלות תחת תנאים מבוקרים.
עבור מפתחים, ביצועים יציבים במדדי ביצוע מתרגמים לצפיות (predictability). המשמעות היא פחות כשלים מפתיעים כאשר התאורה משתנה, כאשר טקסט מופיע בגופן בלתי צפוי, או כאשר משתמש שואל שאלה הדורשת שרשור של מספר עובדות ויזואליות. כשבוחרים מודל בסיס (foundation model) עבור אפליקציית ראייה ממוחשבת, האמינות הזו לרוב חשובה יותר מתכונות נוצצות.
השורה התחתונה
אין מחסור במודלים שיכולים להסתכל על תמונה ולהגיד משהו עליה. המודלים המועילים הם אלו שקוראים את הטקסט בתוך הפריים, מנתחים שאלות מורכבות, מתארים פריסות מרחביות (spatial layouts) בצורה מדויקת ומפיקים כיתובים (captions) שבאמת משקפים את מה שקורה. נראה ש-Qwen-Image נבנה בדיוק עבור הקטגוריה השנייה הזו של עבודה.
אם אתם מעריכים מודלים של ראייה-שפה עבור פרויקט ייצור, הדו"ח הטכני המלא מכיל את המתודולוגיה, פרטי מערך הנתונים (dataset) ותוצאות הבדיקה שתזדקקו להן כדי לבצע השוואה מושכלת. תוכלו לקרוא את הדו"ח המלא כאן. אם תרצו לדון בפיתוחים הללו עם בונים וחוקרים אחרים, קהילת הלמידה של GyaanSetu פתוחה בפניכם.
