מודלים של ראייה-שפה (VLMs) עדיין מחטיאים את המטרה במשימות חזותיות בסיסיות. הערכה חדשה של PerceptionBench מצאה שאף אחת מ-16 המערכות המובילות אינה עולה על 60% דיוק כולל, ואפילו החזקה שבהן נשארת מתחת ל-80% בכל מיומנות בודדת. התוצאה מזהירה מפתחים לכך שציונים גבוהים במבחני תיאור (captioning) או הסקה (reasoning) פופולריים אינם מבטיחים ראייה אמינה.
מדוע המבחנים הקיימים מסתירים את הבעיה
רוב מדדי הביצועים (benchmarks) הציבוריים מערבבים תיאור תמונה, מענה על שאלות והסקה מבוססת שכל ישר. כאשר מודל פולט תיאור (caption) שגוי, הטעות יכולה להיות שגיאת שפה, שגיאת הסקה, או פשוט כישלון בזיהוי האובייקט. מכיוון ששלושת המרכיבים הללו שזורים זה בזה, ציון נמוך אינו מספק רמז לגבי החסר החזותי. לכן, צוותים המפתחים אפליקציות מקבלים ביטחון מופרז ממספרי הכותרות, מתוך הנחה שהמודל "רואה" בצורה נכונה.
מה PerceptionBench עושה אחרת
PerceptionBench מבודד עשר יכולות חזותיות ומעריך כל מודל על סט משימות של ראייה טהורה. על ידי הסרת השפה וההסקה, מדד הביצועים מראה עד כמה הממשק החזותי (visual front-end) עובד היטב בפני עצמו. באופן גורף, 16 ה-VLMs המובילים אינם מגיעים לסף דיוק של 60%, והמערכת בעלת הביצועים הטובים ביותר לעולם אינה מגיעה ל-80% באף מיומנות בודדת. הזיה (Hallucination) — יצירת פרטים שאינם מופיעים בתמונה — היא השגיאה הנפוצה ביותר, בעוד שתבנית החוזקות והחולשות משתנה במידה רבה בין המודלים.
מי עלול להפסיד
מפתחים לא צריכים להחליף מסווגים חזותיים ייעודיים במודלים כלליים של בינה מלאכותית.
היכן הטיעון נחלש
הנתונים של PerceptionBench מראים תשואה פוחתת: אפילו המודלים הגדולים ביותר עדיין נתקלים בקשיים במשימות תפיסה בסיסיות.
צעדים מעשיים למפתחים
- שמרו על מסווגים חזותיים ייעודיים למשימות הדורשות דיוק; התייחסו ל-VLMs כאל תוספת ולא כתחליף.
- הוסיפו שכבת אימות שתבצע הצלבה של פלטי המודל מול גלאי מהימן לפני שהם מגיעים למשתמש.
- הטמיעו מסנן ראייה קל משקל כדי לתפוס הזיות ברורות או סיווגים שגויים בשלב מוקדם של תהליך העבודה (pipeline).
שילוב של VLM רב-תכליתי עם רכיב ראייה שנבנה למטרה ספציפית מאפשר לצוותים להשתמש ביכולות ההסקה של הראשון, תוך הגנה מפני נקודות העיוורון החזותיות שלו.
מקור: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
