مدل‌های بینایی-زبان (VLMs) هنوز در انجام وظایف بصری ابتدایی ناتوان هستند. ارزیابی جدید PerceptionBench نشان داد که هیچ‌یک از شانزده سیستم پیشرو، دقت کلی بیش از ۶۰٪ ندارد و حتی قوی‌ترین آن‌ها نیز در هیچ مهارت انفرادی به دقت ۸۰٪ نمی‌رسد. این نتیجه به توسعه‌دهندگان هشدار می‌دهد که امتیازات بالا در آزمون‌های محبوب شرح‌نویسی (captioning) یا استدلال، تضمین‌کننده بینایی قابل‌اعتماد نیست.

چرا آزمون‌های موجود مشکل را پنهان می‌کنند

بیشتر بنچمارک‌های عمومی، توصیف تصویر، پاسخ‌گویی به سوالات و استدلال مبتنی بر دانش عمومی را با هم ترکیب می‌کنند. وقتی یک مدل شرح‌نویسی اشتباهی ارائه می‌دهد، این خطا می‌تواند ناشی از لغزش زبانی، خطای استدلال یا صرفاً ناتوانی در تشخیص شیء باشد. از آنجایی که این سه مؤلفه با هم درآمیخته‌اند، امتیاز پایین هیچ نشانه‌ای از کمبود بصری ارائه نمی‌دهد. بنابراین، تیم‌های سازنده اپلیکیشن‌ها با تکیه بر اعداد و ارقام برجسته، اعتماد به نفس کاذبی پیدا می‌کنند و تصور می‌کنند مدل به‌درستی «می‌بیند».

تفاوت PerceptionBench در چیست

PerceptionBench ده توانایی بصری را مجزا کرده و هر مدل را بر اساس مجموعه‌ای از وظایف «بینایی محض» ارزیابی می‌کند. این بنچمارک با حذف بخش‌های زبانی و استدلالی، نشان می‌دهد که بخش بصری (visual front-end) به تنهایی چقدر خوب عمل می‌کند. در تمامی موارد، شانزده VLM برتر از آستانه دقت ۶۰٪ پایین‌تر هستند و بهترین سیستم نیز در هیچ مهارت خاصی به دقت ۸۰٪ نمی‌رسد. توهم (Hallucination) — یعنی تولید جزئیاتی که در تصویر وجود ندارند — رایج‌ترین خطا است، در حالی که الگوی نقاط قوت و ضعف در مدل‌های مختلف بسیار متفاوت است.

چه کسانی متضرر می‌شوند

توسعه‌دهندگان نباید طبقه‌بندی‌کننده‌های بصری (visual classifiers) اختصاصی را با مدل‌های هوش مصنوعی عمومی جایگزین کنند.

جایی که استدلال دچار ضعف می‌شود

داده‌های PerceptionBench نشان‌دهنده بازدهی نزولی است: حتی بزرگ‌ترین مدل‌ها نیز همچنان در وظایف ادراکی پایه دچار لغزش می‌شوند.

گام‌های عملی برای توسعه‌دهندگان

  • طبقه‌بندی‌کننده‌های بصری اختصاصی را حفظ کنید برای وظایفی که نیاز به دقت بالا دارند؛ با VLMs به عنوان مکمل برخورد کنید، نه جایگزین.
  • یک لایه تأییدکننده اضافه کنید که خروجی‌های مدل را پیش از رسیدن به کاربر، با یک آشکارساز (detector) قابل‌اعتماد تطبیق دهد.
  • یک فیلتر بینایی سبک‌وزن مستقر کنید تا توهمات آشکار یا طبقه‌بندی‌های اشتباه را در مراحل اولیه فرآیند شناسایی کند.

ترکیب یک VLM همه‌منظوره با یک مؤلفه بیناییِ هدفمند، به تیم‌ها اجازه می‌دهد از توانایی‌های استدلالی مدل اول استفاده کنند و در عین حال، در برابر نقاط کور بصری آن محافظت کنند.

منبع: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1