مدلهای بینایی-زبان (VLMs) هنوز در انجام وظایف بصری ابتدایی ناتوان هستند. ارزیابی جدید PerceptionBench نشان داد که هیچیک از شانزده سیستم پیشرو، دقت کلی بیش از ۶۰٪ ندارد و حتی قویترین آنها نیز در هیچ مهارت انفرادی به دقت ۸۰٪ نمیرسد. این نتیجه به توسعهدهندگان هشدار میدهد که امتیازات بالا در آزمونهای محبوب شرحنویسی (captioning) یا استدلال، تضمینکننده بینایی قابلاعتماد نیست.
چرا آزمونهای موجود مشکل را پنهان میکنند
بیشتر بنچمارکهای عمومی، توصیف تصویر، پاسخگویی به سوالات و استدلال مبتنی بر دانش عمومی را با هم ترکیب میکنند. وقتی یک مدل شرحنویسی اشتباهی ارائه میدهد، این خطا میتواند ناشی از لغزش زبانی، خطای استدلال یا صرفاً ناتوانی در تشخیص شیء باشد. از آنجایی که این سه مؤلفه با هم درآمیختهاند، امتیاز پایین هیچ نشانهای از کمبود بصری ارائه نمیدهد. بنابراین، تیمهای سازنده اپلیکیشنها با تکیه بر اعداد و ارقام برجسته، اعتماد به نفس کاذبی پیدا میکنند و تصور میکنند مدل بهدرستی «میبیند».
تفاوت PerceptionBench در چیست
PerceptionBench ده توانایی بصری را مجزا کرده و هر مدل را بر اساس مجموعهای از وظایف «بینایی محض» ارزیابی میکند. این بنچمارک با حذف بخشهای زبانی و استدلالی، نشان میدهد که بخش بصری (visual front-end) به تنهایی چقدر خوب عمل میکند. در تمامی موارد، شانزده VLM برتر از آستانه دقت ۶۰٪ پایینتر هستند و بهترین سیستم نیز در هیچ مهارت خاصی به دقت ۸۰٪ نمیرسد. توهم (Hallucination) — یعنی تولید جزئیاتی که در تصویر وجود ندارند — رایجترین خطا است، در حالی که الگوی نقاط قوت و ضعف در مدلهای مختلف بسیار متفاوت است.
چه کسانی متضرر میشوند
توسعهدهندگان نباید طبقهبندیکنندههای بصری (visual classifiers) اختصاصی را با مدلهای هوش مصنوعی عمومی جایگزین کنند.
جایی که استدلال دچار ضعف میشود
دادههای PerceptionBench نشاندهنده بازدهی نزولی است: حتی بزرگترین مدلها نیز همچنان در وظایف ادراکی پایه دچار لغزش میشوند.
گامهای عملی برای توسعهدهندگان
- طبقهبندیکنندههای بصری اختصاصی را حفظ کنید برای وظایفی که نیاز به دقت بالا دارند؛ با VLMs به عنوان مکمل برخورد کنید، نه جایگزین.
- یک لایه تأییدکننده اضافه کنید که خروجیهای مدل را پیش از رسیدن به کاربر، با یک آشکارساز (detector) قابلاعتماد تطبیق دهد.
- یک فیلتر بینایی سبکوزن مستقر کنید تا توهمات آشکار یا طبقهبندیهای اشتباه را در مراحل اولیه فرآیند شناسایی کند.
ترکیب یک VLM همهمنظوره با یک مؤلفه بیناییِ هدفمند، به تیمها اجازه میدهد از تواناییهای استدلالی مدل اول استفاده کنند و در عین حال، در برابر نقاط کور بصری آن محافظت کنند.
منبع: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
