ویژن لینگویج ماڈلز (VLMs) اب بھی بنیادی بصری کاموں میں ناکام رہتے ہیں۔ PerceptionBench کے ایک نئے جائزے سے معلوم ہوا ہے کہ سولہاں صف اول کے سسٹمز میں سے کوئی بھی مجموعی طور پر 60% درستگی سے تجاوز نہیں کرتا، اور یہاں تک کہ سب سے مضبوط سسٹم بھی کسی بھی انفرادی مہارت پر 80% سے نیچے رہتا ہے۔ یہ نتیجہ ڈویلپرز کو خبردار کرتا ہے کہ مقبول کیپشننگ یا ریژوننگ (reasoning) ٹیسٹوں پر زیادہ اسکور قابل اعتماد بصارت کی ضمانت نہیں دیتے۔

موجودہ ٹیسٹ اس مسئلے کو کیوں چھپاتے ہیں

زیادہ تر عوامی بینچ مارکس (benchmarks) تصویر کی وضاحت، سوال و جواب اور عام فہم استدلال (commonsense reasoning) کو ملا دیتے ہیں۔ جب کوئی ماڈل غلط کیپشن دیتا ہے، تو وہ غلطی زبان کی لغزش، استدلال کی غلطی، یا کسی چیز کو پہچاننے میں ناکامی ہو سکتی ہے۔ چونکہ یہ تینوں اجزاء آپس میں جڑے ہوئے ہیں، اس لیے کم اسکور بصری کمی کے بارے میں کوئی سراغ نہیں دیتا۔ اس لیے ایپلی کیشنز بنانے والی ٹیمیں ہیڈ لائن نمبروں سے ضرورت سے زیادہ اعتماد حاصل کر لیتی ہیں، یہ فرض کرتے ہوئے کہ ماڈل صحیح طور پر "دیکھ" رہا ہے۔

PerceptionBench کیا مختلف کرتا ہے

PerceptionBench دس بصری صلاحیتوں کو الگ کرتا ہے اور ہر ماڈل کا خالص بصری ٹاسک سیٹ پر جائزہ لیتا ہے۔ زبان اور استدلال کو ہٹا کر، یہ بینچ مارک دکھاتا ہے کہ بصری فرنٹ اینڈ (visual front-end) اکیلے کتنی اچھی طرح کام کرتا ہے۔ مجموعی طور پر، سولہاں بہترین VLMs 60% درستگی کی حد سے پیچھے رہ جاتے ہیں، اور بہترین کارکردگی دکھانے والا سسٹم بھی کسی بھی ایک مہارت پر 80% تک نہیں پہنچ پاتا۔ ہالوسینیشن (Hallucination)—یعنی ایسی تفصیلات پیدا کرنا جو تصویر میں موجود نہ ہوں—سب سے عام غلطی ہے، جبکہ طاقت اور کمزوریوں کا نمونہ مختلف ماڈلز کے درمیان کافی مختلف ہے۔

کس کا نقصان ہو سکتا ہے

ڈویلپرز کو مخصوص بصری کلاسیفائرز (visual classifiers) کو عام AI ماڈلز سے تبدیل نہیں کرنا چاہیے۔

جہاں دلیل کمزور پڑتی ہے

PerceptionBench کا ڈیٹا بتاتا ہے کہ نتائج میں کمی آ رہی ہے: بڑے سے بڑے ماڈلز بھی اب بھی بنیادی ادراک (perception) کے کاموں میں لڑکھڑا جاتے ہیں۔

ڈویلپرز کے لیے عملی اقدامات

  • مخصوص بصری کلاسیفائرز (visual classifiers) برقرار رکھیں ان کاموں کے لیے جن میں درستگی کی ضرورت ہو؛ VLMs کو متبادل کے بجائے ایک معاون کے طور پر استعمال کریں۔
  • تصدیقی تہہ (verification layer) شامل کریں جو صارف تک پہنچنے سے پہلے ماڈل کے نتائج کو ایک قابل اعتماد ڈیٹیکٹر کے ساتھ کراس چیک کرے۔
  • ایک ہلکا پھلکا ویژن فلٹر (vision filter) نافذ کریں تاکہ پائپ لائن کے آغاز میں ہی واضح ہالوسینیشن یا غلط کلاسیفیکیشن کو پکڑا جا سکے۔

ایک عام مقصد کے لیے بنائے گئے VLM کو خاص مقصد کے لیے بنائے گئے ویژن کمپوننٹ کے ساتھ جوڑنے سے ٹیمیں پہلے والے کی استدلال کی صلاحیتوں کو استعمال کر سکتی ہیں جبکہ اس کے بصری اندھے پن (blind spots) سے بچ سکتی ہیں۔

ماخذ: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1