اے آئی سرچ ایجنٹس کیوں ناکام ہوتے ہیں: ابہام کا سنگین مسئلہ
جہاں ڈویلپرز اے آئی ایجنٹس کی استدلال کی گہرائی (reasoning depth) کو بہتر بنانے پر توجہ مرکوز کر رہے ہیں، وہیں خود مختار تحقیق میں اصل رکاوٹ سرچ کرنے کی صلاحیت نہیں بلکہ ابہام (ambiguity) کو سنبھالنے کی نااہلی ہے۔ ایک نئی تحقیق سے پتہ چلتا ہے کہ جدید ترین LLMs بھی رک کر وضاحت مانگنے میں دشواری محسوس کرتے ہیں، جس کے نتیجے میں طویل استدلال کے سلسلے میں اکثر ایک تباہ کن "غلطیوں کا سلسلہ" (error cascade) شروع ہو جاتا ہے۔
DiscoBench کی اہم پیش رفت
Tencent Hunyuan اور Tsinghua University کے محققین نے DiscoBench متعارف کرایا ہے، جو کہ ایک خصوصی ٹیسٹ فریم ورک ہے جسے اس بات کا جائزہ لینے کے لیے ڈیزائن کیا گیا ہے کہ لسانی ماڈلز مبہم، نامکمل یا غلط صارف کے سوالات کو کیسے سنبھالتے ہیں۔ GAIA یا BrowseComp جیسے پچھلے بینچ مارکس کے برعکس، جو مکمل طور پر درست پرامپٹس کا تصور کرتے ہیں، DiscoBench حقیقی دنیا کی افراتفری کی عکاسی کرتا ہے۔
اس فریم ورک میں گیارہ شعبوں—بشمول سائنس، سیاست اور موسیقی—کے 211 ٹاسک شامل ہیں، جن میں ابہام کے 463 مخصوص نکات موجود ہیں۔ ہر چیک پوائنٹ پر، ایک ایجنٹ کو یہ فیصلہ کرنا ہوتا ہے کہ آیا وہ تلاش جاری رکھے، جواب دے، یا سب سے اہم بات یہ کہ صارف سے وضاحت مانگے۔ انسانی تعامل کی نقل کرنے کے لیے، محققین نے Gemini 3 Flash کو ایک LLM پر مبنی صارف سیمولیٹر کے طور پر استعمال کیا تاکہ جب ایجنٹ کوئی معیاری فالو اپ سوال پوچھے تو اسے اشارے فراہم کیے جا سکیں۔
غلطیوں کا سلسلہ: زیادہ سرچ کرنا بہتر کیوں نہیں ہے
یہ تحقیق ایک خطرناک پیٹرن کی نشاندہی کرتی ہے: جب کوئی ایجنٹ کسی مبہم ہستی یا متضاد معیاروں کا سامنا کرتا ہے، تو وہ مدد مانگنے کے بجائے اکثر "زیادہ سخت تلاش" کرنے کا انتخاب کرتا ہے۔ اس سے ایک ایسا مظہر پیدا ہوتا ہے جہاں ماڈل صاف ستھرے اور قواعد کے مطابق درست سرچز تو کرتا ہے لیکن وہ بنیادی طور پر غلط سمت میں ہوتے ہیں۔
ڈیٹا ظاہر کرتا ہے کہ "زیادہ سرچ کرنا" درحقیقت درستگی کو کم کر سکتا ہے۔ "SearchHeavyGuess" پروفائل میں—جہاں ماڈلز بار بار سرچ کرتے ہیں لیکن وضاحت کرنے کے بجائے آخر کار اندازہ لگاتے ہیں—کامیابی کی شرح گر کر 51.9% رہ گئی۔ اس کے برعکس، وہ ماڈلز جنہوں نے "SearchThenAsk" حکمت عملی اپنائی، انہوں نے 93.4% کی بہت زیادہ کامیابی کی شرح حاصل کی۔ یہ ثابت کرتا ہے کہ ناکامی معلومات کے حصول کی کمی نہیں ہے، بلکہ مکالماتی ایجنسی (conversational agency) کی ناکامی ہے۔
صف اول کے ماڈلز کے کارکردگی کے بینچ مارکس
گیارہ اعلیٰ درجے کے ماڈلز کے ٹیسٹ سے ایک تلخ حقیقت سامنے آئی ہے: ابہام کا سامنا کرنے پر صنعت کے صف اول کے لیڈرز بھی 50% درستگی کی حد عبور کرنے کے لیے جدوجہد کرتے ہیں۔
- Doubao Seed 2.0 Pro نے 43.1% اینڈ ٹو اینڈ درستگی کے ساتھ سب سے آگے رہ کر قیادت کی۔
- Gemini 3.1 Pro Preview 40.8% کے ساتھ اس کے قریب رہا۔
- Claude Opus 4.7 نے 39.8% تک کامیابی حاصل کی، باوجود اس کے کہ اس کی چیک پوائنٹ پاس ریٹ (57%) زیادہ تھی۔
- Qwen3.6 Max اور MiniMax M2.7 بالترتیب 12.3% اور 16.1% کے ساتھ نمایاں طور پر پیچھے رہ گئے۔
دلچسپ بات یہ ہے کہ جب محققین نے ایک "Guided" سسٹم پرامپٹ فراہم کیا جس میں ماڈلز کو واضح طور پر ابہام پر نظر رکھنے کا کہا گیا، تب بھی اینڈ ٹو اینڈ درستگی میں صرف 28.6% سے 33.7% تک معمولی اضافہ ہوا۔ یہ اس بات کی نشاندہی کرتا ہے کہ ابہام کو "پہچاننا" اور "تعامل کے ذریعے اسے حل کرنے کا طریقہ جاننا" دو الگ الگ علمی مہارتیں ہیں۔
اے آئی کی دنیا کے لیے اثرات
یہ تحقیق ایجنٹک اے آئی کی ترقی کے مرکز کو تبدیل کرتی ہے۔ حقیقی طور پر قابل اعتماد خود مختار محققین بنانے کے لیے، صنعت کو "tool call" کی تعدد بڑھانے سے آگے بڑھ کر interactive reasoning (تعاملاتی استدلال) پر توجہ مرکوز کرنی ہوگی۔ LLM کی بہتری کے لیے اگلا مرحلہ صرف بہتر معلومات کی واپسی (retrieval) نہیں ہے—بلکہ پیچیدہ، کثیر مراحل والے کاموں کے دوران غلطیوں کو بڑھنے سے روکنے کے لیے بہتر "clarification logic" (وضاحت کی منطق) کی ترقی ہے۔
اہم نکات
- ابہام ناکامی کا بنیادی نقطہ ہے: اے آئی ایجنٹس اس لیے ناکام نہیں ہوتے کہ وہ معلومات تلاش نہیں کر سکتے، بلکہ اس لیے ناکام ہوتے ہیں کیونکہ جب کوئی سوال نامکمل ہو تو وہ وضاحت مانگنے میں ناکام رہتے ہیں۔
- "Search-Heavy" کا جال: غلط ہستی کے لیے بار بار تلاش کرنا غلطیوں کا ایک ایسا سلسلہ پیدا کرتا ہے جس سے نکلنا محض اندازہ لگانے کے مقابلے میں زیادہ مشکل ہوتا ہے۔
- پہچاننا $\neq$ حل کرنا: زیادہ ڈیٹیکشن اسکورز (غلطی کی نشاندہی کرنا) خود بخود زیادہ کامیابی کی شرح میں تبدیل نہیں ہوتے، جو اس بات کو اجاگر کرتا ہے کہ ماڈلز مکالماتی مسائل کے حل کو کس طرح سنبھالتے ہیں اس میں ایک فرق موجود ہے۔
