دس بڑے لینگویج ماڈلز (LLMs) سے جب رومانیہ میں شادی کی انگوٹھی بنانے والے بہترین لگژری جیولری برانڈز کے بارے میں پوچھا گیا، تو انہوں نے 29 مختلف برانڈز کے نام بتائے، اور کوئی بھی برانڈ ہر جواب میں شامل نہیں تھا۔ یہ پھیلاؤ ظاہر کرتا ہے کہ جنریٹیو AI کے درمیان "اتفاقِ رائے" حقیقت سے زیادہ ایک افسانہ ہے، خاص طور پر ان مخصوص (niche) سوالات کے لیے جن پر کاروبار اپنی دھاک بٹھانا چاہتے ہیں۔

یہ ٹیسٹ کیوں اہم ہے

ڈویلپرز اکثر یہ فرض کرتے ہوئے AI پر مبنی سرچ یا سفارش (recommendation) کے فیچرز بناتے ہیں کہ مختلف ماڈلز ایک ہی حقائق پر متفق ہوں گے۔ اگر کسی برانڈ کی موجودگی کا انحصار صرف ایک AI کے آؤٹ پٹ پر ہو، تو ایک مختلف جواب کہیں اور اس کی موجودگی کو ختم کر سکتا ہے۔ یہ تجربہ ثابت کرتا ہے کہ یہ مفروضہ کمزور ہے اور اس بات پر روشنی ڈالتا ہے کہ ہر ماڈل کا ڈیٹا پائپ لائن (data pipeline) خود ماڈل کی طرح ہی اہمیت رکھتا ہے۔

تجربے کا مختصر جائزہ

  • ماڈلز: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM اور Qwen۔
  • پرامپٹ (Prompt): "مجھے رومانیہ میں شادی کی انگوٹھیوں کے لیے ٹاپ-5 لگژری جیولری برانڈز کی فہرست دیں۔" کسی برانڈ کا اشارہ نہیں دیا گیا، ہر ماڈل کے لیے ایک نیا سیشن استعمال کیا گیا۔
  • اسலாٹس (Slots): 10 ماڈلز × 5 پوزیشنز = کل 50 سفارشات۔

نمایاں اعداد و شمار

  • 29 منفرد برانڈز نے 50 اسலாٹس کو پُر کیا۔
  • ان برانڈز میں سے 66% صرف ایک ماڈل کے جواب میں نظر آئے۔
  • کسی بھی دو ماڈلز کے درمیان اوسط اوورلیپ (overlap) 18% تھا۔
  • تمام دس ماڈلز نے کسی بھی برانڈ کا ذکر نہیں کیا۔

کون سب سے زیادہ نظر آیا؟

| برانڈ | ماڈلز میں نظر