یک آزمایش سریع نشان می‌دهد که موتورهای جستجوی هوش مصنوعی می‌توانند با اطمینان صحبت کنند، در حالی که به منابع از کار افتاده یا بی‌کیفیت استناد می‌کنند

یک بررسی ساده‌ی منشأ (provenance) روی سه ابزار جستجوی محبوب مبتنی بر هوش مصنوعی نشان داد که دو مورد از آن‌ها یا به لینک‌های از کار افتاده اشاره کرده‌اند و یا پاسخ‌های خود را با سایت‌های کم‌اعتبار پشتیبانی کرده‌اند؛ هرچند هر سه ابزار، متنِ با اعتمادبه‌نفس یکسان و ردیفی از «چیپس‌های» منبع (source chips) را نمایش می‌دادند.

آزمایشی که باعث غافلگیری شد

من یک سوال واقعی و جدید پرسیدم: «در قانون هوش مصنوعی اتحادیه اروپا در سال ۲۰۲۶ چه تغییری ایجاد شد؟» پاسخ در متن رسمی اصلاحیه وجود دارد، بنابراین یا آنجا هست یا نیست. من این پرسش را به سه موتور جستجوی هوش مصنوعی که استنادها را نمایش می‌دهند دادم: Perplexity، حالت هوش مصنوعی گوگل (Google’s AI mode) و Brave Search.

هر سه موتور، حقایق یکسانی را برگرداندند — تاریخ‌های یکسان، توضیحات یکسان — بنابراین از نظر صحتِ محض، با هم برابر بودند. تفاوت‌ها تنها زمانی آشکار شد که من منابع استناد شده را بررسی کردم.

چگونه کیفیت منابع را قضاوت کردم

من یک سیستم امتیازدهی سه‌سطحی ایجاد کردم که به هر استناد بر اساس نوع میزبان وزن می‌دهد:

  • اصلی (وزن ۳) – سایتی که واقعاً قانون را منتشر می‌کند (مثلاً ثبت رسمی اتحادیه اروپا).
  • رسمی (وزن ۲) – نهادی که قانون را صادر یا نظارت می‌کند (دامنه‌های دولتی، سایت‌های آژانس‌ها).
  • محتوای تولید شده توسط کاربر (UGC، وزن ۰) – پلتفرم‌هایی مانند YouTube یا Reddit.

امتیاز کلی هر موتور، میانگین وزنِ URLهایی است که نمایش داده است.

موتور جستجو منابع گزارش شده امتیاز
Perplexity دامنه‌های رسمی دولتی 2.00
Google AI mode شرکت‌های مشاوره و یک ویدئوی YouTube 1.00
Brave Search منبع اصلی 3.00

روی کاغذ، Brave عالی به نظر می‌رسید، Perplexity قابل قبول بود و Google عقب ماند.

شکست پنهان: لینک‌های از کار افتاده

نقشه‌ی سطوح فقط به نام دامنه نگاه می‌کند؛ اینکه آیا صفحه لینک‌شده واقعاً بارگذاری می‌شود یا خیر را تأیید نمی‌کند. من تمام URLها را دنبال کردم. استناد «اصلی» Brave یک بدنه خالی را برگرداند — لینک از کار افتاده بود. موتور ادعا می‌کرد که به قانون اشاره می‌کند، اما هیچ چیزی ارائه نداد.

Perplexity از دامنه‌های رسمی دولتی استفاده کرد.

Google از شرکت‌های مشاوره و یک ویدئوی YouTube استفاده کرد.

دو مشکل متمایز پدیدار شد:

  1. یک دامنه با کیفیت بالا، لزوماً بارگذاری شدن صفحه را تضمین نمی‌کند.
  2. یک خلاصه‌ی خوش‌ساخت می‌تواند توسط منابع کم‌اعتبار پشتیبانی شود.

رابط کاربری هر دو مشکل را پنهان می‌کند. هر سه ابزار، همان پاراگراف با اعتمادبه‌نفس و ردیفی یکنواخت از چیپس‌های منبع را ارائه می‌دهند، بدون اینکه هیچ نشانه بصری وجود داشته باشد که نشان دهد یک چیپس به صفحه‌ای از کار افتاده لینک شده یا دیگری به جای متن قانونی، به یک آموزش در YouTube اشاره دارد.

چرا منشأ (provenance) برای توسعه‌دهندگان اهمیت دارد

توسعه‌دهندگان می‌توانند منشأ را به یک معیار قابل آزمایش تبدیل کنند:

  • امتیازدهی به هر پاسخ با استفاده از وزن‌دهی سطحی مشابه آنچه در بالا ذکر شد.
  • اعتبارسنجی سلامت لینک‌ها به صورت خودکار؛ علامت‌گذاری پاسخ‌های خالی یا خطاهای HTTP.
  • فعال‌سازی هشدارها زمانی که امتیاز منشأ یک پاسخ از یک آستانه‌ی قابل تنظیم کمتر شود.

این رویکرد ملموس‌تر از تعقیب «توهمات» (hallucinations) است – مدل ممکن است جمله‌ای باورپذیر تولید کند، اما بررسی منشأ دقیقاً به شما می‌گوید که کدام استناد (یا نبودِ آن) باعث ایجاد مشکل شده است و امکان اصلاح هدفمند را فراهم می‌کند.

نتیجه‌گیری

یک آزمایش کوتاه روی منشأ نشان می‌دهد که موتورهای جستجوی هوش مصنوعی می‌توانند در عین استناد به منابع از کار افتاده یا بی‌کیفیت، مقتدر به نظر برسند. توسعه‌دهندگانی که به این موتورها اتکا می‌کنند، باید کیفیت استناد را به عنوان یک ویژگی قابل اندازه‌گیری در نظر بگیرند، نه یک تضمین مفروض، و بررسی‌های خودکار را در خط لوله‌های (pipelines) خود بگنجانند. تأیید اینکه یک منبع «اصلی» واقعاً بارگذاری می‌شود، می‌تواند مرز بین یک پاسخ قابل اعتماد و یک تله‌ی خاموشِ اطلاعات نادرست باشد.