ده مدل زبانی بزرگ (LLM) هنگام پاسخ به این سوال که بهترین سازندگان حلقه‌های ازدواج رومانیایی کدامند، ۲۹ برند متمایز جواهرات لوکس را نام بردند و هیچ برندی در تمام پاسخ‌ها تکرار نشد. این پراکندگی نشان می‌دهد که «اجماع» میان هوش مصنوعی‌های مولد بیشتر یک افسانه است تا واقعیت، به‌ویژه برای پرس‌وجوهای تخصصی که کسب‌وکارها امیدوارند بر آن‌ها تسلط یابند.

چرا این آزمایش اهمیت دارد

توسعه‌دهندگان اغلب ویژگی‌های جستجو یا پیشنهاددهنده مبتنی بر هوش مصنوعی را با این فرض می‌سازند که مدل‌های مختلف بر سر حقایق یکسان به توافق می‌رسند. اگر دیده شدن یک برند به خروجی یک هوش مصنوعی واحد وابسته باشد، یک پاسخ متفاوت می‌تواند آن حضور را در جاهای دیگر از بین ببرد. این آزمایش ثابت می‌کند که این فرض شکننده است و نشان می‌دهد که خط لوله داده‌های (data pipeline) هر مدل، به اندازه خود مدل اهمیت دارد.

خلاصه آزمایش

  • مدل‌ها: ChatGPT، Claude، Gemini، Copilot، Grok، Perplexity، DeepSeek، Kimi، GLM و Qwen.
  • دستور (Prompt): «یک لیست از ۵ برند برتر جواهرات لوکس در رومانی برای حلقه‌های ازدواج به من بده.» بدون هیچ اشاره‌ای به برندها، و با شروع یک نشست (session) تازه برای هر مدل.
  • جایگاه‌ها: ۱۰ مدل × ۵ موقعیت = ۵۰ پیشنهاد در مجموع.

اعداد قابل توجه

  • ۲۹ برند منحصربه‌فرد ۵۰ جایگاه را پر کردند.
  • ۶۶٪ از آن برندها تنها در پاسخ یک مدل ظاهر شدند.
  • میانگین هم‌پوشانی بین هر دو مدل ۱۸٪ بود.
  • هیچ برندی توسط هر ده مدل ذکر نشد.

چه برندهایی بیش از همه ظاهر شدند؟

برند در کدام مدل‌ها ظاهر شد
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini هر کدام ۳

برندهای TEILOR و Malvensky دارای نشانه‌گذاری اسکیما (schema markup) قوی و حضور مکرر در اخبار هستند که احتمالاً به آن‌ها کمک می‌کند در سیستم‌های مختلف ظاهر شوند.

آنچه داده‌ها به مهندسان می‌گویند

  • اجماع در بازارهای تخصصی یک توهم است. حتی مدل‌های با عملکرد بالا نیز زمانی که پرس‌وجو خاص باشد، تفاوت‌های فاحشی با هم دارند.
  • مدل‌های تقویت‌شده با جستجو متفاوت عمل می‌کنند. Microsoft Copilot که نتایج زنده وب را اضافه می‌کند، لیستی تولید کرد که با هیچ مدل دیگری هم‌پوشانی نداشت.
  • ردپای دیجیتال باعث دیده شدن می‌شود. برندهایی که روی داده‌های ساختاریافته و SEO سرمایه‌گذاری می‌کنند، بیشتر ظاهر می‌شوند، اما این مزیت در میان ارائه‌دهندگان مختلف هوش مصنوعی متفاوت است.

آنچه باید در آینده زیر نظر داشت

  • مدل‌های بازیابی ترکیبی (Hybrid retrieval models): با ترکیب مدل‌های زبانی مقیاس‌بزرگ با جستجوی بی‌درنگ (real-time search) توسط ارائه‌دهندگان بیشتر، ممکن است شاهد الگوهای هم‌پوشانی جدید یا حتی پراکندگی عمیق‌تر باشیم.

نتیجه‌گیری

وقتی یک پرس‌وجوی تخصصی، ۲۹ پیشنهاد برند متفاوت از ده مدل پیشرو LLM ارائه می‌دهد، درس واضح است: هیچ «حقیقت» واحدی در هوش مصنوعی مولد وجود ندارد. برندها و مهندسان باید با هر منبع داده‌ی یک مدل به عنوان یک کانال مجزا برخورد کنند و اگر می‌خواهند در اکوسیستم هوش مصنوعی دیده شوند، ردپاهای ساختاریافته و قابل جستجو ایجاد کنند.

مطالعه کامل و داده‌های خام: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap