ده مدل زبانی بزرگ (LLM) هنگام پاسخ به این سوال که بهترین سازندگان حلقههای ازدواج رومانیایی کدامند، ۲۹ برند متمایز جواهرات لوکس را نام بردند و هیچ برندی در تمام پاسخها تکرار نشد. این پراکندگی نشان میدهد که «اجماع» میان هوش مصنوعیهای مولد بیشتر یک افسانه است تا واقعیت، بهویژه برای پرسوجوهای تخصصی که کسبوکارها امیدوارند بر آنها تسلط یابند.
چرا این آزمایش اهمیت دارد
توسعهدهندگان اغلب ویژگیهای جستجو یا پیشنهاددهنده مبتنی بر هوش مصنوعی را با این فرض میسازند که مدلهای مختلف بر سر حقایق یکسان به توافق میرسند. اگر دیده شدن یک برند به خروجی یک هوش مصنوعی واحد وابسته باشد، یک پاسخ متفاوت میتواند آن حضور را در جاهای دیگر از بین ببرد. این آزمایش ثابت میکند که این فرض شکننده است و نشان میدهد که خط لوله دادههای (data pipeline) هر مدل، به اندازه خود مدل اهمیت دارد.
خلاصه آزمایش
- مدلها: ChatGPT، Claude، Gemini، Copilot، Grok، Perplexity، DeepSeek، Kimi، GLM و Qwen.
- دستور (Prompt): «یک لیست از ۵ برند برتر جواهرات لوکس در رومانی برای حلقههای ازدواج به من بده.» بدون هیچ اشارهای به برندها، و با شروع یک نشست (session) تازه برای هر مدل.
- جایگاهها: ۱۰ مدل × ۵ موقعیت = ۵۰ پیشنهاد در مجموع.
اعداد قابل توجه
- ۲۹ برند منحصربهفرد ۵۰ جایگاه را پر کردند.
- ۶۶٪ از آن برندها تنها در پاسخ یک مدل ظاهر شدند.
- میانگین همپوشانی بین هر دو مدل ۱۸٪ بود.
- هیچ برندی توسط هر ده مدل ذکر نشد.
چه برندهایی بیش از همه ظاهر شدند؟
| برند | در کدام مدلها ظاهر شد |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | هر کدام ۳ |
برندهای TEILOR و Malvensky دارای نشانهگذاری اسکیما (schema markup) قوی و حضور مکرر در اخبار هستند که احتمالاً به آنها کمک میکند در سیستمهای مختلف ظاهر شوند.
آنچه دادهها به مهندسان میگویند
- اجماع در بازارهای تخصصی یک توهم است. حتی مدلهای با عملکرد بالا نیز زمانی که پرسوجو خاص باشد، تفاوتهای فاحشی با هم دارند.
- مدلهای تقویتشده با جستجو متفاوت عمل میکنند. Microsoft Copilot که نتایج زنده وب را اضافه میکند، لیستی تولید کرد که با هیچ مدل دیگری همپوشانی نداشت.
- ردپای دیجیتال باعث دیده شدن میشود. برندهایی که روی دادههای ساختاریافته و SEO سرمایهگذاری میکنند، بیشتر ظاهر میشوند، اما این مزیت در میان ارائهدهندگان مختلف هوش مصنوعی متفاوت است.
آنچه باید در آینده زیر نظر داشت
- مدلهای بازیابی ترکیبی (Hybrid retrieval models): با ترکیب مدلهای زبانی مقیاسبزرگ با جستجوی بیدرنگ (real-time search) توسط ارائهدهندگان بیشتر، ممکن است شاهد الگوهای همپوشانی جدید یا حتی پراکندگی عمیقتر باشیم.
نتیجهگیری
وقتی یک پرسوجوی تخصصی، ۲۹ پیشنهاد برند متفاوت از ده مدل پیشرو LLM ارائه میدهد، درس واضح است: هیچ «حقیقت» واحدی در هوش مصنوعی مولد وجود ندارد. برندها و مهندسان باید با هر منبع دادهی یک مدل به عنوان یک کانال مجزا برخورد کنند و اگر میخواهند در اکوسیستم هوش مصنوعی دیده شوند، ردپاهای ساختاریافته و قابل جستجو ایجاد کنند.
مطالعه کامل و دادههای خام: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
