עשרה מודלי שפה גדולים (LLMs) רשמו 29 מותגי תכשיטי יוקרה נפרדים כאשר נשאלו על יצרני טבעות הנישואין הטובים ביותר ברומניה, ואף מותג לא הופיע בכל תשובה. הפיזור מראה ש"קונצנזוס" בקרב בינה מלאכותית גנרטיבית הוא יותר מיתוס מאשר מציאות, במיוחד עבור שאילתות נישה שחברות מקוות לשלוט בהן.
למה הניסוי חשוב
מפתחים בונים לעיתים קרובות תכונות חיפוש או המלצה מבוססות AI מתוך הנחה שמודלים שונים יתכנסו לאותם עובדות. אם הנראות של מותג תלויה בפלט של בינה מלאכותית אחת בלבד, תשובה שונה יכולה למחוק את החשיפה הזו במקומות אחרים. הניסוי הזה מוכיח שההנחה הזו שבירה ומדגיש עד כמה צינור הנתונים (data pipeline) של כל מודל חשוב לא פחות מהמודל עצמו.
הניסוי בקצרה
- מודלים: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM ו-Qwen.
- פרומפט: "תן לי רשימת Top-5 של מותגי תכשיטי יוקרה ברומניה עבור טבעות נישואין". ללא רמזים על מותגים, סשן (session) חדש עבור כל מודל.
- משבצות: 10 מודלים × 5 מיקומים = 50 המלצות בסך הכל.
המספרים הבולטים
- 29 מותגים ייחודיים מילאו את 50 המשבצות.
- 66% מהמותגים הללו הופיעו בתשובה של מודל אחד בלבד.
- החפיפה הממוצעת בין כל שני מודלים הייתה 18%.
- אף מותג לא הוזכר על ידי כל עשרת המודלים.
מי הופיע הכי הרבה פעמים?
| מותג | הופיע במודלים |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 3 כל אחד |
ל-TEILOR ו-Malvensky יש schema markup חזק ואזכורים תכופים בתקשורת, מה שככל הנראה עוזר להם להופיע במערכות מרובות.
מה הנתונים אומרים למהנדסים
- קונצנזוס הוא אשליה בשווקי נישה. אפילו מודלים בעלי ביצועים גבוהים מתפצלים באופן דרמטי כאשר השאילתה ספציפית.
- מודלים מועצמי חיפוש (Search-augmented) מתנהגים אחרת. Microsoft Copilot, שמוסיף תוצאות רשת חיות, הפיק רשימה שלא חפפה לאף מודל אחר.
- עקבות דיגיטליים מניעים נראות. מותגים שמשקיעים בנתונים מובנים (structured data) וב-SEO מופיעים לעיתים קרובות יותר, אך היתרון משתנה בין ספקי ה-AI השונים.
מה כדאי לעקוב אחריו בהמשך
- מודלי שליפה היברידיים (Hybrid retrieval models): ככל שיותר ספקים משלבים מודלי שפה בקנה מידה גדול עם חיפוש בזמן אמת, אנו עשויים לראות דפוסי חפיפה חדשים — או אפילו פיצול עמוק יותר.
שורה תחתונה
כאשר שאילתת נישה מניבה 29 המלצות מותגים שונות מעשרה מודלי LLM מובילים, הלקח ברור: אין "אמת" אחת בבינה מלאכותית גנרטיבית. מותגים ומהנדסים חייבים להתייחס למקור הנתונים של כל מודל כערוץ נפרד ולבנות עקבות מובנים וניתנים לחיפוש אם הם רוצים להיראות לאורך כל המערכת האקולוגית של ה-AI.
מחקר מלא ונתונים גולמיים: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
