โมเดลภาษาขนาดใหญ่ (LLMs) 10 โมเดล ระบุชื่อแบรนด์เครื่องประดับหรูที่แตกต่างกันถึง 29 แบรนด์ เมื่อถูกถามถึงผู้ผลิตแหวนแต่งงานที่ดีที่สุดในโรมาเนีย และไม่มีแบรนด์ใดเลยที่ปรากฏอยู่ในทุกคำตอบ ความหลากหลายนี้แสดงให้เห็นว่า "ฉันทามติ" (consensus) ในหมู่ Generative AI นั้นเป็นเพียงเรื่องเล่ามากกว่าความจริง โดยเฉพาะอย่างยิ่งสำหรับคำถามเฉพาะกลุ่ม (niche queries) ที่ธุรกิจต่างหวังจะครองตลาด
ทำไมการทดสอบนี้จึงสำคัญ
นักพัฒนามักสร้างฟีเจอร์การค้นหาหรือการแนะนำที่ขับเคลื่อนด้วย AI โดยสมมติว่าโมเดลที่แตกต่างกันจะให้ข้อมูลที่ตรงกัน หากการมองเห็นของแบรนด์ขึ้นอยู่กับผลลัพธ์ของ AI เพียงตัวเดียว คำตอบที่แตกต่างออกไปอาจทำให้การรับรู้แบรนด์ในช่องทางอื่นหายไปได้ทันที การทดลองนี้พิสูจน์ว่าสมมติฐานดังกล่าวนั้นเปราะบาง และชี้ให้เห็นว่ากระบวนการจัดการข้อมูล (data pipeline) ของแต่ละโมเดลมีความสำคัญไม่แพ้ตัวโมเดลเอง
สรุปการทดลองโดยย่อ
- โมเดล: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM และ Qwen
- คำสั่ง (Prompt): “ขอรายชื่อ 5 อันดับแบรนด์เครื่องประดับหรูในโรมาเนียสำหรับแหวนแต่งงาน” โดยไม่มีการบอกใบ้ชื่อแบรนด์ และเริ่มเซสชันใหม่สำหรับแต่ละโมเดล
- จำนวนช่องคำตอบ: 10 โมเดล × 5 อันดับ = คำแนะนำทั้งหมด 50 รายการ
ตัวเลขที่น่าสนใจ
- มีแบรนด์ที่ไม่ซ้ำกัน 29 แบรนด์ ในจำนวนคำแนะนำทั้งหมด 50 รายการ
- 66% ของแบรนด์เหล่านั้นปรากฏในคำตอบของโมเดลเพียงโมเดลเดียวเท่านั้น
- ค่าเฉลี่ยความซ้ำซ้อน (overlap) ระหว่างสองโมเดลใดๆ อยู่ที่ 18%
- ไม่มีแบรนด์ใดที่ถูกกล่าวถึงโดยทั้งสิบโมเดล
แบรนด์ใดปรากฏบ่อยที่สุด?
| แบรนด์ | ปรากฏในโมเดล |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | อย่างละ 3 |
TEILOR และ Malvensky มีการทำ schema markup ที่แข็งแกร่งและมีการกล่าวถึงในสื่อบ่อยครั้ง ซึ่งน่าจะเป็นปัจจัยที่ช่วยให้แบรนด์เหล่านี้ปรากฏขึ้นในหลายระบบ
สิ่งที่ข้อมูลบอกกับวิศวกร
- ฉันทามติเป็นเพียงภาพลวงตา ในตลาดเฉพาะกลุ่ม แม้แต่โมเดลที่มีประสิทธิภาพสูงก็ยังให้คำตอบที่แตกต่างกันอย่างมากเมื่อคำถามมีความเฉพาะเจาะจง
- โมเดลที่ใช้การค้นหาเสริม (Search-augmented models) มีพฤติกรรมที่แตกต่างออกไป โดย Microsoft Copilot ซึ่งมีการเพิ่มผลลัพธ์การค้นหาเว็บแบบเรียลไทม์ ให้รายชื่อที่ไม่ซ้ำกับโมเดลอื่นเลย
- ร่องรอยดิจิทัล (Digital footprints) คือตัวขับเคลื่อนการมองเห็น แบรนด์ที่ลงทุนในข้อมูลที่มีโครงสร้าง (structured data) และ SEO จะปรากฏตัวบ่อยกว่า แต่ความได้เปรียบนี้จะแตกต่างกันไปตามผู้ให้บริการ AI แต่ละราย
สิ่งที่ควรจับตามองต่อไป
- โมเดลการดึงข้อมูลแบบไฮบริด (Hybrid retrieval models): เมื่อผู้ให้บริการเริ่มผสมผสานโมเดลภาษาขนาดใหญ่เข้ากับการค้นหาแบบเรียลไทม์มากขึ้น เราอาจได้เห็นรูปแบบความซ้ำซ้อนใหม่ๆ หรืออาจเห็นการแตกกระจายของข้อมูลที่ลึกซึ้งยิ่งขึ้น
บทสรุป
เมื่อคำถามเฉพาะกลุ่มให้คำแนะนำแบรนด์ที่แตกต่างกันถึง 29 แบรนด์จาก 10 LLMs ชั้นนำ บทเรียนนี้จึงชัดเจนว่า: ไม่มี "ความจริง" เพียงหนึ่งเดียวใน Generative AI แบรนด์และวิศวกรต้องปฏิบัติต่อแหล่งข้อมูลของแต่ละโมเดลเสมือนเป็นช่องทางที่แยกจากกัน และต้องสร้างร่องรอยที่สามารถค้นหาได้และมีโครงสร้างที่ชัดเจน หากต้องการให้แบรนด์ปรากฏอยู่ในระบบนิเวศของ AI
ผลการศึกษาฉบับเต็มและข้อมูลดิบ: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
