โมเดลภาษาขนาดใหญ่ (LLMs) 10 โมเดล ระบุชื่อแบรนด์เครื่องประดับหรูที่แตกต่างกันถึง 29 แบรนด์ เมื่อถูกถามถึงผู้ผลิตแหวนแต่งงานที่ดีที่สุดในโรมาเนีย และไม่มีแบรนด์ใดเลยที่ปรากฏอยู่ในทุกคำตอบ ความหลากหลายนี้แสดงให้เห็นว่า "ฉันทามติ" (consensus) ในหมู่ Generative AI นั้นเป็นเพียงเรื่องเล่ามากกว่าความจริง โดยเฉพาะอย่างยิ่งสำหรับคำถามเฉพาะกลุ่ม (niche queries) ที่ธุรกิจต่างหวังจะครองตลาด

ทำไมการทดสอบนี้จึงสำคัญ

นักพัฒนามักสร้างฟีเจอร์การค้นหาหรือการแนะนำที่ขับเคลื่อนด้วย AI โดยสมมติว่าโมเดลที่แตกต่างกันจะให้ข้อมูลที่ตรงกัน หากการมองเห็นของแบรนด์ขึ้นอยู่กับผลลัพธ์ของ AI เพียงตัวเดียว คำตอบที่แตกต่างออกไปอาจทำให้การรับรู้แบรนด์ในช่องทางอื่นหายไปได้ทันที การทดลองนี้พิสูจน์ว่าสมมติฐานดังกล่าวนั้นเปราะบาง และชี้ให้เห็นว่ากระบวนการจัดการข้อมูล (data pipeline) ของแต่ละโมเดลมีความสำคัญไม่แพ้ตัวโมเดลเอง

สรุปการทดลองโดยย่อ

  • โมเดล: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM และ Qwen
  • คำสั่ง (Prompt): “ขอรายชื่อ 5 อันดับแบรนด์เครื่องประดับหรูในโรมาเนียสำหรับแหวนแต่งงาน” โดยไม่มีการบอกใบ้ชื่อแบรนด์ และเริ่มเซสชันใหม่สำหรับแต่ละโมเดล
  • จำนวนช่องคำตอบ: 10 โมเดล × 5 อันดับ = คำแนะนำทั้งหมด 50 รายการ

ตัวเลขที่น่าสนใจ

  • มีแบรนด์ที่ไม่ซ้ำกัน 29 แบรนด์ ในจำนวนคำแนะนำทั้งหมด 50 รายการ
  • 66% ของแบรนด์เหล่านั้นปรากฏในคำตอบของโมเดลเพียงโมเดลเดียวเท่านั้น
  • ค่าเฉลี่ยความซ้ำซ้อน (overlap) ระหว่างสองโมเดลใดๆ อยู่ที่ 18%
  • ไม่มีแบรนด์ใดที่ถูกกล่าวถึงโดยทั้งสิบโมเดล

แบรนด์ใดปรากฏบ่อยที่สุด?

แบรนด์ ปรากฏในโมเดล
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini อย่างละ 3

TEILOR และ Malvensky มีการทำ schema markup ที่แข็งแกร่งและมีการกล่าวถึงในสื่อบ่อยครั้ง ซึ่งน่าจะเป็นปัจจัยที่ช่วยให้แบรนด์เหล่านี้ปรากฏขึ้นในหลายระบบ

สิ่งที่ข้อมูลบอกกับวิศวกร

  • ฉันทามติเป็นเพียงภาพลวงตา ในตลาดเฉพาะกลุ่ม แม้แต่โมเดลที่มีประสิทธิภาพสูงก็ยังให้คำตอบที่แตกต่างกันอย่างมากเมื่อคำถามมีความเฉพาะเจาะจง
  • โมเดลที่ใช้การค้นหาเสริม (Search-augmented models) มีพฤติกรรมที่แตกต่างออกไป โดย Microsoft Copilot ซึ่งมีการเพิ่มผลลัพธ์การค้นหาเว็บแบบเรียลไทม์ ให้รายชื่อที่ไม่ซ้ำกับโมเดลอื่นเลย
  • ร่องรอยดิจิทัล (Digital footprints) คือตัวขับเคลื่อนการมองเห็น แบรนด์ที่ลงทุนในข้อมูลที่มีโครงสร้าง (structured data) และ SEO จะปรากฏตัวบ่อยกว่า แต่ความได้เปรียบนี้จะแตกต่างกันไปตามผู้ให้บริการ AI แต่ละราย

สิ่งที่ควรจับตามองต่อไป

  • โมเดลการดึงข้อมูลแบบไฮบริด (Hybrid retrieval models): เมื่อผู้ให้บริการเริ่มผสมผสานโมเดลภาษาขนาดใหญ่เข้ากับการค้นหาแบบเรียลไทม์มากขึ้น เราอาจได้เห็นรูปแบบความซ้ำซ้อนใหม่ๆ หรืออาจเห็นการแตกกระจายของข้อมูลที่ลึกซึ้งยิ่งขึ้น

บทสรุป

เมื่อคำถามเฉพาะกลุ่มให้คำแนะนำแบรนด์ที่แตกต่างกันถึง 29 แบรนด์จาก 10 LLMs ชั้นนำ บทเรียนนี้จึงชัดเจนว่า: ไม่มี "ความจริง" เพียงหนึ่งเดียวใน Generative AI แบรนด์และวิศวกรต้องปฏิบัติต่อแหล่งข้อมูลของแต่ละโมเดลเสมือนเป็นช่องทางที่แยกจากกัน และต้องสร้างร่องรอยที่สามารถค้นหาได้และมีโครงสร้างที่ชัดเจน หากต้องการให้แบรนด์ปรากฏอยู่ในระบบนิเวศของ AI

ผลการศึกษาฉบับเต็มและข้อมูลดิบ: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap