Mười mô hình ngôn ngữ lớn (LLM) đã liệt kê 29 thương hiệu trang sức xa xỉ khác nhau khi được hỏi về những nhà sản xuất nhẫn cưới tốt nhất tại Romania, và không có thương hiệu nào xuất hiện trong mọi câu trả lời. Sự phân tán này cho thấy "sự đồng thuận" giữa các AI tạo sinh thực chất là một huyền thoại hơn là thực tế, đặc biệt là đối với các truy vấn ngách mà các doanh nghiệp hy vọng sẽ chiếm lĩnh.

Tại sao thử nghiệm này lại quan trọng

Các nhà phát triển thường xây dựng các tính năng tìm kiếm hoặc đề xuất dựa trên AI với giả định rằng các mô hình khác nhau sẽ hội tụ về cùng một sự thật. Nếu khả năng hiển thị của một thương hiệu phụ thuộc vào kết quả của một AI duy nhất, một câu trả lời khác biệt có thể xóa sạch sự hiện diện đó ở những nơi khác. Thử nghiệm này chứng minh rằng giả định đó rất mong manh và nhấn mạnh rằng đường ống dữ liệu (data pipeline) của mỗi mô hình cũng quan trọng như chính mô hình đó.

Tóm tắt thử nghiệm

  • Mô hình: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM và Qwen.
  • Câu lệnh (Prompt): “Hãy cho tôi danh sách top 5 thương hiệu trang sức xa xỉ tại Romania chuyên về nhẫn cưới.” Không gợi ý thương hiệu, mỗi mô hình là một phiên làm việc mới.
  • Vị trí: 10 mô hình × 5 vị trí = tổng cộng 50 đề xuất.

Những con số đáng chú ý

  • 29 thương hiệu duy nhất đã lấp đầy 50 vị trí.
  • 66% trong số các thương hiệu đó chỉ xuất hiện trong câu trả lời của một mô hình.
  • Độ trùng lặp trung bình giữa bất kỳ hai mô hình nào là 18%.
  • Không có thương hiệu nào được cả mười mô hình nhắc đến.

Ai xuất hiện thường xuyên nhất?

Thương hiệu Xuất hiện trong các mô hình
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini mỗi thương hiệu 3 lần

TEILOR và Malvensky có cấu trúc dữ liệu (schema markup) mạnh mẽ và thường xuyên được báo chí nhắc đến, điều này có khả năng giúp họ xuất hiện trên nhiều hệ thống khác nhau.

Dữ liệu nói gì với các kỹ sư

  • Sự đồng thuận là một ảo tưởng trong các thị trường ngách. Ngay cả các mô hình hiệu suất cao cũng có sự khác biệt đáng kể khi truy vấn mang tính cụ thể.
  • Các mô hình tăng cường tìm kiếm (search-augmented models) hoạt động khác biệt. Microsoft Copilot, vốn bổ sung các kết quả web trực tiếp, đã tạo ra một danh sách không trùng lặp với bất kỳ mô hình nào khác.
  • Dấu chân kỹ thuật số thúc đẩy khả năng hiển thị. Các thương hiệu đầu tư vào dữ liệu có cấu trúc và SEO sẽ xuất hiện thường xuyên hơn, nhưng lợi thế này thay đổi tùy theo từng nhà cung cấp AI.

Điều cần theo dõi tiếp theo

  • Các mô hình truy xuất hỗn hợp (hybrid retrieval models): khi ngày càng có nhiều nhà cung cấp kết hợp các mô hình ngôn ngữ quy mô lớn với tìm kiếm thời gian thực, chúng ta có thể thấy các mô hình trùng lặp mới—hoặc thậm chí là sự phân mảnh sâu sắc hơn.

Bài học rút ra

Khi một truy vấn ngách mang lại 29 đề xuất thương hiệu khác nhau từ mười LLM hàng đầu, bài học rút ra rất rõ ràng: không có một "sự thật" duy nhất trong AI tạo sinh. Các thương hiệu và kỹ sư phải coi nguồn dữ liệu của mỗi mô hình là một kênh riêng biệt và xây dựng các dấu chân có cấu trúc, có thể tìm kiếm được nếu họ muốn được nhìn thấy trong toàn bộ hệ sinh thái AI.

Nghiên cứu đầy đủ và dữ liệu thô: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap