Sepuluh model bahasa besar (LLM) menyenaraikan 29 jenama barang kemas mewah yang berbeza apabila diminta untuk memberikan pembuat cincin perkahwinan terbaik di Romania, dan tiada satu pun jenama yang muncul dalam setiap jawapan. Kepelbagaian ini menunjukkan bahawa "konsensus" dalam kalangan AI generatif lebih kepada mitos berbanding realiti, terutamanya bagi pertanyaan khusus yang ingin dikuasai oleh perniagaan.
Mengapa ujian ini penting
Pembangun sering membina ciri carian atau cadangan dipacu AI dengan andaian bahawa model yang berbeza akan mencapai fakta yang sama. Jika keterlihatan sesuatu jenama bergantung pada output satu AI sahaja, jawapan yang berbeza boleh melenyapkan pendedahan tersebut di tempat lain. Eksperimen ini membuktikan bahawa andaian tersebut rapuh dan menekankan betapa pentingnya saluran data (data pipeline) setiap model sama seperti model itu sendiri.
Ringkasan eksperimen
- Model: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM dan Qwen.
- Prompt: “Berikan saya senarai 5 teratas jenama barang kemas mewah di Romania untuk cincin perkahwinan.” Tiada pembayang jenama, sesi baharu untuk setiap model.
- Slot: 10 model × 5 kedudukan = 50 jumlah cadangan.
Angka yang menonjol
- 29 jenama unik mengisi 50 slot tersebut.
- 66% daripada jenama tersebut hanya muncul dalam jawapan satu model sahaja.
- Purata pertindihan antara mana-mana dua model adalah 18%.
- Tiada jenama yang disebut oleh kesemua sepuluh model.
Siapa yang paling kerap muncul?
| Jenama | Muncul dalam model |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | 3 setiap satu |
TEILOR dan Malvensky mempunyai penandaan skema (schema markup) yang kuat dan sering disebut dalam media, yang berkemungkinan membantu mereka muncul merentasi pelbagai sistem.
Apa yang data beritahu jurutera
- Konsensus adalah satu ilusi dalam pasaran khusus. Malah model berprestasi tinggi pun berbeza secara drastik apabila pertanyaan adalah spesifik.
- Model yang dipertingkatkan carian (search-augmented) berkelakuan berbeza. Microsoft Copilot, yang menambah keputusan web secara langsung, menghasilkan senarai yang tidak bertindih dengan mana-mana model lain.
- Jejak digital memacu keterlihatan. Jenama yang melabur dalam data berstruktur dan SEO muncul lebih kerap, tetapi kelebihannya berbeza mengikut penyedia AI.
Apa yang perlu diperhatikan seterusnya
- Model pencarian hibrid: memandangkan lebih banyak penyedia menggabungkan model bahasa berskala besar dengan carian masa nyata, kita mungkin akan melihat corak pertindihan baharu—atau bahkan fragmentasi yang lebih mendalam.
Kesimpulan
Apabila pertanyaan khusus menghasilkan 29 cadangan jenama yang berbeza daripada sepuluh LLM terkemuka, pengajarannya jelas: tidak ada satu "kebenaran" tunggal dalam AI generatif. Jenama dan jurutera mesti menganggap sumber data setiap model sebagai saluran yang berasingan dan membina jejak yang berstruktur serta boleh dicari jika mereka mahu dilihat merentasi ekosistem AI.
Kajian penuh dan data mentah: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
