പത്ത് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) റൊമാനിയയിലെ മികച്ച വെഡിങ് റിംഗ് നിർമ്മാതാക്കളെക്കുറിച്ച് ചോദിച്ചപ്പോൾ 29 വ്യത്യസ്ത ലക്ഷ്വറി ജ്വല്ലറി ബ്രാൻഡുകളെയാണ് പട്ടികപ്പെടുത്തിയത്; ഒരു ബ്രാൻഡും എല്ലാ ഉത്തരങ്ങളിലും ഉണ്ടായിരുന്നില്ല. ജനറേറ്റീവ് AI-കൾക്കിടയിലെ "ഏകകണ്ഠമായ അഭിപ്രായം" (consensus) എന്നത് ഒരു യാഥാർത്ഥ്യത്തേക്കാൾ ഉപരി ഒരു മിഥ്യയാണെന്ന് ഈ വ്യത്യാസം കാണിക്കുന്നു, പ്രത്യേകിച്ച് ബിസിനസ്സുകൾ ആധിപത്യം സ്ഥാപിക്കാൻ ആഗ്രഹിക്കുന്ന നിഷ് (niche) മേഖലകളിലെ ചോദ്യങ്ങളിൽ.
ഈ പരീക്ഷണം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്
വ്യത്യസ്ത മോഡലുകൾ ഒരേ വസ്തുതകളിൽ എത്തിച്ചേരുമെന്ന് കരുതിയാണ് ഡെവലപ്പർമാർ പലപ്പോഴും AI അധിഷ്ഠിത സെർച്ച് അല്ലെങ്കിൽ റെക്കമെൻഡേഷൻ ഫീച്ചറുകൾ നിർമ്മിക്കുന്നത്. ഒരു ബ്രാൻഡിന്റെ ദൃശ്യപരത (visibility) ഒരു പ്രത്യേക AI-യുടെ ഔട്ട്പുട്ടിനെ മാത്രം ആശ്രയിച്ചാണെങ്കിൽ, മറ്റ് മോഡലുകളിൽ നിന്നുള്ള വ്യത്യസ്തമായ ഉത്തരങ്ങൾ ആ ബ്രാൻഡിന്റെ സാന്നിധ്യം ഇല്ലാതാക്കിയേക്കാം. ഈ പരീക്ഷണം ആ അനുമാനം എത്രത്തോളം ദുർബലമാണെന്ന് തെളിയിക്കുന്നു, കൂടാതെ ഓരോ മോഡലിന്റെയും ഡാറ്റാ പൈപ്പ്ലൈൻ എത്രത്തോളം പ്രധാനമാണെന്ന് ഇത് ചൂണ്ടിക്കാട്ടുന്നു.
പരീക്ഷണത്തിന്റെ സംഗ്രഹം
- മോഡലുകൾ: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM, Qwen.
- പ്രോംപ്റ്റ്: “റൊമാനിയയിലെ വെഡിങ് റിംഗുകൾക്കായി മികച്ച 5 ലക്ഷ്വറി ജ്വല്ലറി ബ്രാൻഡുകളുടെ പട്ടിക നൽകുക.” ബ്രാൻഡുകളെക്കുറിച്ചുള്ള സൂചനകളില്ലാതെ, ഓരോ മോഡലിനും പുതിയ സെഷനുകളിലാണ് ഇത് ചെയ്തത്.
- സ്ലോട്ട്കൾ: 10 മോഡലുകൾ × 5 സ്ഥാനങ്ങൾ = ആകെ 50 റെക്കമെൻഡേഷനുകൾ.
ശ്രദ്ധേയമായ കണക്കുകൾ
- 50 സ്ലോട്ടുകളിലായി 29 വ്യത്യസ്ത ബ്രാൻഡുകൾ പ്രത്യക്ഷപ്പെട്ടു.
- ആ ബ്രാൻഡുകളിൽ 66% ഒരു മോഡലിന്റെ ഉത്തരത്തിൽ മാത്രമാണ് വന്നത്.
- ഏതെങ്കിലും രണ്ട് മോഡലുകൾ തമ്മിലുള്ള ശരാശരി സാമ്യം (overlap) 18% ആയിരുന്നു.
- പത്ത് മോഡലുകളും ഒരുപോലെ പരാമർശിച്ച ഒരു ബ്രാൻഡും ഉണ്ടായില്ല.
ആരെല്ലാം ഏറ്റവും കൂടുതൽ തവണ പ്രത്യക്ഷപ്പെട്ടു?
| ബ്രാൻഡ് | മോഡലുകളിൽ പ്രത്യക്ഷപ്പെട്ടത് |
|---|---|
| TEILOR | 6 |
| Malvensky | 5 |
| Sabion, Coriolan, KULTHO, Sabrini | ഓരോന്നിലും 3 വീതം |
TEILOR, Malvensky എന്നീ ബ്രാൻഡുകൾക്ക് ശക്തമായ സ്കീമ മാർക്കപ്പും (schema markup) frequent പ്രസ് പരാമർശങ്ങളും ഉള്ളതിനാൽ, വിവിധ സിസ്റ്റങ്ങളിൽ ഇവ പ്രത്യക്ഷപ്പെടാൻ സാധ്യതയുണ്ട്.
ഡാറ്റ എഞ്ചിനീയർമാരോട് പറയുന്നത്
- നിഷ് (niche) വിപണികളിൽ ഏകകണ്ഠമായ അഭിപ്രായം എന്നത് ഒരു മിഥ്യയാണ്. ചോദ്യങ്ങൾ വളരെ കൃത്യമായവയാകുമ്പോൾ ഉയർന്ന പ്രകടനം കാഴ്ചവെക്കുന്ന മോഡലുകൾ പോലും വലിയ വ്യത്യാസങ്ങൾ കാണിക്കുന്നു.
- സെർച്ച്-ഓഗ്മെന്റഡ് (Search-augmented) മോഡലുകൾ വ്യത്യസ്തമായി പ്രവർത്തിക്കുന്നു. ലൈവ് വെബ് റിസൾട്ടുകൾ ചേർക്കുന്ന Microsoft Copilot, മറ്റ് മോഡലുകളുമായി യാതൊരു സാമ്യവുമില്ലാത്ത ഒരു പട്ടികയാണ് നൽകിയത്.
- ഡിജിറ്റൽ ഫൂട്ട്പ്രിന്റുകൾ ദൃശ്യപരത വർദ്ധിപ്പിക്കുന്നു. സ്ട്രക്ചേർഡ് ഡാറ്റയിലും SEO-യിലും നിക്ഷേപിക്കുന്ന ബ്രാൻഡുകൾ കൂടുതൽ തവണ പ്രത്യക്ഷപ്പെടുന്നു, എന്നാൽ ഈ നേട്ടം ഓരോ AI പ്രൊവൈഡർമാരിലും വ്യത്യസ്തമായിരിക്കും.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- ഹൈബ്രിഡ് റിട്രീവൽ മോഡലുകൾ (Hybrid retrieval models): കൂടുതൽ പ്രൊവൈഡർമാർ ലാർജ് സ്കെയിൽ ലാംഗ്വേജ് മോഡലുകളെ റിയൽ-ടൈം സെർച്ചിനോട് സംയോജിപ്പിക്കുമ്പോൾ, പുതിയ രീതിയിലുള്ള സാമ്യങ്ങളോ അല്ലെങ്കിൽ കൂടുതൽ വിഭജനമോ (fragmentation) നമുക്ക് കാണാൻ കഴിഞ്ഞേക്കാം.
ചുരുക്കം
പത്ത് പ്രമുഖ LLM-കളിൽ നിന്ന് ഒരു നിഷ് ചോദ്യത്തിന് 29 വ്യത്യസ്ത ബ്രാൻഡ് റെക്കമെൻഡേഷനുകൾ ലഭിക്കുമ്പോൾ, പാഠം വ്യക്തമാണ്: ജനറേറ്റീവ് AI-യിൽ ഒരൊറ്റ "സത്യം" ഇല്ല. AI ഇക്കോസിസ്റ്റത്തിൽ തങ്ങളുടെ സാന്നിധ്യം ഉറപ്പാക്കാൻ ബ്രാൻഡുകളും എഞ്ചിനീയർമാരും ഓരോ മോഡലിന്റെയും ഡാറ്റാ സ്രോതസ്സിനെ ഒരു പ്രത്യേക ചാനലായി കാണുകയും, സ്ട്രക്ചേർഡ് ആയതും സെർച്ച് ചെയ്യാൻ കഴിയുന്നതുമായ ഫൂട്ട്പ്രിന്റുകൾ നിർമ്മിക്കുകയും വേണം.
പൂർണ്ണമായ പഠനവും ഡാറ്റയും: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap
