Mifumo kumi ya lugha kubwa (LLMs) ilitaja chapa 29 tofauti za vito vya kifahari wakati ikiulizwa kuhusu watengenezaji bora wa pete za harusi nchini Romania, na hakuna chapa iliyoonekana katika kila jibu. Mgawanyiko huo unaonyesha kuwa "makubaliano" miongoni mwa AI zinazozalisha (generative AIs) ni hadithi zaidi kuliko ukweli, hasa kwa maswali ya kitalaamu ambayo biashara hutumai kudhibiti.

Kwa nini jaribio hili ni muhimu

Watengenezaji mara nyingi hujenga vipengele vya utafutaji au mapendekezo vinavyoendeshwa na AI wakidhania kuwa mifumo tofauti itafikia ukweli mmoja. Ikiwa uonekanaji wa chapa unategemea matokeo ya AI moja tu, jibu tofauti linaweza kufuta ule uonekanaji mahali pengine. Jaribio hili linathibitisha kuwa dhana hiyo ni dhaifu na linaonyesha jinsi mtiririko wa data (data pipeline) wa kila mfumo unavyojali sawa na mfumo wenyewe.

Muhtasari wa jaribio

  • Mifumo: ChatGPT, Claude, Gemini, Copilot, Grok, Perplexity, DeepSeek, Kimi, GLM na Qwen.
  • Maelekezo (Prompt): “Nipe orodha ya chapa 5 bora za vito vya kifahari nchini Romania kwa ajili ya pete za harusi.” Hakuna vidokezo vya chapa, kikao kipya kwa kila mfumo.
  • Nafasi: Mifumo 10 × nafasi 5 = mapendekezo 50 kwa jumla.

Takwimu zinazojitokeza

  • Chapa 29 za kipekee zilijaza nafasi hizo 50.
  • 66% ya chapa hizo zilijitokeza katika jibu la mfumo mmoja tu.
  • Mwingiliano wa wastani kati ya mifumo miwili yoyote ulikuwa 18%.
  • Hakuna chapa iliyotajwa na mifumo yote kumi.

Ni nani aliyetokeza mara nyingi zaidi?

Chapa Ilitokea katika mifumo
TEILOR 6
Malvensky 5
Sabion, Coriolan, KULTHO, Sabrini 3 kila moja

TEILOR na Malvensky zina schema markup imara na kutajwa mara kwa mara kwenye vyombo vya habari, jambo ambalo huenda linazisaidia kujitokeza katika mifumo mingi.

Takwimu zinazowaambia wahandisi

  • Makubaliano ni udanganyifu katika masoko mahususi. Hata mifumo yenye ufanisi mkubwa hutofautiana sana wakati swali linapokuwa mahususi.
  • Mifumo inayoongezwa na utafutaji (Search-augmented models) hutenda tofauti. Microsoft Copilot, ambayo huongeza matokeo ya moja kwa moja kutoka mtandaoni, ilitoa orodha ambayo haikuingiliana na mfumo mwingine wowote.
  • Nyayo za kidijitali huendesha uonekanaji. Chapa zinazowekeza katika data iliyopangwa (structured data) na SEO hujitokeza mara kwa mara, lakini faida hiyo inatofautiana kati ya watoa huduma wa AI.

Nini cha kufuatilia baadaye

  • Mifumo mseto ya upatikanaji (Hybrid retrieval models): kadiri watoa huduma wengi wanavyochanganya mifumo ya lugha kubwa na utafutaji wa wakati halisi, tunaweza kuona mifumo mipya ya mwingiliano—au hata mgawanyiko mkubwa zaidi.

Hitimisho

Wakati swali la kitalaamu linatoa mapendekezo ya chapa 29 tofauti kutoka kwa mifumo kumi mikuu ya LLM, somo ni wazi: hakuna "ukweli" mmoja katika AI inayozalisha. Chapa na wahandisi lazima wachukulie chanzo cha data cha kila mfumo kama njia tofauti na kujenga nyayo zinazoweza kutafutika na zilizopangwa ikiwa wanataka kuonekana katika mfumo mzima wa AI.

Utafiti kamili na data ghafi: https://dev.to/dan_cristian_c97aa535c495/we-asked-10-llms-to-recommend-brands-they-gave-us-29-different-answers-27ap