Upimaji mpya wa mifumo 20 ya lugha kubwa (LLMs) unaonyesha kuwa hakuna mfumo mmoja unaotawala kazi yoyote mwaka 2026. Kuelekeza kila kazi kwa mtaalamu kunaweza kupunguza gharama na kuharakisha utoaji. Utafiti huo ulinganisha Anthropic, OpenAI, Google, xAI, Meta na maabara kadhaa za China, na ukagundua kuwa kuchagua mfumo usiofaa unapoteza pesa na muda.

Kwa nini LLM moja haitoshi tena

Mwaka mmoja uliopita, watengenezaji wengi walichagua mfumo mmoja kwa kila kitu—kuanzia kodi hadi majibu ya utafiti. Mapengo kati ya mifumo iliyojengwa kwa ajili ya uandishi wa kodi, uratibu wa zana (tool orchestration), uwezo wa kufikiri kwa kina, na ufanisi wa gharama umekua kiasi kwamba mbinu ya "moja kwa ajili ya yote" sasa inaleta madhara zaidi kuliko msaada.

Jinsi upimaji ulivyojengwa

Niliendesha seti ile ile ya kazi kwenye mifumo yote 20, nikapuuza madai ya masoko ya wauzaji na nikajikita kwenye data huru zinazoweza kurudiwa. Kazi hizo ziligawanywa katika makundi manne:

  • Uandishi wa kodi na uhuru (autonomy) – kuzalisha kodi ya kiwango cha uzalishaji, kushughulikia mzunguko wa mawakala (agentic loops).
  • Matumizi ya zana na uratibu – kuita API za nje, kusimamia faili, kuendesha kompyuta.
  • Uwezo wa kufikiri na sayansi – kutatua matatizo ya hisabati, kufasiri data za utafiti.
  • Thamani – kutoa ubora unaokubalika kwa gharama ya chini kabisa inayowezekana.

Matrix iliyopatikana inawawezesha wahandisi kuoanisha aina ya kazi na uwezo wa mfumo badala ya kutumia jina maarufu zaidi kama chaguo la kawaida.

Ni mifumo gani inayotawala kila kundi

Uandishi wa kodi na uhuru – Claude Opus 5 na Fable 5 viliongoza orodha mara kwa mara, vikishughulikia uundaji wa kodi tata na mizunguko ya hatua nyingi kwa majaribio machache zaidi. GPT-5.6 Sol kilikuwa karibu sana, kikitoa mbadala thabiti wakati wawili wa kwanza hawapatikani.

Matumizi ya zana na uratibu – Muse Spark 1.1 ya Meta ilionyesha kuaminika zaidi katika kuita zana za nje, wakati Gemini 3.6 Flash ulikuwa bora katika matukio ya matumizi ya kompyuta kama vile usimamizi wa spreadsheet na uendeshaji wa UI (UI automation).

Uwezo wa kufikiri na sayansi – GPT-5.6 Sol na Gemini 3.1 Pro zilikuwa chaguo bora kwa hisabati na utafiti.

Thamani ya juu zaidi – Mifumo ya China ya open-weight—GLM-5.2 na DeepSeek V4—ilifikia ubora wa kiwango cha juu (frontier-level) kwa sehemu ndogo sana ya bei ya kila token ikilinganishwa na mifumo mikuu. Timu zinazoweza kuvumilia upungufu mdogo wa ufundi hupata faida kubwa zaidi kwa gharama ndogo.

Viongozi wa open-weight – Kimi K3 kwa sasa ndio mfumo wenye nguvu zaidi uliotolewa wazi. Llama 4 ya Meta imepungua nyuma.

Hitimisho: mfumo "mwerevu" zaidi si wakati wote wa kiuchumi zaidi au wa haraka zaidi kwa kazi fulani.

Mkakati wa kuelekeza (routing) kwa mifumo ya uzalishaji

  1. Elekeza, usifanye kuwa ya kawaida – Chukulia uteuzi wa mfumo kama uamuzi unaobadilika, si kama chaguo la kudumu.
  2. Anza na rahisi, ongeza ngazi ikifeli – Anza na mfumo wenye gharama ya chini kabisa unaoweza kushughulikia kazi; ikifeli, tumia mfumo wa ngazi ya juu zaidi.
  3. Tenganisha mpangaji na mfanyakazi – Tumia mfumo wenye uwezo mkubwa wa kufikiri (mfano, Opus 5) ili kuvunja tatizo katika hatua, kisha upe kazi ndogo zinazojirudia kwa mfanyaji wa gharama nafuu (mfano, Gemini Flash).
  4. Pima mafanikio, si matumizi ya token pekee – Mfumo rahisi unaojaribu tena mara tatu unaweza kugharimu zaidi kuliko mfumo ghali unaofanya kazi kwa usahihi mara ya kwanza.

Nini cha kufuatilia baadaye

Watengenezaji wanapaswa kuchukulia ramani ya kuelekeza (routing map) kama hati inayobadilika na kupitia upya chaguzi za mifumo kwa kila toleo kuu jipya.

Hitimisho

Mwaka 2026, faida ya ushindani ni ya timu zinazochukulia LLMs kama sanduku la zana badala ya kisu kimoja cha Swiss-army. Kwa kuoanisha kazi na mfumo unaofanya vizuri katika hizo, mashirika hupunguza matumizi ya fedha kwenye AI huku yakitoa matokeo kwa haraka zaidi. Ushindi wa kweli si mfumo mpya unaotangazwa sana; ni mkakati wa kuelekeza uliodhibitiwa unaoweka akili sahihi pale inapohitajika zaidi.