Nilitaka kuona kama kuuliza swali lilelile mara 51 kungeifanya jibu liwe la kuaminika zaidi. Nilichukua LLM ya ndani (local LLM), nikaiwekea kipande cha kodi ya uzalishaji (production code), na kuiomba ifanye mapitio. Kisha nikafanya hivyo tena. Na tena. Jumla mara hamsini na moja, nikitumia mfumo wa kura ya wengi (majority voting) kuchagua jibu "bora". Wazo lilikuwa rahisi: ikiwa modeli itajikwaa katika mkondo mmoja, labda hekima ya wengi kupitia vizazi 51 ingeondoa kelele na kuibua uchambuzi sahihi. Hivyo ndivyo ilivyotokea. Jaribio lilionyesha kuwa kura ya wengi haichagui usahihi. Inachagua kile ambacho modeli imekuwa na msimamo mkali zaidi nacho.
Tofauti hii ni muhimu kwa sababu kura ya wengi imekuwa mbinu maarufu (hack) katika mifumo ya LLM (LLM pipelines). Mtindo huo ni rahisi. Unaiendesha modeli mara kadhaa kwa kutumia maelekezo (prompt) yaleyale, unakusanya matokeo, na unahifadhi jibu linalojitokeza mara nyingi zaidi. Katika nyanja kama vile picha za kitabibu au utambuzi wa barua pepe zisizohitajika (spam detection), mbinu za pamoja (ensemble methods) hufanya kazi kwa sababu modeli tofauti, au mitazamo tofauti ya data, huzalisha makosa huru ambayo kwa kweli yanaweza kufutana. Modeli kubwa za lugha (Large language models) si wapiga kura huru. Ni mfumo mmoja wenye historia moja ya mafunzo, seti moja ya uzito (weights), na ulimwengu mmoja wa upendeleo (biases). Unapouliza modeli ileile swali lilelile mara hamsini na moja, hauundei kamati. Unafanya kura kwa mshiriki mmoja tu aliye katika hali tofauti kidogo za hisia.
Tatizo la Udumivu
Suala kuu ni kwamba makosa ya LLM mara chache huwa ya nasibu. Ni mifumo iliyojengwa ndani ya data ya mafunzo na usanifu (architecture). Modeli inayosoma vibaya 'Python decorator' fulani katika mkondo mmoja ina uwezekano mkubwa wa kuisoma vibaya katika mkondo unaofuata. Modeli inayotunga uongo (hallucinate) kuhusu udhaifu wa usalama kwa sababu jina la variable linafanana na nenosiri, pengine itatunga uongo huo tena katika mkondo wa arubaini na saba. Kelele unazozifuta kwa wastani kwa kawaida ni mabadiliko ya juu-juu katika maneno au mpangilio. Mantiki ya msingi mara nyingi hubaki vilevile.
Chukua mfano halisi. Wazia kazi (function) inayochambua faili za kumbukumbu (log files) kwa kutumia 'regular expression'. Regex hiyo ni kali na salama. Lakini mfululizo wa herufi r'...' una herufi ambazo, katika muktadha tofauti, zinaweza kusababisha 'injection'. Iombe LLM ifanye mapitio ya hili. Ikiwa modeli imeona maelfu ya machapisho ya Stack Overflow yakionya dhidi ya 'regex injection' katika wachambuzi wa log, inaweza kuainisha kipande hiki salama kama hatari. Iendeshe mara moja, unapata 'false positive'. Iendeshe mara 51, na kuna uwezekano mkubwa utapata 'false positives' 51, au angalau wengi sana. Kura ya wengi sasa inaimarisha uongo huo (hallucination). Modeli ina udumivu, hivyo "makubaliano" pia yanakuwa na udumivu.
Hii hutokea kwa sababu mbinu za 'temperature' na 'sampling' hazibadili kile modeli inachokijua. Zinapanga upya tu jinsi inavyozungumza. Kiwango cha juu cha 'temperature' kinaweza kufanya maelezo yawe ya mazungumzo mengi au mafupi sana. Inaweza kubadilisha visawe. Haiifundishi modeli ghafla kwamba regex hiyo haina madhara. Mabadiliko unayopigia kura ni ya urembo tu. Kosa ni la kimuundo.
Kile Ambacho Mkondo 51 Unafichua
Nilipozitandaza matokeo hayo 51 mezani kwangu, mtindo ulikuwa wazi. Modeli haikuchunguza tafsiri 51 tofauti za kodi. Ilirudia tafsiri ileile kwa sauti tofauti kidogo. Baadhi ya mkondo zilienda nje ya mada, zikipendekeza marekebisho ya 'edge-case' au kuzingatia masuala ya mtindo yasiyohusiana. Lakini kundi kuu, wengi wazi, waliendelea kurudi kwenye dai lilelile lisilo sahihi la msingi. Dai hilo halikuwa sahihi. Lilikuwa tu la kawaida.
Hisabati ya kura ya wengi inadhani kuwa kuna majaribio huru ya Bernoulli. Unahitaji makosa yasiyohusiana ili wengi washinde mmoja mmoja. Katika jaribio langu, makosa yalikuwa yamehusiana sana. Yalikuwa na chanzo kimoja: usambazaji wa mafunzo ya modeli unatoa uzito mkubwa kwa mbinu fulani za uandishi wa kodi (coding tropes). Kwa hivyo, kura ya wengi haikupunguza kosa. Iliongeza upendeleo wa wengi. Ilitoa hisia ya uongo ya uhakika kwa uchambuzi wenye kasoro.
Hii ni hatari hasa katika mapitio ya kodi kwa sababu watengenezaji programu (developers) huchukulia matokeo ya AI ya upatanifu au karibu na upatanifu kama mamlaka. Pendekezo moja la kusita ni rahisi kulipuuza. Pendekezo linalobaki vilevile katika mkondo hamsini na moja linahisi kama ukweli wa msingi. Si hivyo. Ni mzunguko wa udanganyifu (ground loop).
Pale Ambapo Kura Hufanya Kazi Hasa
None of this means you should never run a model more than once. Majority voting can help in narrow situations where the task is shallow and the errors are truly random. Asking a model to pick between two syntactic formats, to choose a variable naming convention, or to extract a date string from a log line—these low-stakes tasks sometimes benefit from repeated sampling. The variation is genuine noise, and a quick vote cleans it up.
The trouble starts when the task requires reasoning about intent. Does this auth check belong here? Is this async call safe? Is this cache key collision actually exploitable? These questions demand an understanding of context, not just pattern matching. A model's pattern matcher is deterministic in its bias. It will reach for the most common answer from its training data, not the most accurate answer for your codebase.
Smarter Ways to Spend Your Compute
Fifty-one runs of a local model cost real time and electricity. There are better ways to invest that compute. If you want to improve reliability, diversity beats volume. Run two different models with
