Watu wengi wanaweza kutoa prompt kwa LLM. Kujenga moja ndani ya bidhaa inayoweza kuhimili trafiki halisi ni mchezo tofauti kabisa. Ikiwa unataka kutoka kwenye uandishi kwenye dirisha la mazungumzo hadi kutuma AI ya uzalishaji (production AI), unahitaji kuelewa jinsi stack inavyoungana. Sio uchawi. Ni mfululizo wa matatizo ya kihandisi yaliyotenganishwa, na kila tabaka lina namna yake ya kufeli.
Nakuongoza jinsi mfumo wa kisasa wa AI unavyofanya kazi, tangu wakati unapoandika neno hadi wakati agent anapotimiza kazi.
Msingi: Jinsi Mifumo Inavyofikiri
Katika kiini chake, mfumo mkubwa wa lugha (large language model) unafanya jambo moja tu: unatabiri token inayofuata. Token hiyo inaweza kuwa neno linalofuata, sehemu ya neno, au hata alama. Kila kitu kingine—mashairi, kodi, mantiki—ni tabia inayojitokeza kutokana na kufanya kazi hiyo moja kwa kiwango kikubwa.
Safari kutoka kwenye prompt yako hadi kwenye jibu la mfumo inaonekana hivi.
Tokenization ni hatua ya kwanza. Maandishi ghafi hayana maana kwa mtandao wa neva (neural network), hivyo mfumo unagawa maneno yako katika vipande na kuunganisha kila kipande na namba. Neno "tokenization" linaweza kuwa token tatu tofauti. Kirai "New York" kinaweza kuwa kimoja au viwili, kulingana na msamiati. Namba hizi si za kubahatisha; zinatoka kwenye kamusi maalum ambayo mfumo uliijifunza wakati wa mafunzo.
Mara tu maneno yanapokuwa namba, yanahitaji maana. Embeddings hugeuza namba hizo kuwa vekta (vectors)—orodha ndefu za thamani za floating-point zinazoweka dhana zinazofanana karibu pamoja katika nafasi ya hisabati. "King" na "Queen" zinakaa karibu mmoja na mwenzake. "Paris" na "Berlin" zinakusanyika pamoja lakini katika eneo tofauti na "Python" au "JavaScript."
Lakini vekta pekee hupoteza mpangilio. Positional encoding huambia mfumo mahali kila token ilipo katika sentensi. Bila hiyo, "The dog bit the man" na "The man bit the dog" zitaonekana sawa kabisa.
Kisha inakuja attention mechanism. Hapa ndipo mfumo unatazama token zote katika ingizo (input) na kuamua ni zipi muhimu kwa kutabiri inayofuata. Unapouliza, "Kampuni ilianzishwa lini, na nani anaongoza sasa?" mfumo unahitaji kuunganisha "founded" na tarehe na "leads" na jina la CEO. Attention hutengeneza miunganisho hiyo.
Operesheni hizi hujikusanya katika tabaka (layers)—mara nyingi makumi—ambapo tabaka za awali hushughulikia sarufi (syntax) na za baadaye hujenga mantiki ya kidhahania. Mahali fulani katikati, feed-forward networks huhifadhi uhusiano wa ukweli. Hapa ndipo mfumo unapoweka maarifa kwamba Paris ni mji mkuu wa Ufaransa, au kwamba API fulani inatarajia JSON payload. Sio kanzi data (database) hasa, bali ni mtandao uliokandamizwa wa uzito (weights) unaowasha mifumo.
Hatimaye, decoding hugeuza uwakilishi wa ndani wa vekta kuwa token zinazoweza kusomwa na binadamu. Mfumo "haujui" kuwa unaandika Kiingereza; unarangu (ranking) tu maelfu ya token zinazoweza kufuata na kuchagua inayowezekana zaidi, mara kwa mara, hadi unapofikia hali ya kusimama (stop condition).
Tabaka la RAG: Kuipa Mifumo Kumbukumbu
Mfumo wa msingi (base model) umefungwa katika wakati. Uzito wake unakamata mtandao wa internet hadi tarehe fulani, na hauwezi kufikia nyaraka zako binafsi isipokuwa uziweke. Hilo linaufanya usiwe na manufaa kwa kazi nyingi za kibiashara. Retrieval-Augmented Generation, au RAG, hurekebisha hili kwa kuupa mfumo maktaba ya nje ambayo unaweza kuishauri kabla ya kujibu.
Mpangilio ni rahisi kwa dhana lakini ni mgumu katika utendaji. Kwanza, unachukua nyaraka zako na kutumia chunking. Huweki PDF ya kurasa mia kwenye dirisha la prompt. Unagawanya katika aya, sehemu, au vizuizi vya kimaana (semantic blocks) vidogo vya kutosha kuingia ndani ya kikomo cha muktadha (context limit) cha mfumo huku ukiendelea kuhifadhi maana.
Kila kipande (chunk) hupitia embedding model na kuwa vekta, kama vile token zilizo ndani ya LLM. Vekta hizi zinaishi kwenye vector database—hifadhi maalum iliyoundwa kwa ajili ya utafutaji wa ufanani (similarity search) badala ya utafutaji wa usahihi (exact lookups). Mtumiaji anapouliza swali, unaweka swali lake katika mfumo wa embedding na kuuliza kanzi data: "Ni vipande gani vilivyo karibu zaidi na vekta hii kwa maana?"
Utafutaji wa vekta pekee mara nyingi hukosa matokeo sahihi. Mfumo mzuri wa uzalishaji hutumia hybrid search, ukichanganya ulinganishaji wa maneno muhimu (keyword
RAG inaruhusu modeli kusoma. Wakala (Agents) inairuhusu kutenda.
Wakala ni LLM iliyokwama ndani ya mzunguko (loop) kimsingi. Inatazama, inafikiri, inatenda, na kisha inatazama tena. Ukiuliza wakala akahifadhi tiketi ya ndege, haielezi tu jinsi uhifadhi unavyofanya kazi. Inagawanya kazi hiyo katika hatua, inaita kazi (functions) sahihi, inasoma majibu, na inajirekebisha.
Mzunguko huo unaonekana hivi. Tazama (Observe): wakala anasoma hali ya sasa—ombi lako, matokeo ya wito wa zana (tool calls) yaliyopita, na makosa yoyote. Fikiri (Reason): LLM inaamua nini cha kufanya baadaye, mara nyingi kwa kuunda mpango uliopangwa au kuchagua kutoka kwenye chaguzi zilizowekwa mapema. Tenda (Act): inaita zana.
Zana (Tools) ndizo zinazowaruhusu wakala kugusa ulimwengu halisi. Zinafafanuliwa kwa kutumia JSON schemas ambazo zinaambia modeli kwa usahihi ni vigezo (parameters) gani API inahitaji. LLM haifanyi maombi ya HTTP ya kiholela. Inajaza schema. "Iita API ya hali ya hewa ikiwa na mji: London na vipimo: metric." Ikiwa zana itarudisha joto, wakala anatoa
