Anthropic ilipochapisha Building Effective Agents mwishoni mwa 2024, ilifanya jambo la kipekee katika tasnia hii: iliwapa wahandisi msamiati wa pamoja. Badala ya ilani nyingine kuhusu akili mnemba ya jumla (AGI), mwongozo huo ulitoa mifumo sita ya wazi ya kupanga mifumo ya LLM. Mwaka mmoja na nusu baadaye, mnamo 2026, hali inaonekana tofauti kabisa. Model Context Protocol imekuwa kiwango cha ulimwengu mzima. Claude imepata uwezo mpya. Mashirika mengi sasa yana angalau wakala (agent) mmoja unaofanya kazi katika mazingira halisi (production). Katika mazingira hayo, ni haki kuuliza ikiwa mifumo hiyo sita bado ina umuhimu, au ikiwa inapaswa kuwekwa kwenye kumbukumbu pamoja na uzito wa modeli (model weights) wa mwaka jana.
Nilitumia mifumo yote sita dhidi ya modeli ya ndani (local model) katika sehemu ya ziada (side repository) ili kubaini jambo hilo. Jibu ni ndiyo. Bado inafanya kazi. Lakini si kwa sababu ni sheria zisizoweza kubadilika. Inafanya kazi kwa sababu miezi kumi na minane iliyopita ya uzoefu wa uzalishaji (production) imethibitisha mantiki ya msingi ya mfumo huu.
Kile Ambacho Mfumo Huu Ulitupa Hali Halisi
Mifumo sita hiyo inastahili kukumbukwa kwa usahihi: Prompt Chaining, Routing, Parallelization, Evaluator-Optimizer, Orchestrator-Workers, na Autonomous Agents. Ile ya mwisho kimsingi ni mzunguko (loop) ambapo modeli inapanga, inatenda, inatazama, na kurudia hadi hali fulani itimizwe.
Wahandisi wengi walikuwa tayari wanachanganua prompts (chaining prompts) au kukabidhi kazi kwa nyaya za wafanyakazi (worker threads) kabla ya mwongozo huo kutokea. Kile ambacho Anthropic kilitoa ni taksonomia (taxonomy). “Wakala” (agent) wa mtu mmoja ulikuwa “mchakato wa kazi” (workflow) wa mtu mwingine, na “wito wa zana wa hatua nyingi” (multi-step tool call) wa mtu wa tatu. Mwongozo huo ulipanga vurugu hiyo katika makundi yenye mipaka ya wazi. Hilo lilifanya iwezekane kubishana kuhusu faida na hasara (trade-offs) bila kutoelewana. Katika nyanja inayozama katika sifa za juu (hype), lugha iliyo wazi ni aina fulani ya miundombinu.
Tasnia Ilijenga Juu Yake, Sio Pembeni Yake
Kufikia 2026, makundi haya yameingizwa kikamilifu katika jinsi timu zinavyounda mifumo. Anthropic bado anayafundisha katika kozi zao za Academy. Makala ya utafiti na blogu za uhandisi bado yanatumia makundi hayo hayo sita kuelezea usanifu (architectures) mpya. Aina hiyo ya uimara ni nadra kwa taaluma inayobadilisha teknolojia yake (stack) kila robo mwaka.
Sababu ni rahisi. Tasnia haikuibadilisha mfumo huu. Ilijenga juu yake. Zana mpya kama MCP na viwango vipya vya Agent Skills hufanya kazi kama mifumo ya mabomba (plumbing). Zinafanya iwe rahisi kuunganisha modeli na kanzi data (database), kuonyesha zana, au kusimamia hali (state). Lakini hazibadilishi mantiki ya lini kutumia router badala ya orchestrator. Bomba bora halibadilishi ramani ya nyumba.
Data za uzalishaji (production) za mwaka 2026 zinathibitisha hili. Mtindo wa kawaida zaidi wa utumiaji (deployment) bado ni wito mmoja wa matumizi ya zana uliounganishwa na uhakiki wa binadamu. Wa pili wa kawaida zaidi ni mchakato wa kazi wa hatua nyingi wenye mkabala mmoja tu kwa mtu. Yote mawili ni watoto wa moja kwa moja wa Prompt Chaining na Routing. Mizunguko kamili ya kiotomatiki (autonomous loops) bado ni ubaguzi, si kanuni, katika mifumo inayofanya kazi (live systems).
Kujizuia Kulishinda Soko
Ushauri bora zaidi wa mwongozo wa awali pia ulikuwa ushauri ambao mara nyingi ulipuuzwa mwaka 2024: tumia mfumo rahisi zaidi unaofanya kazi. Usiweke wakala kamili wa kiotomatiki (autonomous agent) ikiwa njia iliyoandikwa moja kwa moja (hardcoded path) itafanya kazi hiyo.
Soko hatimaye limekubali hili. Miradi mingi ya majaribio ya wakala (agent pilots) bado inafeli, na inafeli kwa sababu ile ile inayotabirika. Timu hujenga dhana (abstraction) juu ya dhana nyingine mpaka hakuna mtu anayeweza kufuatilia mipaka ya maamuzi. Mfumo unapopotoka, kutatua hitilafu (debugging) kunakuwa kama uchimbaji wa mabaki ya kale (archaeology). Makampuni ambayo yamefanikiwa katika uzalishaji ni yale yaliyoonyesha kiasi. Walitumia matumizi ya zana ya awamu moja (single-turn tool use) kama chaguo la kwanza. Waliongeza tabaka la uelekezi (routing layer) baada tu ya prompt moja kuonyesha kutokuwa na uthabiti. Walichukulia uhuru (autonomy) kama mzigo unaohitaji kuhalalishwa, si kipengele cha kusherehekewa.
Huu si upinzani dhidi ya azma. Ni hoja kwa ajili ya muundo (composition). Mifumo hiyo hufanya kazi vizuri zaidi unapoichanganya kwa makusudi badala ya kutafuta chaguo tata zaidi kwenye menyu kwa mazoea.
Pale Ambapo Mapengo Huanza Kuonekana
Mfumo huu si dawa ya kila kitu. Kuna mipaka migumu inayojitokeza mara tu unapokiacha hatua ya prototipu (prototype stage).
For high-frequency, low-cost tasks, deterministic code still wins. An LLM should not be normalizing a CSV column when pandas can do it in milliseconds without hallucinating. Avoid autonomous loops if you cannot define a crisp evaluation goal. Without a clear stopping condition, the model will iterate until it invents a reason to stop. For high-stakes decisions that require external grounding, do not rely solely on the model’s internal knowledge. And watch for bottlenecks in data retrieval. Any pattern that depends on vector search or external APIs can choke if your database is slow or your context window is clogged with irrelevant chunks.
These are not hypothetical edge cases. They are the constraints that separate a working demo from a system that survives the weekend.
A Rigid Check and a Wrong Failure
I learned the practical value of this framework while building my test repository. I was implementing the Evaluator-Optimizer pattern. My evaluator started as a hardcoded regex that scanned the model’s output for specific keywords. The model returned a correct, well-reasoned answer that happened to use synonyms instead of the exact words I was hunting. The evaluator flagged it as a failure.
The model was right. My check was too rigid.
Fixing it required more than expanding a word list. I switched the evaluator itself to an LLM-based judgment. That cost extra tokens and a few more milliseconds, but it restored the evaluation to the right level of abstraction. The pattern itself was sound. I had simply chosen the wrong implementation for the task. That is exactly the kind of mistake the framework is meant to prevent. Some evaluations need code. Others need a model. Knowing which is which is the whole point.
How to Use Them Now
Treat these six patterns as a starting point, not absolute law. Begin with a single prompt. If quality is inconsistent across input types, add a routing layer to send different requests to specialized prompts. If you need multiple independent perspectives before making a call, use Parallelization. If the task is large and divisible, try Orchestrator-Workers. Only reach for the full autonomous loop when the problem space is too wide to pre-map and when you have a reliable
