Timu ya Foundry ya Microsoft imeongeza ufuatiliaji (tracing) unaozingatia OpenTelemetry kwenye mfumo wake wa mawakala (agent framework), ikitoa njia kwa watengenezaji kuona utekelezaji wa mwisho hadi mwisho (end-to-end) katika mawakala mbalimbali wanaochochewa na LLM.
Kwa nini mifumo ya mawakala wengi (multi-agent systems) inahitaji zaidi ya faili za log
Mazoezi ya kawaida ya majibu ya matukio yanayoendeshwa na AI hutumia wakala mkuu (commander agent) ambaye anaratibu mawakala kadhaa wa kitaalamu: mmoja anachambua log, mwingine anagundua hitilafu za vipimo (metric anomalies), wa tatu anaunganisha dalili na miongozo ya utendaji (runbooks), na kielelezi (router) huchagua modeli bora ya lugha kwa kila kazi ndogo. Kila mtaalamu anaweza kuitia wazi modeli tofauti—kwa mfano, toleo la “gpt-5-mini”—na kuitumia zana zake mwenyewe. Jambo linapoharibika, wahandisi hutazama log zilizojitenga ambazo zinaonyesha kile kila sehemu ilifanya, lakini hakuna mtazamo wa jinsi vipande hivyo vinavyoungana.
Bila ufuatiliaji (trace) uliounganishwa, chanzo cha tatizo hujificha katika makabidhiano kati ya mawakala. Wakala mkuu anaweza kutuma ombi ambalo msomaji wa log anashughulikia kwa usahihi, lakini mtaalamu wa vipimo anatafsiri vibaya data na kupendekeza runbook isiyo sahihi. Kurekebisha mnyororo huo kwa mkono huchukua muda na huleta makosa.
Jinsi OpenTelemetry inavyounganisha mtiririko wa kazi
OpenTelemetry inafafanua dhana mbili kuu: traces na spans. Trace ni utambulisho wa kipekee unaofuata ombi kuanzia mwanzo hadi mwisho. Span inarekodi operesheni moja—kama vile kuitia wazi modeli ya lugha au kuitumia zana—ndani ya trace hiyo.
Wakala anapopokea ombi, huchukua Trace ID inayokuja kutoka kwenye metadata ya ombi na kutengeneza child span ambayo inarithi ID hiyo hiyo. Child span inarekodi muda wake wa kuanza, muda uliotumika, sifa (jina la modeli, zana iliyotumika) na makosa yoyote. Mchakato huu unajirudia kwa kila wakala wa chini (downstream agent), ukijenga mti unaoakisi mtiririko wa kimantiki wa kazi nzima.
OpenTelemetry pia inasaidia Baggage, ambayo ni kubebea rahisi kwa jozi za funguo-thamani (key-value pairs) maalum. Kwa kuambatanisha “drill-id” au muktadha mwingine wa biashara kwenye baggage mwanzoni mwa trace, kila span ya chini inarithi utambulisho huo moja kwa moja. Kisha, span processor inageuza baggage kuwa sifa za kawaida, na kufanya iwe rahisi kuuliza (query) spans zote zinazohusiana na mazoezi fulani ya matukio.
Muonekano wa ufuatiliaji mpya
Kwa kuwepo kwa uwekaji wa vifaa (instrumentation), Azure Monitor (au backend yoyote inayokubaliana na OpenTelemetry) huonyesha mpangilio wa picha (visual hierarchy):
- Jina la Wakala / ID – inaonyesha ni sehemu gani ilitekeleza operesheni hiyo.
- Matumizi ya Zana – inarekodi ni huduma au kazi (function) gani ya nje iliyoitwa.
- Toleo la Model – inarekodi LLM halisi iliyotumika, ambayo ni muhimu kwa kufuatilia mabadiliko baada ya kuongeza toleo la modeli.
- Matumizi ya Token – inarekodi ni token ngapi zilitumwa na kupokelewa kutoka kwa modeli, ikisaidia timu kudhibiti gharama.
- Latency / muda uliotumika – inaonyesha mahali ambapo vikwazo (bottlenecks) vinatokea, iwe katika ufuatiliaji wa modeli (model inference) au I/O ya zana.
Katika mfano wa mazoezi ya matukio, root span ya wakala mkuu inazalisha child spans kwa kila mtaalamu, na kila mtaalamu anazalisha watoto zaidi kwa ajili ya simu zake za modeli. Kubofya sehemu yoyote (node) kunaonyesha seti kamili ya sifa, hivyo mhandisi anaona maelezo ya kila operesheni papo hapo.
Umuhimu kwa operesheni zinazozingatia AI
- Kasi ya uchambuzi wa chanzo cha tatizo – Timu hufuatilia hitilafu hadi kwenye span husika iliyotupa kosa, na kupunguza muda wa wastani wa kutatua tatizo (mean time to resolution).
- Uoni wa gharama – Idadi ya token inaonyeshwa kando ya latency, ikiruhusu idara ya fedha kugundua matumizi yaliyopitiliza kabla ya bili za wingu (cloud bills) kuongezeka sana.
- Urekebishaji wa utendaji – Span zenye latency kubwa katika mawakala huonyesha mahali ambapo caching, uteuzi wa modeli, au usanifu upya wa zana unaweza kuongeza ufanisi.
Nini cha kufuatilia baadaye
Miradi iliyojengwa juu ya LangChain, OpenAI SDK, au tabaka nyingine za uratibu (orchestration layers) inaweza kutumia kanuni zilezile za kimaana (semantic conventions) kwa GenAI, ikifungua njia kwa traces zinazoweza kupita kwenye watoa huduma za wingu na mifumo ya ndani (on-premise deployments).
Mashirika yanapaswa tu kuwezesha OpenTelemetry SDK kwenye mawakala wao na kutuma data kwenye Azure Monitor au mkusanyaji (collector) wa chanzo huru.
Hitimisho
OpenTelemetry inatoa kiungo muhimu kwa mifumo ya AI ya mawakala wengi inayogeuza mrundikano wa log kuwa simulizi inayoeleweka. Kwa kusambaza Trace ID moja kupitia LLM mbalimbali, router, na simu za zana, watengenezaji wanapata mahali hitilafu zilipo, wanadhibiti gharama, na kuboresha utendaji bila kuhitaji kutengeneza upya miundombinu ya ufuatiliaji.
