AgentInspect inaruhusu watengenezaji kunasa hatua kwa hatua za wakala wa AI kama logi za JSONL, jambo linalowezesha kuhakikisha kuwa zana zinazohitajika zilifanya kazi – yote bila kuhitaji kuunganisha OpenTelemetry kwenye mfumo.
Katika jaribio la haraka la mfano wa kukagua hali ya hewa ulioundwa kwa kutumia Vercel AI SDK, AgentInspect ilionyesha "kushindwa kwa kimya" (silent failure): jibu la mwisho lilikuwa sahihi, lakini wito wa zana ya hali ya hewa (weather-tool call) haukutokea kamwe. Ukaguzi wa kiwango cha mchakato wa maktaba hiyo uligundua tatizo ambalo jaribio la kawaida la matokeo lingeliacha lipite.
Kwa nini njia ya utekelezaji ni muhimu
Jibu la wakala wa AI ni bidhaa ya mwisho ya mnyororo unaoweza kujumuisha miito mingi ya modeli na wito wa zana za nje. Ikiwa prompt inapaswa kuchukua data ya moja kwa moja, kutokuwepo kwa upatikanaji huo kunabadilisha kiwango cha hatari hata wakati maandishi yanaonekana kuwa sahihi. Majaribio ya kiwango cha jibu (answer-level tests) huruhusu hitilafu inayopuuza hatua muhimu kuingia kwenye uzalishaji (production) bila kugundulika.
AgentInspect inafanya nini
- Rekodi nyepesi – Kiunganishi (adapter) cha TypeScript huunganishwa kwenye kodi ya wakala na kuandika kila mwito wa modeli, uendeshaji wa zana, na mpangilio wao kwenye faili ya JSON (JSONL) iliyogawanywa kwa mistari.
- Injini ya sheria – Watengenezaji hutangaza vigezo rahisi kama vile "zana ya hali ya hewa lazima iitwe" au "API ya fedha haipaswi kutumiwa." Maktaba hiyo hutathmini sheria hizi baada ya kila utekelezaji.
- Ukaguzi wa CLI – Utendaji ulioshindwa huwekwa kama faili ambazo zana ya mstari wa amri (command-line tool) iliyojengwa ndani inaweza kuzifungua kwa ajili ya kuonyesha tena kwa binadamu ufuatiliaji wa utekelezaji (execution trace).
Kwa sababu logi ni faili za ndani, hakuna haja ya mfumo wa nyuma wa ufuatiliaji (tracing backend), usanidi wa mtandao, au huduma tofauti ya ufuatiliaji (observability service).
Jinsi jaribio lilivyowekwa
- Ukaguzi wa mchakato – Sheria ilithibitisha kuwa mwisho wa zana ya hali ya hewa (weather-tool endpoint) uliitwa.
- Ukaguzi wa jibu – Uhakiki tofauti ulinganisha maandishi yaliyozalishwa na pendekezo linalotarajiwa la kutembelea maeneo ya ndani.
Matukio mawili yalitekelezwa:
| Scenario | Ukaguzi wa jibu | Ukaguzi wa mchakato |
|---|---|---|
| Njia iliyonyooka (hali ya hewa imechukuliwa) | Imepita | Imepita |
| Hali ya hewa imepitiwa (zana haikuitwa kamwe) | Imepita | Imefeli |
Utendaji wa pili unaonyesha thamani ya ukaguzi wa mchakato: jibu lilionekana kuwa sawa, lakini kutokuwepo kwa wito wa zana kulionyesha hitilafu iliyofichika.
AgentInspect dhidi ya Promptfoo
Promptfoo, mfumo wa majaribio uliothibitishwa zaidi, hunasa ufuatiliaji (traces) kupitia OpenTelemetry. Njia hiyo inafanya kazi vizuri kwa timu ambazo tayari zinatuma data ya telemetry kwenye mkusanyaji (collector), lakini inaongeza mzigo wa usanidi na utegemezi wa miundombinu ya ufuatiliaji.
AgentInspect inahisi kama hatua ya mapema ya maendeleo, lakini ni rahisi sana kuweka.
Nani anapaswa kujali
- Mifumo ya CI (CI pipelines) – Kuongeza hatua moja inayotekeleza AgentInspect na kusimamisha ujenzi (build) pindi sheria zinapokiukwa kunageuza hitilafu za kimya kuwa vikwazo vya wazi.
- Utafutaji wa hitilafu (Debugging) – Logi za JSONL zinaweza kufunguliwa ndani ili kuonyesha tena mfuatano kamili wa miito, hivyo kuokoa muda ikilinganishwa na kuchimbua kwenye dashibodi za ufuatiliaji za mbali.
- Timu za bidhaa – Kujua kuwa upatikanaji muhimu wa data ulifanyika kabla ya kutoa kipengele (feature) hupunguza hatari ya malalamiko ya watumiaji baadaye.
Hitimisho: wakati usahihi wa wakala wa AI unategemea hatua zinazochukua, na si maandishi ya mwisho pekee, kirekodi nyepesi kama AgentInspect kinaweza kugeuza hitilafu za mchakato zilizofichika kuwa kushindwa kunakoonekana na kunakoweza kufanyiwa majaribio—bila mzigo wa mfumo kamili wa ufuatiliaji.
