Wakala wa AI niliyeanzisha alifaulu majaribio 23 ya kitengo (unit tests), lakini ndani ya saa moja baada ya kuanza kufanya kazi, alibuni kipengele kipya cha bidhaa na kutoa bei ambayo ni mara tatu ya chini kuliko uhalisia. Mtumiaji alipomkosoa, bot alisisitiza msimamo wake, mazungumzo yakafikia kikomo, na nikampoteza mteja. Kosa hilo lilithibitisha kuwa mfululizo wa majaribio ya kitengo ya kimahesabu (deterministic unit tests) hayawezi kuhakikisha uaminifu wa wakala.

Kwa nini majaribio ya kitengo yanashindwa kwa wakala wa AI

Majaribio ya kitengo hufanya kazi kwa kodi za kawaida kwa sababu ingizo (input) lilelile huleta toleo (output) lilelile kila wakati. “2 + 2 = 4” ni uhakika unaoweza kuuhakiki kwa ukaguzi rahisi wa usawa. Hata hivyo, wakala unaoendeshwa na LLM hubadilisha toleo lake kulingana na maelekezo (prompt), muktadha unaozunguka, na hali ya zana yoyote ya nje anayoiita. Jaribio linalokagua usawa kamili wa maandishi (string equality) linakosa hallucinations, mabadiliko ya sauti, au ukiukaji wa mipaka (guardrails). Kufeli huku kwa kimya kulikomfanya nipoteze mteja kunaonyesha kuwa lazima utathmini mwingiliano mzima, si tu kazi (functions) zilizojitenga.

Kujenga mfumo wa tathmini (evaluation harness) kabla ya kodi yoyote ya kipengele

Nilibadilisha mpangilio wa maendeleo: kwanza nibuni mfumo wa tathmini wa tabaka nne, kisha niandike wakala. Mfumo huu unaendesha majaribio 131 kwa mpigo mmoja, gharama yake ni takriban senti tatu kwa kila mzunguko, na unamalizika kwa takriban dakika kumi na moja. Ninapangia kila jaribio modeli ndogo zaidi inayoweza kulishughulikia, nikiweka akiba ya modeli kubwa na ghali zaidi kwa nyakati ambazo zinaongeza thamani kweli.

Tabaka la 1 – Utendaji wa zana (Tool functionality)

Safu ya kwanza ya ulinzi inakagua ikiwa wakala anaweza kuitumia zana zake kwa usahihi. Majaribio yanajumuisha utafutaji uliofanikiwa, maswali yaliyoundwa vibaya kwa makusudi, na kufeli kwa API kunakosimuliwa. Kwa sababu matumizi ya zana ni ya kimahesabu (deterministic) kwa kiasi kikubwa—ama ombi limeundwa kwa usahihi au API inarudisha kosa—assertions rahisi za Python zinatosha. Kukamata ombi lililoundwa vibaya hapa kunazuia mkanganyiko wa baadaye.

Tabaka la 2 – Kufuata maelekezo (Instruction following)

Kisha mfumo unathibitisha kuwa wakala anaheshimu mipaka (guardrails). LLM ndogo inafanya kazi kama mtathmini, ikiskani majibu ya wakala ili kuona uzingatiaji: kubaki katika tabia iliyokusudiwa, kuepuka mada zilizopigwa marufuku, na kutoa JSON schema inayohitajika. Tabaka hili linakamatia mabadiliko ya kimaana (semantic drift) ambayo majaribio ya kitengo yanayapuuza, kama vile kuingia katika tabia isiyokusudiwa au kuvuja kwa maelekezo ya ndani (internal prompts).

Tabaka la 3 – Tabia inayolenga lengo (Goal-oriented behavior)

Tabaka la tatu ndilo muhimu zaidi. Linauliza ikiwa wakala kweli anatimiza kusudi lake. Kwa bot ya kutafuta wateja (lead-generation bot), hiyo inamaanisha kuthibitisha kuwa anauliza maswali sahihi ya sifa na kumrudishia binadamu pale inapofaa. Ninatumia modeli inayozingatia mantiki (reasoning-oriented model) hapa kwa sababu inaweza kutathmini mtiririko mzima bila kuongeza gharama. Ikiwa bot atashindwa kufikia lengo lake—hata kama amefaulu tabaka mbili za kwanza—anatajwa kwa ajili ya kurekebishwa upya.

Tabaka la 4 – Utendaji (Performance)

Hatimaye, mfumo unarekodi ucheleweshaji (latency) na kasi ya kuzalisha tokeni. Majibu ya polepole yanaharibu uzoefu wa mtumiaji, hasa katika mazungumzo ya wakati halisi. Kwa kufuatilia vipimo hivi pamoja na usahihi wa utendaji, nahakikisha wakala ni sahihi na anajibu kwa haraka.

Chaguzi za kuokoa gharama

Takwimu ya $0.03 kwa kila mzunguko si mbinu ya masoko; inatokana na kuoanisha ugumu wa jaribio na ukubwa wa modeli. Ukaguzi wa zana wa kimahesabu (deterministic) unaendeshwa kwenye mfumo wa bei rahisi zaidi, uzingatiaji wa maelekezo unatumia modeli nyepesi, na ni tathmini zinazolenga lengo pekee zinazohitaji modeli yenye uwezo zaidi, ingawa ni ghali zaidi. Mbinu hii ya ngazi inafanya gharama ya jumla kuwa ndogo vya kutosha kuendesha mfululizo mzima kwa kila mabadiliko ya kodi.

Mabadilishano: kasi dhidi ya usalama

Kuanzisha mfumo huu kuliongeza vikwazo vya awali. Mizunguko ya maendeleo ilirefuka, na ratiba ya uzinduzi ilichelewa.

Nini cha kufuatilia baadaye

  • Watathmini wanaoendeshwa na modeli: Kadiri LLM zinavyoboreka, mtathmini katika Tabaka la 2 anaweza kuwa na uelewa wa kina zaidi, akipunguza matokeo ya uongo (false positives) huku bado akigundua ukiukaji mdogo wa sera.

Hitimisho

Ikiwa unatengeneza wakala wa AI kwa ajili ya uzalishaji (production), mfumo wa tathmini wa tabaka nyingi si hiari; ni msingi. Kwa kuweka gharama ya majaribio ya kina mapema—$0.03 kwa kila mzunguko, dakika kumi na moja kwa kila mfululizo—unajilinda dhidi ya kufeli kwa kimya ambako majaribio ya kitengo hayawezi kukitambua.