Jinsi jaribio lilivyowekwa
Mwandishi alijenga mfumo mdogo wa utengenezaji unaosaidiwa na utafutaji (RAG) unaozunguka hati mbili za kanuni za malipo na akaendesha ukaguzi wa aina mbili:
- Jaribio la Recall – je, ukurasa sahihi ulionekana miongoni mwa matokeo matano ya juu? Matokeo: 60 %.
- Jaribio la Jibu – je, jibu la mwisho lililotolewa na mtengenezaji (generator) lilikuwa sahihi? Matokeo: 90 %.
Pengo la 40 % lilionekana hali isiyowezekana. Ikiwa mfumo wa utafutaji (retriever) ulikosa ukurasa sahihi mara nne kati ya kumi, niwezaje modeli bado ikajibu kwa usahihi mara tisa kati ya kumi?
Jaribio la kwanza la "kurekebisha" mfumo wa utafutaji (retriever)
Mvumbuzi alijaribu mbinu mbili za kawaida:
- Hybrid search – kuchanganya ishara za kileksika (lexical) na za vekta (vector). Recall ilibaki vilevile.
- Reranker – kupanga upya kurasa tano zilizopatikana. Recall ilipanda hadi 70 % lakini bado ilikuwa nyuma sana ya usahihi wa jibu wa 90 %.
Zana zote mbili zinapanga upya tu kile ambacho tayari kimepatikana; haziwezi kuleta ukurasa ambao haukuwahi kuingia kwenye seti ya wagombe (candidate set). Tatizo lilikuwa mahali pengine.
Kipimo, na si modeli, ndicho kilichokuwa na hitilafu
Badala ya kuhukumu mafanikio kwa kutumia lebo ya ukurasa, mwandishi alikagua ukweli halisi katika vipande (chunks) vilivyopatikana. Katika tatu kati ya "makosa" manne, ukweli sahihi ulikuwepo, lakini ulikuwa kwenye ukurasa tofauti na ule ambao skripti ya jaribio ilitarajia. Tathmini iliuadhibu mfumo wa utafutaji kwa kupata jibu sahihi kwenye ukurasa usiotarajiwa.
Wakati kipimo kilipobadilishwa kuwa "je, kuna kipande chochote kilichopatikana kinachounga mkono ukweli unaohitajika?", recall ilipanda hadi 90 %, ikilingana na usahihi wa jibu. Mfumo wa utafutaji ulifanya kazi; mfumo wa tathmini haukufanya kazi.
Kwa nini recall ya kimapokeo inaweza kupotosha
- Uwekaji lebo katika kiwango cha ukurasa unaunda makosa ya kufikirika. Ukweli mmoja unaweza kuonekana kwenye kurasa kadhaa. Kuweka alama ukurasa mmoja tu kama ukweli wa msingi (ground truth) huchukulia makosa mengine yote sahihi kama makosa.
- Mikusanyiko midogo ya maandishi (corpora) huongeza athari hii. Kwa nyaraka chache, ukurasa mmoja uliowekwa lebo vibaya unaweza kubadilisha recall kwa kiasi kikubwa wakati usahihi wa jibu unabaki vilevile.
- Kelele za embedding huficha ukweli. Vekta hutoa alama kwa kurasa nzima; maandishi ya kisheria au kiufundi yanayozunguka yanapunguza ishara ya uhusiano ya sentensi inayolengwa, na kusukuma ukurasa chini katika upangaji hata kama ukweli upo.
Mafunzo ya vitendo kwa watendaji wa RAG
- Tenganisha upangaji (ranking) na makosa ya utafutaji (retrieval). Rerankers hurekebisha tu ule wa kwanza; ikiwa kipande sahihi hakijawahi kuingia kwenye seti ya wagombe, kupanga upya hakusaidii chochote.
- Weka lebo za data za jaribio katika kiwango cha ukweli. Unganisha kila swali na kipande mahususi cha habari kinachohitajika, badala ya kutumia utambulisho wa hati moja tu.
- Usiamini vipimo vikubwa (benchmarks) kwa seti ndogo za data. Mikusanyiko midogo ya maandishi ya nyanja maalum hufanya kazi tofauti, na alama za recall za jumla zinaweza kupotosha.
- Zingatia ukubwa wa vipande vya embedding (granularity). Kipande chenye ukubwa wa ukurasa kina maneno mengi, na maandishi ya kisheria yanayozunguka yanaweza kushusha daraja la ukweli unaoujali.
Hitimisho: alama ya juu ya usahihi wa jibu inaweza kuwepo pamoja na takwimu ndogo ya recall ya kimapokeo wakati tathmini haijaendana na kazi inayofanyika. Kurekebisha kipimo, na si modeli, huokoa muda, hupunguza tahadhari za uongo, na kutoa mifumo ya RAG inayoweza kuaminika zaidi.
