Prototipe ya RAG ya mwanatengenezaji ilikataa kujibu swali lolote lenye ufanani wa cosine (cosine similarity) chini ya 0.50. Ilifanya kazi vizuri sana—hadi pale modeli ya embedding ilipobadilishwa. Kizuizi (guard) kisha kiliacha majibu yasiyo sahihi kupita kimyakimya. Tukio hili linathibitisha kuwa kiwango cha ufanani kilichowekwa moja kwa moja (hard-coded similarity threshold) kinaweza kufeli wakati modeli zinapobadilishwa, hatari inayotishia mfumo wowote unaotegemea ufanani wa embedding kwa ajili ya ukaguzi wa usalama.

Kwa nini kiwango hicho kilikuwa muhimu

Mifumo ya Retrieval-augmented generation (RAG) mara nyingi hutumia kizuizi cha ufanani: ikiwa ufanani wa cosine kati ya swali na hati yake ya karibu iko chini ya namba iliyowekwa, mfumo unakataa kutoa jibu. Kizuizi hiki huizuia modeli isitengeneze majibu ya uongo (hallucinating) wakati muktadha uliopatikana ni dhaifu. Katika mpangilio wa awali, kiwango cha 0.50 kiliifanya mifumo iwe ya kweli—maswali yasiyoweza kujibiwa yalipata alama chini ya kiwango hicho, na yale yanayoweza kujibiwa yalipata juu yake.

Wakati mfumo wa embedding (embedding backend) ulipobadilishwa, kiwango kile kile cha 0.50 hakikutenganisha tena makundi hayo mawili. Mfumo ulianza kutoa majibu yenye ujasiri lakini yasiyo sahihi bila kusababisha hitilafu yoyote au kosa la wazi. Kufeli huku hakukuonekana katika vipimo vya kawaida vya upangaji (ranking metrics) na kulionekana tu wakati binadamu alipoona mabadiliko hayo.

Jiometri si ya ulimwengu wote

Kila modeli ya embedding huchora lugha katika nafasi yenye vipimo vingi (high-dimensional space) ikiwa na jiometri yake yenyewe. Kwa hivyo, thamani za ufanani wa cosine zina maana tofauti kutoka modeli moja hadi nyingine. Alama ya 0.50 inaweza kuwa kwenye ukingo wa pengo la wazi kwa modeli moja na ndani kabisa ya eneo linaloingiliana kwa nyingine.

  • Voyage-3 – mstari wa 0.50 upo kati ya maswali yasiyoweza kujibiwa yenye alama ndogo na yale yanayoweza kujibiwa yenye alama kubwa. Kizuizi kinafanya kazi kama ilivyokusudiwa.
  • BGE-Small – maswali mengi yasiyoweza kujibiwa hupata alama zaidi ya 0.50, hivyo kizuizi hakifanyi kazi kamwe. Kuongeza kiwango hadi 0.70 kunarudisha ulinzi wa usalama.
  • Hashing-64 – alama za maswali yanayoweza kujibiwa na yasiyoweza kujibiwa zimechanganyika sana kiasi kwamba hakuna kiwango kimoja kinachoweza kuzitenganisha; modeli hii ni dhaifu sana kiasi kwamba haiwezi kuunga mkono kizuizi cha ufanani kabisa.

Mifano hii inaonyesha ukweli mpana: kiwango (threshold) ni cha jozi maalum ya modeli-data, si sheria ya ulimwengu wote.

Gharama iliyofichika ya thamani isiyobadilika

Viwango vya ufanani hutokea katika kazi nyingi za baadaye (downstream tasks):

  • semantic caching
  • utambuzi wa nakala zinazofanana (duplicate detection)
  • ukaguzi wa uhusiano wa hati (document relevance checks)
  • ulinganishaji wa viumbe/kitambulisho (entity matching)

Kutumia thamani isiyobadilika kunachukulia kuwa modeli zote za embedding zina usambazaji wa alama unaofanana—dhana hii ni hatari. Dhana hii inapofeli, mifumo hutoa majibu yenye ujasiri wa uongo kimyakimya, jambo linalopunguza imani ya mtumiaji na kupeleka data zisizo za kweli kwenye maamuzi ya baadaye.

Kurekebisha vizuizi kwa kila modeli

Suluhisho ni rahisi: usiwahi kutoa programu yenye thamani isiyobadilika iliyowekwa moja kwa moja (hard-coded constant). Chukulia kiwango hicho kama hyper-parameter ambayo lazima itengenezwe kwa ajili ya kila modeli mpya ya embedding.

  1. Kusanya seti ndogo ya uthibitishaji (validation set) iliyowekwa lebo inayojumuisha maswali yanayoweza kujibiwa na yasiyoweza kujibiwa.
  2. Piga hesabu za ufanani wa cosine kwa kila jozi ya swali-hati ukitumia modeli inayolengwa.
  3. Chora usambazaji (distributions) huo miwili au piga hesabu ya kiwango cha ujasiri wa uongo (false-confident rate)—uwiano wa maswali yasiyoweza kujibiwa yanayozidi kiwango kilichopendekezwa.
  4. Chagua thamani ndogo zaidi ya ufanani inayofanya kiwango cha ujasiri wa uongo kikae chini ya kiwango cha hatari kinachokubalika.

Kwa sababu lengo ni kuzuia ujasiri uliopitiliza, vipimo vya kawaida vya upangaji kama mean reciprocal rank (MRR) havitoshi. Kiwango cha ujasiri wa uongo kinapima moja kwa moja namna kizuizi kinavyofeli.

Hoja kinyume: “Baadhi ya modeli hufanya kazi moja kwa moja”

Ni kweli kwamba modeli fulani zinazofanya kazi vizuri, kama Voyage-3 katika mfano huu, zinatokea kuendana na kizuizi cha 0.50. Hiyo haihakikishii utulivu wa baadaye. Maboresho ya modeli, fine-tuning, au hata mabadiliko katika mkusanyiko wa data (corpus) yanaweza kubadilisha usambazaji wa ufanani, na kuvunja kizuizi tena. Kutegemea muunganiko mmoja wa bahati mbaya huleta hali ya kutosahau umakini.

Nini cha kuangalia baadaye

-

-

-

Hitimisho

Kiwango cha ufanani si swichi ya usalama ya ulimwengu wote; ni kizuizi maalum cha modeli ambacho lazima kirekebishwe kila wakati unapobadilisha mfumo wa embedding au data inayotumika. Kupuuza ukweli huu kunaruhusu mifumo ya RAG kuingia katika hali ya uongo wa kimyakimya (silent hallucination), jambo linaloharibu lengo kuu la kizuizi hicho. Njia pekee ya kuaminika ni kurekebisha kwa utaratibu kwa kila modeli na kufuatilia mara kwa mara kiwango cha ujasiri wa uongo.