Mtafiti mmoja alirekodi kila token aliyotumia wakala wake wa utafiti anayeendeshwa na LLM kwa mwezi mmoja na kupunguza bili kwa 31 %. Matumizi yalishuka kutoka $945 hadi $651 huku kiwango cha mafanikio kikiongezeka kutoka 91 % hadi 93 %, matokeo ambayo mtu yeyote anayerunisha mifumo ya AI inayozingatia gharama ataona.
Kwa nini data ya kiwango cha token ilikuwa muhimu
Watumiaji wengi wa LLM huona tu ankara ya mwisho – jumla ya kiasi inayoficha gharama ya kila kazi ndogo. Wakala wa mtafiti huyo alitekeleza vitendo vitatu vya msingi: kutafuta nyaraka za SEC, kuandaa ripoti, na kuunganisha muhtasari wa utafiti. Bila data ya kina, hakuweza kujua ikiwa ile $312 aliyolipa mwezi Juni ilitumika vizuri.
Ili kubaini uvujaji uliojificha, aliongeza tabaka la urekodishaji la PostgreSQL lililorekodi jina la modeli, idadi ya token, aina ya kazi, na gharama kwa kila mwito. Baada ya siku 30, data ilitoa picha ya wazi:
- Kutafuta nyaraka za SEC – 41 % ya matumizi yote
- Kuandaa ripoti – 28 %
- Muhtasari wa utafiti – 17 %
- Ukaguzi wa ubora – 9 %
- Mengineyo – 5 %
Namba zilionesha kuwa hatua ya gharama kubwa zaidi haikuwa modeli yenyewe bali jinsi wakala alivyoweka matokeo ghafi ya utafutaji kwenye prompt.
Marekebisho matatu yaliyopunguza gharama
1. Fanya muhtasari kabla ya kutuma prompt
Hapo awali, wakala alijaza matokeo 20 ghafi ya utafutaji kwenye kila prompt, jambo lililoongeza idadi ya token kwa kiasi kikubwa. Aliweka mfumo wa muhtasari wa bei rahisi kwanza, na hivyo kupunguza matumizi ya pembejeo (input). Gharama kwa kila kazi ya utafutaji ilishuka kutoka $0.84 hadi $0.19 – upungufu wa 77 %.
2. Elekeza ukaguzi rahisi kwenye modeli ya bei rahisi
Ukaguzi wa ubora ulifanyika kwa kutumia modeli ya hali ya juu iliyokuwa na gharama ya $0.09 kwa kila ukaguzi. Alibadilisha na kutumia modeli ya bei nafuu kwa ukaguzi mwingi wa pass/fail, na kupunguza bei ya kila ukaguzi hadi $0.01. Modeli hiyo ya bei rahisi ilijibu kwa usahihi 89 % ya wakati; hitilafu yoyote ilipelekwa kwenye modeli ya awali, hivyo kuhifadhi usahihi huku ikipunguza gharama kwa 87 %.
3. Ruka ukaguzi wakati ujasiri (confidence) ni mkubwa
Aliongeza sheria ya kuruka hatua ya ukaguzi wa ubora kila wakati ambapo kiwango cha mafanikio wa kihistoria wa kazi kilikuwa juu na urefu wa matokeo ulikuwa ndani ya mipaka inayotarajiwa. Hii iliondoa takriban 60 % ya ukaguzi ambao ungekuwa umefanyika hata hivyo.
Matokeo chanya
Kwa mabadiliko hayo matatu, hesabu ya mwezi ilionekana hivi:
- Matumizi ya jumla: $945 → $651 (punguzo la 31 %)
- Gharama ya utafutaji wa SEC kwa kila kazi: $0.84 → $0.19 (punguzo la 77 %)
- Gharama ya ukaguzi wa ubora kwa kila kazi: $0.09 → $0.01 (punguzo la 87 %)
- Kiwango cha mafanikio cha jumla: 91 % → 93 %
Kiwango cha juu cha mafanikio kinaashiria kuwa prompt fupi zilipunguza kelele (noise) na kusaidia modeli kuzingatia swali la msingi.
Tahadhari na hoja za kinyume
Mbinu hii inategemea mawazo mawili. Kwanza, mfumo wa muhtasari wa bei rahisi lazima ubaki na taarifa za kutosha kwa ajili ya ufuatiliaji wa kimantiki; ikiwa utatupa maelezo muhimu, ubora wa matokeo unaweza kushuka. Pili, modeli ya gharama nafuu inayotumiwa kwa ukaguzi wa ubora si kamilifu; usahihi wake wa 89% unamaanisha sehemu ndogo ya makosa bado inafika kwenye bidhaa ya mwisho, ingawa njia ya kuongeza (escalation path) inakamata nyingi kati ya hizo. Watumiaji wenye mahitaji makali zaidi ya uzingatiaji (compliance) wanaweza kuhitaji viwango vikali zaidi au hatua za ziada za uhakiki.
Hii inamaanisha nini kwa watendaji wa LLM
- Dashibodi za kina hushinda. Ripoti za matumizi za kiwango cha juu huficha upotevu wa token. Kurekodi matumizi kwa kila kazi hufichua ukosefu wa ufanisi ambao vinginevyo ungeendelea kuwa umefichika.
- Modeli za kisasa (frontier models) hazihitajiki kila wakati. Modeli ya bei rahisi inaweza kubana data au kufanya maamuzi rahisi ya binary bila kuharibu ubora wa jumla.
Gharama iliyofichika ya wakala wa LLM mara nyingi ni kazi isiyopimwa inayofanya. Kwa kuweka mifumo ya ufuatiliaji wa mtiririko wa token na kutumia uboreshaji wa lengo mahususi, mtafiti aligeuza bili ya kila mwezi ya $945 kuwa operesheni ya gharama nafuu ya $651 huku akiongeza ufanisi. Kwa mtu yeyote anayepanga bajeti ya kazi za AI, somo ni wazi: pima kila token, kisha acha data iamue wapi pa kupunguza.
