Wakala wako anayeendeshwa na LLM unaweza kufanya kazi vizuri kwenye onyesho (demo), kisha akaanza kulegalega na kuongeza gharama baada ya mazungumzo machache. Sababu ya siri siyo modeli isiyo thabiti—ni token drift, ongezeko la polepole la ukubwa wa prompt ambayo modeli inapaswa kuichakata kila wakati.

Token drift hutokea wakati kila mwingiliano unapoongeza maandishi zaidi kwenye muktadha wa pembejeo (input context) ya modeli. Historia ya mazungumzo, miundo ya zana (tool schemas), majibu ya API, na nyaraka zilizopatikana vyote hujikusanya, hivyo kila wito unaofuata unakuwa na mzigo mkubwa zaidi wa data. Kwa sababu muda wa uchakataji wa modeli na bei huongezeka kulingana na idadi ya token za pembejeo, gharama hupanda kwa kiwango cha mraba (quadratically) badala ya mstari (linearly).

Kwa nini tatizo hili hujitokeza kwenye uzalishaji (production), siyo kwenye maonyesho (demos)

Mifumo inayotumika halisi huhifadhi kila kitu: kila kauli ya mtumiaji, kila matokeo ya zana, kila kipande cha maarifa kilichopatikana. Mkusanyiko huu hubaki kuwa wa siri mpaka ucheleweshaji (latency) upande na ankara ya malipo ifike.

Vyanzo vya kawaida vya token drift

  • Nakala zinazojirudia (Repeated transcripts) – Kuweka kila ujumbe wa zamani kwenye prompt badala ya kuufupisha au kuufuta.
  • Miundo mizito ya zana (Heavy tool schemas) – Kutuma maelezo makubwa ya JSON ya uwezo wa zana kwenye kila mzunguko.
  • Matokeo mazito ya zana (Bulky tool results) – Kujumuisha majibu kamili ya API au mistari ya hifadhidata ambayo ina data nyingi kuliko zile ambazo wakala anazohitaji hasa.
  • RAG bloat – Retrieval-augmented generation (RAG) inayoongeza vipande vingi vya nyaraka, ambapo baadhi yake ni za zamani au zisizohusika.
  • Kumbukumbu inayojirudia (Duplicated memory) – Kuweka muhtasari, kitu cha hali (state object), na nakala ghafi pamoja, jambo ambalo linajirudia taarifa zilezile mara tatu.

Kila moja kati ya hizi huongeza token ambazo hazichangii nguvu mpya ya ufikiri, lakini huongeza ukubwa wa prompt.

Jinsi ya kudhibiti bajeti ya token

1. Tumia usanifu wa muktadha wa tabaka (layered context design)

  • Maelekezo thabiti (Stable instructions) – Weka prompt za mfumo na sheria za usalama juu kabisa na uzirejelee badala ya kuzituma tena kila mzunguko.
  • Hali iliyopangwa (Structured state) – Hifadhi uwakilishi mdogo wa malengo, maamuzi, na utambulisho (identifiers) ambao wakala anaweza kusoma haraka.
  • Historia iliyofupishwa (Compressed history) – Fupisha mizunguko ya zamani katika aya fupi inayosomeka na binadamu, ukifanya hivyo tu pale kikomo kinapofikiwa.
  • Mizunguko ya hivi karibuni (Recent turns) – Jumuisha ujumbe machache ya mwisho neno kwa neno ili kudumisha mwendelezo.

Kutenganisha maandishi yasiyobadilika kutoka kwa maudhui yanayoweza kufupishwa kunakuzuia kutuma maneno yaleyale mara kwa mara.

2. Punguza matokeo ya zana (Trim tool outputs)

  • Chujia tu nyanja (fields) ambazo wakala anazitumia hasa; toa maelezo marefu yasiyo na lazima.
  • Badilisha matokeo makubwa na muhtasari mfupi au kitambulisho cha rejeleo (reference ID), na hifadhi mzigo kamili wa data kwenye hifadhidata, cache, au blob store.
  • Zana inaporudisha orodha, tuma tu vitu vya juu-N (top-N items) ambavyo ni muhimu kwa uamuzi wa sasa.

3. Tumia ufupishaji wa akili (Apply smart summarization)

  • Usifupishe kila mzunguko; uchakataji wa ziada huongeza mzigo wa kazi.
  • Sasisha muhtasari pale tu idadi ya token iliyokusanywa ya mizunguko ya zamani inapovuka kikomo kilichowekwa.
  • Weka ukweli muhimu—ID, kiasi, nyakati (timestamps)—katika hifadhi iliyopangwa badala ya kuyaweka kwenye maandishi ya kawaida, ili muhtasari ubaki mfupi.

4. Fuatilia vipimo sahihi (Track the right metrics)

  • Logi matumizi ya token kwa kila wito wa modeli, siyo tu kwa kila ombi la mtumiaji. Hii hufichua ukuaji wa siri upande wa pembejeo.
  • Fuatilia idadi ya token za pembejeo zinazoongezwa kila mzunguko; ongezeko la ghafla huashiria chanzo cha token drift.
  • Tenganisha token zilizohifadhiwa (cached tokens) (zilizotumiwa tena kutoka wito uliopita) na token zinazozalishwa upya; zile za kwanza pekee ndizo husababisha token drift.

Chukulia prompt kama rasilimali yenye ukomo, siyo nakala isiyo na mwisho. Kwa kupima, kufupisha, na kupunguza kwa makusudi, unaweka wakala wako wa LLM kuwa na kasi, bei nafuu, na tayari kwa kiwango cha uzalishaji.

Funzo: Token drift huongeza gharama kimyakimya na kupunguza kasi ya wakala. Tambua sehemu zinazokua kwenye prompt yako, zifupishe au uzitenge nje, na ufuatilie matumizi ya token kwa kila wito. Mtazamo uliodhibitiwa huugeuza mshtuko wa ankara usiotabirika kuwa operesheni inayoweza kudhibitiwa na yenye bajeti rafiki.