AWS imeongeza query-aware compression kwenye huduma yake ya Bedrock, ikiruhusu watengenezaji kupunguza vipande visivyo na umuhimu vya hati kabla havijafika kwenye modeli ya lugha. Kwa kupunguza token zinazotumwa kwenye modeli, kipengele hiki kinaweza kupunguza gharama za kompyuta kwa mifumo ya Retrieval-Augmented Generation (RAG).
Kwa nini mifumo ya RAG hutumia pesa nyingi
Mifumo ya RAG kwanza huchukua vifungu vya maandishi kutoka kwenye kanzi thani ya maarifa (knowledge base), kisha hutoa vifungu hivyo kwa modeli ya uundaji (generative model) ili kujibu swali la mtumiaji. Mitambo mingi hutuma kila kipande kilichopatikana moja kwa moja kwenye modeli, hata wakati sehemu kubwa ya maandishi haina uhusiano wowote na swali. Kila neno la ziada linakuwa token, na kila token ambayo modeli inachakata huongeza gharama kwenye API inayotumika. Kwa kampuni ndogo na za kati zinazoendesha roboti za msaada (support bots) au zana za utafutaji za ndani, matumizi ya token yanaweza kuzidi haraka gharama za simu za modeli zenyewe.
Kazi ya query-aware compression
Uwezo mpya wa Bedrock unaingiza hatua ya kuchuja kati ya upatikanaji (retrieval) na uundaji (generation):
- Mfumo bado unachukua seti ile ile ya hati kwa swali fulani.
- Kabla ya modeli kuona maandishi yoyote, kichakataji chepesi (lightweight processor) huchambua kila kifungu kulingana na swali mahususi.
- Sehemu tu zinazoonekana kuwa na umuhimu hubaki; nyingine zote hutupwa kama kelele (noise).
Hauhitaji index mpya, modeli ya embedding, au modeli ya lugha iliyoboreshwa (fine-tuned). Mabadiliko ni kuunganisha upya mtiririko (pipeline) ili kuita tabaka la ubanaji (compression layer).
Athari kwa biashara
Kwa sababu ada za token huongezeka kulingana na kiasi cha maandishi yanayotumwa kwenye modeli, kuondoa vipande visivyo na umuhimu kunaweza kupunguza bili hatua kwa hatua. Kampuni ambazo zimeona gharama zao za RAG zikiongezeka sana kadiri matumizi yanavyoongezeka zitapata faida kubwa zaidi.
Nini cha kufuatilia baadaye
- Jaribu kipengele hiki kwa data zako mwenyewe: Fanya jaribio la kulinganisha mtiririko wa kawaida wa RAG dhidi ya ule unaojumuisha query-aware compression. Pima idadi ya token, ucheleweshaji (latency), na uhusiano wa jibu.
- Uwazi wa watoa huduma: Unapofanya tathmini ya majukwaa ya RAG ya upande wa tatu, uliza ikiwa wanatumia ubanaji au uchujaji katika mifumo yao ya upatikanaji. Muuzaji anayetuma vipande ghafi (raw chunks) huenda akatoa ankara za kila mwezi zenye gharama kubwa zaidi.
Hitimisho
Marekebisho madogo ya mtiririko—kuchuja maandishi yasiyo na umuhimu kabla hayajafika kwenye modeli—yanaweza kubadilisha gharama iliyofichika kuwa kipengele kinachoweza kudhibitiwa. Kwa mashirika ambayo tayari yanalipia RAG inayotegemea Bedrock, kuwezesha query-aware compression ni jaribio lenye juhudi kidogo, lakini akiba yoyote itategemea data yako mahususi.
