Ukimtumia muhtasari wa kisheria wa kurasa 300 au ripoti ya mwaka iliyofungwa kwenye mifumo mingi ya OCR, programu itavunja nyaraka hiyo katika vipande kwa siri. Ukurasa wa kwanza, chakata, futa kumbukumbu. Ukurasa wa pili, chakata, futa kumbukumbu. Wakati mfumo unapofikia viambatisho vilivyo nyuma, muktadha wowote ambao unaweza kuwa umeupata kutoka kwenye utangulizi utakuwa umepotea kabisa. Viunganishi vya chini (footnotes) vinakuwa yatima. Majedwali yaliyogawanywa kwenye kurasa tofauti hupoteza muundo wake. Vichwa vya habari vinavyoendelea kwenye kurasa tofauti huwekwa vibaya. Matokeo yake ni faili ya maandishi iliyoshonwa pamoja ambayo binadamu lazima aiunganishe tena.
Baidu inaona kuwa mtiririko huu wa kazi umeharibika kimsingi. Jibu lao ni Unlimited OCR, usanifu ulioundwa ili kuingiza nyaraka kubwa za kurasa nyingi katika hatua moja bila mlipuko wa kumbukumbu ya GPU ambao kwa kawaida hufuata. Siri ni njia mpya ya uangalizi (attention mechanism) inayochukulia kumbukumbu kama kumbukumbu ya kazi ya binadamu badala ya diski ngumu: weka nyenzo chanzo mbele yako, kumbuka kile ulichoandika hivi punde, na uruhusu yaliyopita mbali yafifie.
Kwa nini Nyaraka Ndefu Huharibu OCR ya Kawaida
Ili kuelewa suluhisho hili, inasaidia kuona ni wapi mifumo ya kawaida ya OCR ya mwisho-hadi-mwisho (end-to-end) inapoanguka.
Mifumo mingi ya kisasa ya OCR hutumia modeli kubwa ya lugha (large language model) kama dekoda yake. Wakati modeli inaposoma ukurasa na kuzalisha maandishi, huhifadhi uwakilishi wa ndani uitwao KV cache—kimsingi ni shajara inayojiendesha ya funguo (keys) na thamani (values) zinazosaidia modeli kufuatilia kile ambacho tayari kimesemwa. Tatizo ni kwamba shajara hii hukua kwa kasi ya mstari (linearly) kwa kila mstari mpya wa matokeo. Chakata ukurasa kumi, na cache inakuwa na kina cha ukurasa kumi. Chakata mia moja, na inakuwa mamilioni ya tokeni, ikimaliza VRAM na kupunguza kasi ya uzalishaji hadi kufikia mwendo wa kusuasua.
Wahandisi wamekutana na hili kwa kutochukua hatua. Wanakata nyaraka katika kurasa moja moja, wanapitisha kila ukurasa kwenye modeli kwa kujitegemea, na kuweka upya KV cache kati ya kila hatua. Hii inafanya kazi, lakini pia huondoa uzi wowote wa mwendelezo kwa modeli. Aya inayoanza kwenye ukurasa wa tatu na kumalizika kwenye ukurasa wa nne hugawanywa katikati. Mpangilio wa majedwali ya kurasa tofauti unavunjika. Marejeleo ya sehemu za awali yanageuka kuwa viungo vilivyovunjika kwa sababu dekoda haina kumbukumbu ya kudumu ya kile kilichotangulia. Modelii haisomi nyaraka kweli; inafanya mfululizo wa kadi za kumbukumbu (flashcards) zilizojitenga.
Mbinu ya Kibinadamu: Reference Sliding Window Attention
Watafiti wa Baidu walishambulia hili kwa kuiga utambuzi wa kibinadamu. Fikiria kuhusu kunakili aya kutoka kwenye kitabu kwa mkono. Huweki kila sentensi uliyokwisha nakili kwenye akili yako. Unatazama chanzo, unaangalia maneno machache ya mwisho uliyoyaandika, na unaendelea. Kumbukumbu yako ya kazi ni ndogo, lakini kwa sababu maandishi chanzo yanabaki wazi mbele yako, kazi hiyo inakuwa rahisi.
Reference Sliding Window Attention, au R-SWA, inafanya intuition hii kuwa rasmi.
Ndani yake, KV cache inakuwa foleni yenye urefu maalum. Wakati modeli inapotengeneza tokeni mpya, inabaki na uwezo kamili wa kuona "reference tokens"—uwekaji wa picha za kuona (visual image embeddings) asilia na maelekezo (prompt) ya awali—lakini inaangalia tu maneno 128 ya mwisho ambayo imeyazalisha yenyewe. Hivyo tu. Iwe modeli iko kwenye ukurasa wa kwanza au wa hamsini, kiwango cha kumbukumbu cha historia yake ya matokeo kinabaki palepale. Cache haikui. Inajirudia.
Hii ni
