Masukkan ringkasan hukum setebal 300 halaman atau laporan tahunan jilid ke dalam sebagian besar pipeline OCR, dan perangkat lunak tersebut akan memecahnya menjadi potongan-potongan secara diam-diam. Halaman satu, proses, kosongkan memori. Halaman dua, proses, kosongkan memori. Saat sistem mencapai lampiran di bagian belakang, konteks apa pun yang mungkin telah dikumpulkan dari pendahuluan sudah lama hilang. Catatan kaki menjadi yatim piatu. Tabel yang terbagi di berbagai halaman kehilangan strukturnya. Header yang berlanjut di berbagai halaman menjadi salah label. Hasilnya adalah file teks yang dijahit-jahit yang harus disusun kembali oleh manusia.
Baidu menganggap alur kerja ini secara fundamental rusak. Jawaban mereka adalah Unlimited OCR, sebuah arsitektur yang dirancang untuk menyerap dokumen multi-halaman yang masif dalam satu forward pass tunggal tanpa ledakan memori GPU yang biasanya menyusul. Triknya adalah mekanisme atensi baru yang memperlakukan memori bukan seperti hard drive, melainkan lebih seperti memori kerja manusia: simpan materi sumber di depan Anda, ingat apa yang baru saja Anda tulis, dan biarkan masa lalu yang jauh memudar.
Mengapa Dokumen Panjang Merusak OCR Standar
Untuk memahami solusinya, membantu untuk melihat di mana sistem OCR end-to-end konvensional gagal.
Sebagian besar pipeline OCR modern menggunakan model bahasa besar sebagai dekoder mereka. Saat model membaca sebuah halaman dan menghasilkan teks, ia menyimpan representasi internal yang disebut KV cache—pada dasarnya adalah buku harian berjalan dari keys dan values yang membantu model melacak apa yang telah dikatakannya. Masalahnya adalah buku harian ini tumbuh secara linier dengan setiap baris output baru. Proses sepuluh halaman, dan cache akan sedalam sepuluh halaman. Proses seratus halaman, dan ia akan membengkak menjadi ratusan ribu token, menguras VRAM dan memperlambat kecepatan generasi hingga merayap.
Para insinyur telah menangani hal ini dengan cara tidak menanganinya sama sekali. Mereka memotong dokumen menjadi halaman tunggal, menjalankan setiap halaman melalui model secara independen, dan menyetel ulang KV cache di setiap langkah. Ini menjaga sistem tetap berjalan, tetapi juga merampas benang merah berkelanjutan dari model tersebut. Sebuah paragraf yang dimulai di halaman tiga dan selesai di halaman empat akan terbelah. Pemformatan tabel lintas halaman hancur. Referensi ke bagian sebelumnya berubah menjadi tautan rusak karena dekoder tidak memiliki memori persisten tentang apa yang telah terjadi sebelumnya. Model tersebut tidak benar-benar membaca dokumen; ia hanya melakukan serangkaian kartu kilas (flashcards) yang terisolasi.
Trik Manusia: Reference Sliding Window Attention
Peneliti Baidu mengatasi hal ini dengan meminjam prinsip dari kognisi manusia. Pikirkan tentang menyalin sebuah kutipan dari buku secara manual. Anda tidak menyimpan setiap kalimat yang telah disalin sebelumnya di dalam pikiran Anda. Anda melirik sumbernya, melihat beberapa kata terakhir yang Anda tulis, dan melanjutkan. Memori kerja Anda sangat kecil, tetapi karena teks sumber tetap terbuka di depan Anda, tugas tersebut menjadi mudah.
Reference Sliding Window Attention, atau R-SWA, memformalkan intuisi ini secara tepat.
Di balik layar, KV cache menjadi antrean dengan panjang tetap. Saat model menghasilkan token baru, ia mempertahankan visibilitas penuh terhadap "reference tokens"—embedding gambar visual asli dan prompt awal—tetapi ia hanya melihat kembali ke 128 token terakhir yang telah ia hasilkan sendiri. Hanya itu. Baik model berada di halaman satu atau halaman lima puluh, jejak memori dari riwayat outputnya sendiri tetap terkunci di tempatnya. Cache tidak tumbuh. Ia mendaur ulang.
Ini adalah
