Sebuah benchmark terbaru menunjukkan bahwa desain memori dua lapis—scratchpad berbasis RAM ditambah vault SQLite-vec lokal—menghasilkan waktu kueri median di bawah 100 ms sekaligus menghilangkan tagihan $135 per bulan yang terkait dengan penyimpan vektor cloud populer. Pengembang yang membangun agen AI otonom dapat menjalankan pengaturan on-premise murni yang, dalam benchmark tersebut, lebih cepat dan tidak memerlukan biaya bulanan.
Mengapa pendekatan memori yang ada saat ini kurang memadai
Agen AI sering kali perlu mengingat ribuan interaksi masa lalu, fakta, atau hasil pemanggilan alat (tool-call) dalam jendela respons yang sempit. Sebagian besar tim memasukkan setiap embedding ke dalam database vektor terkelola dan mengandalkan pencarian vektor jarak jauh untuk setiap pencarian. Model tersebut memang dapat diskalakan, tetapi memaksa setiap kueri melewati jaringan, sehingga meningkatkan waktu tempuh bolak-balik (round-trip time) dan pengeluaran bulanan. Dalam benchmark tersebut, latensi median layanan cloud berada di angka 127 ms dan tagihannya mencapai lebih dari $135 untuk bulan tersebut; periode pengujian juga mencatat adanya gangguan layanan (outage).
Membagi memori menjadi dua tingkatan
Arsitektur dua tingkat ini memisahkan "memori kerja" dari "penyimpanan jangka panjang":
L1 Scratchpad (RAM)
- Berjalan sepenuhnya di dalam memori proses.
- Menyimpan konteks tugas saat ini dan pemanggilan alat (tool calls) terbaru.
- Menyimpan string mentah; tidak ada embedding yang dihasilkan.
- Mengembalikan hasil dalam waktu kurang dari 3 ms, sebanding dengan cache CPU.
L2 Vault (SQLite-vec)
- Menyimpan semua embedding lainnya dalam database SQLite lokal yang diperluas dengan kemampuan pencarian vektor.
- Menangani seluruh set 14.726 memori yang digunakan dalam benchmark.
- Mengembalikan kecocokan dalam waktu sekitar 94 ms, jauh di bawah target 100 ms untuk banyak agen real-time.
- Tidak memakan biaya selain penyimpanan mesin host.
SQLite-vec adalah ekstensi sumber terbuka yang menambahkan pencarian tetangga terdekat perkiraan (approximate nearest-neighbor search) ke file relasional standar. Karena database berada di mesin yang sama dengan agen, tidak ada lompatan jaringan (network hop), dan mesin tersebut menggunakan kembali trik pengindeksan SQLite yang sudah ada untuk menjaga kecepatan pencarian.
Angka yang penting
| Sistem | Latensi median | Biaya bulanan | Keandalan yang dilaporkan |
|---|---|---|---|
| Cloud vector store (Pinecone) | 127 ms | ~$135 | Teramati adanya gangguan |
| Local SQLite-vec vault | 94 ms | $0 | Uptime 100% |
Perbedaan biayanya adalah $0 dibandingkan dengan sekitar $135 per bulan.
Menjaga vault tetap rapi
Tumpukan mentah dari semua embedding dapat mengurangi relevansi. Penulis benchmark memperkenalkan sistem peluruhan (decay system) yang memberi skor pada memori berdasarkan kebaruan (recency) dan frekuensi:
- Item baru atau yang sering diakses menerima bobot yang lebih tinggi.
- Item yang sudah lama tidak disentuh secara bertahap kehilangan bobot.
- Peluruhan berbobot ini memangkas "noise pengambilan" (retrieval noise)—kecocokan yang tidak relevan—sebesar 34%.
Dengan memangkas entri berskor rendah atau menurunkannya dalam indeks, agen menghindari data usang sambil menjaga vault tetap ramping untuk performa yang konsisten.
Kesimpulan
Untuk agen AI yang harus mengelola ribuan memori di bawah tenggat waktu yang ketat, scratchpad berbasis RAM yang dipasangkan dengan vault SQLite-vec lokal menawarkan alternatif pragmatis terhadap penyimpan vektor berbasis cloud sepenuhnya. Pendekatan ini memangkas waktu respons, menghilangkan biaya cloud yang berulang, dan memberikan layanan tanpa gangguan, semuanya sambil tetap mempertahankan kemampuan untuk memangkas data yang tidak relevan. Oleh karena itu, mengadopsi model dua tingkat dapat membuat agen menjadi lebih cepat, lebih murah, dan lebih andal.
