Een recente benchmark laat zien dat een geheugenontwerp met twee lagen — een RAM-gebaseerde scratchpad plus een lokale SQLite-vec vault — mediane querytijden van minder dan 100 ms oplevert, terwijl de maandelijkse rekening van $135 voor een populaire cloud vector store wordt geëlimineerd. Ontwikkelaars die autonome AI-agents bouwen, kunnen een volledig on-premise setup draaien die in de benchmark sneller was en geen maandelijkse kosten met zich meebracht.
Waarom bestaande geheugenbenaderingen tekortschieten
AI-agents moeten vaak duizenden eerdere interacties, feiten of resultaten van tool-calls onthouden binnen een krappe responstijd. De meeste teams sturen elke embedding naar een beheerde vector database en vertrouwen bij elke lookup op remote vector search. Dat model schaalt wel, maar dwingt elke query door het netwerk, wat de round-trip tijd en de maandelijkse uitgaven opdrijft. In de benchmark lag de mediane latentie van de clouddienst op 127 ms en liep de rekening voor die maand op tot boven de $135; tijdens de testperiode werd er ook een outage geregistreerd.
Het opsplitsen van het geheugen in twee lagen
De architectuur met twee lagen scheidt het "werkgeheugen" van de "langetermijnopslag":
L1 Scratchpad (RAM)
- Draait volledig in het procesgeheugen.
- Bevat de huidige taakcontext en de meest recente tool-calls.
- Slaat ruwe strings op; er worden geen embeddings gegenereerd.
- Levert resultaten op in minder dan 3 ms, vergelijkbaar met een CPU-cache.
L2 Vault (SQLite-vec)
- Slaat alle andere embeddings permanent op in een lokale SQLite-database die is uitgebreid met vector search-mogelijkheden.
- Verwerkt de volledige set van 14.726 geheugens die in de benchmark werden gebruikt.
- Levert matches op in ongeveer 94 ms, ruim onder de doelstelling van 100 ms voor veel real-time agents.
- Kost niets buiten de opslag van de hostmachine.
SQLite-vec is een open-source extensie die approximate nearest-neighbor search toevoegt aan een standaard relationeel bestand. Omdat de database op dezelfde machine staat als de agent, is er geen network hop nodig, en hergebruikt de engine bestaande SQLite-indexeringstechnieken om lookups snel te houden.
Cijfers die ertoe doen
| Systeem | Mediane latentie | Maandelijkse kosten | Gerapporteerde betrouwbaarheid |
|---|---|---|---|
| Cloud vector store (Pinecone) | 127 ms | ~$135 | Outages waargenomen |
| Lokale SQLite-vec vault | 94 ms | $0 | 100 % uptime |
Het kostenverschil is $0 tegenover ongeveer $135 per maand.
De vault netjes houden
Een ruwe dump van alle embeddings kan de relevantie verwateren. De auteur van de benchmark introduceerde een decay-systeem dat geheugens scoort op basis van recentheid en frequentie:
- Nieuwe of veelgebruikte items krijgen een hoger gewicht.
- Items die al een tijd niet zijn aangeraakt, verliezen geleidelijk gewicht.
- De gewogen decay vermindert "retrieval noise" — irrelevante matches — met 34 %.
Door items met
