Googles Gemma-taalmodel, teruggebracht tot 28,9 miljoen parameters, draait nu op een ESP32-S3-microcontroller die ongeveer $8 kost. Een onafhankelijke ontwikkelaar heeft het proof-of-concept gebouwd, waarmee wordt aangetoond dat een volledig functioneel LLM kan draaien op hardware die goedkoop genoeg is om in elk IoT-apparaat te verbergen.
Hoe de truc werkt
De compressietools van Gemma knijpen de gewichten en de executiegrafiek van het model samen totdat ze in het RAM-geheugen en de bescheiden flashopslag van de ESP32 passen, zoals de bron uitlegt. De chip, een favoriet voor goedkope sensoren en wearables, voert het model volledig offline uit — er is geen cloudverbinding nodig.
Waarom dit alarmbellen doet rinkelen voor IoT-beveiliging
- Offline inferentie houdt gegevens op het apparaat, waardoor server-side logs worden gewist, maar ook een zichtbaarheidspunt voor verdedigers wordt weggenomen.
- Goedkope, alomtegenwoordige hardware stelt aanvallers in staat om geavanceerde AI te integreren in gadgets die opgaan in gewone consumenten- of industriële omgevingen.
- Patch- en update-moeheid – ESP32-apparaten draaien vaak firmware die zelden wordt bijgewerkt, waardoor een kwetsbare AI-module een logistieke nachtmerrie wordt.
Potentieel voordeel en het tegenwicht
Het draaien van AI aan de edge beschermt de privacy van gebruikers, omdat ruwe sensordata nooit naar een server wordt gestreamd. Datzelfde privacy-schild kan echter worden misbruikt.
Wat is de volgende stap voor verdedigers
De mogelijkheid om een LLM met 28 miljoen parameters te draaien op een chip van $8 verandert een capaciteit die voorheen alleen in de cloud beschikbaar was in een verborgen, alomtegenwoordige dreiging. Organisaties moeten edge AI behandelen als een beveiligingsgrens, niet alleen als een gemak.
