El modelo de lenguaje Gemma de Google, reducido a 28,9 millones de parámetros, ahora se ejecuta en un microcontrolador ESP32-S3 que se vende por aproximadamente 8 $. Un desarrollador independiente creó la prueba de concepto, demostrando que un LLM con funciones completas puede residir en un hardware lo suficientemente económico como para ocultarse dentro de cualquier dispositivo IoT.
Cómo funciona el truco
Las herramientas de compresión de Gemma comprimen los pesos del modelo y el grafo de ejecución hasta que caben en la memoria RAM y el modesto almacenamiento flash del ESP32, según explica la fuente. El chip, un favorito para sensores de bajo costo y wearables, ejecuta el modelo de forma totalmente offline, sin necesidad de conexión a la nube.
Por qué esto genera alarmas en la seguridad de IoT
- La inferencia offline mantiene los datos en el dispositivo, eliminando los registros en el servidor, pero también eliminando un punto de visibilidad para los defensores.
- El hardware económico y ubicuo permite a los atacantes integrar IA sofisticada en dispositivos que se mezclan con entornos de consumo o industriales ordinarios.
- Fatiga de parches y actualizaciones: los dispositivos ESP32 suelen ejecutar firmware que rara vez se actualiza, convirtiendo un módulo de IA vulnerable en una pesadilla logística.
Ventajas potenciales y el contrapeso
Ejecutar IA en el borde (edge) protege la privacidad del usuario porque los datos brutos de los sensores nunca se transmiten a un servidor. Sin embargo, ese mismo escudo de privacidad puede ser abusado.
Qué sigue para los defensores
La capacidad de ejecutar un LLM de 28 millones de parámetros en un chip de 8 $ convierte una capacidad que antes era exclusiva de la nube en una amenaza oculta y omnipresente. Las organizaciones deben tratar la IA en el borde (edge AI) como una frontera de seguridad, no solo como una conveniencia.
