Model językowy Gemma od Google, okrojony do 28,9 miliona parametrów, działa teraz na mikrokontrolerze ESP32-S3, który kosztuje około 8 dolarów. Niezależny programista stworzył dowód koncepcji, pokazując, że w pełni funkcjonalny model LLM może działać na sprzęcie na tyle tanim, by można go było ukryć w dowolnym urządzeniu IoT.
Jak działa ten trik
Narzędzia kompresji Gemma ściskają wagi modelu i graf wykonawczy tak długo, aż zmieszczą się w pamięci RAM i skromnej pamięci flash ESP32, jak wyjaśnia źródło. Układ ten, będący ulubieńcem w przypadku tanich czujników i urządzeń typu wearable, wykonuje model całkowicie offline – bez konieczności połączenia z chmurą.
Dlaczego budzi to niepokój w kontekście bezpieczeństwa IoT
- Wnioskowanie offline (offline inference) zatrzymuje dane na urządzeniu, co usuwa logi po stronie serwera, ale jednocześnie pozbawia obrońców punktu wglądu w procesy.
- Tani, powszechny sprzęt pozwala atakującym na osadzanie zaawansowanej sztucznej inteligencji w gadżetach, które wtapiają się w zwykłe otoczenie konsumenckie lub przemysłowe.
- Zmęczenie łatkami i aktualizacjami – urządzenia ESP32 często działają na oprogramowaniu układowym, które rzadko jest odświeżane, co zmienia podatny na ataki moduł AI w logistyczny koszmar.
Potencjalne korzyści i przeciwwaga
Uruchamianie AI na brzegu sieci (edge AI) chroni prywatność użytkownika, ponieważ surowe dane z czujników nigdy nie są przesyłane na serwer. Ta sama tarcza prywatności może jednak zostać wykorzystana w niewłaściwy sposób.
Co dalej dla obrońców
Możliwość uruchomienia modelu LLM o 28 milionach parametrów na chipie za 8 dolarów zmienia funkcjonalność, która niegdyś była dostępna wyłącznie w chmurze, w ukryte, wszechobecne zagrożenie. Organizacje muszą traktować edge AI jako nowy front bezpieczeństwa, a nie tylko udogodnienie.
