Model językowy Gemma od Google, okrojony do 28,9 miliona parametrów, działa teraz na mikrokontrolerze ESP32-S3, który kosztuje około 8 dolarów. Niezależny programista stworzył dowód koncepcji, pokazując, że w pełni funkcjonalny model LLM może działać na sprzęcie na tyle tanim, by można go było ukryć w dowolnym urządzeniu IoT.

Jak działa ten trik

Narzędzia kompresji Gemma ściskają wagi modelu i graf wykonawczy tak długo, aż zmieszczą się w pamięci RAM i skromnej pamięci flash ESP32, jak wyjaśnia źródło. Układ ten, będący ulubieńcem w przypadku tanich czujników i urządzeń typu wearable, wykonuje model całkowicie offline – bez konieczności połączenia z chmurą.

Dlaczego budzi to niepokój w kontekście bezpieczeństwa IoT

  • Wnioskowanie offline (offline inference) zatrzymuje dane na urządzeniu, co usuwa logi po stronie serwera, ale jednocześnie pozbawia obrońców punktu wglądu w procesy.
  • Tani, powszechny sprzęt pozwala atakującym na osadzanie zaawansowanej sztucznej inteligencji w gadżetach, które wtapiają się w zwykłe otoczenie konsumenckie lub przemysłowe.
  • Zmęczenie łatkami i aktualizacjami – urządzenia ESP32 często działają na oprogramowaniu układowym, które rzadko jest odświeżane, co zmienia podatny na ataki moduł AI w logistyczny koszmar.

Potencjalne korzyści i przeciwwaga

Uruchamianie AI na brzegu sieci (edge AI) chroni prywatność użytkownika, ponieważ surowe dane z czujników nigdy nie są przesyłane na serwer. Ta sama tarcza prywatności może jednak zostać wykorzystana w niewłaściwy sposób.

Co dalej dla obrońców

Możliwość uruchomienia modelu LLM o 28 milionach parametrów na chipie za 8 dolarów zmienia funkcjonalność, która niegdyś była dostępna wyłącznie w chmurze, w ukryte, wszechobecne zagrożenie. Organizacje muszą traktować edge AI jako nowy front bezpieczeństwa, a nie tylko udogodnienie.