2,890만 개의 파라미터로 압축된 Google의 Gemma 언어 모델이 이제 약 8달러에 판매되는 ESP32-S3 마이크로컨트롤러에서 실행됩니다. 한 독립 개발자가 이 개념 증명(PoC)을 구축하여, 모든 IoT 기기 내부에 숨길 수 있을 만큼 저렴한 하드웨어에서도 풀 기능 LLM이 구동될 수 있음을 보여주었습니다.

작동 원리

소스 설명에 따르면, Gemma의 압축 도구는 모델의 가중치(weights)와 실행 그래프를 ESP32의 RAM 및 소규모 플래시 저장 공간에 들어갈 수 있을 때까지 압축합니다. 저가형 센서와 웨어러블 기기에 즐겨 사용되는 이 칩은 클라우드 연결 없이 모델을 완전히 오프라인 상태에서 실행합니다.

이것이 IoT 보안에 경종을 울리는 이유

  • **오프라인 추론(Offline inference)**은 데이터를 기기에 보관하므로 서버 측 로그를 삭제하지만, 방어자가 가시성을 확보할 수 있는 지점도 제거합니다.
  • 저렴하고 어디에나 있는 하드웨어 덕분에 공격자는 일반적인 소비자용 또는 산업용 환경에 녹아드는 기기에 정교한 AI를 심을 수 있습니다.
  • 패치 및 업데이트 피로도 – ESP32 기기는 펌웨어가 거의 업데이트되지 않는 경우가 많아, 취약한 AI 모듈이 관리적 측면에서 악몽이 될 수 있습니다.

잠재적 이점과 그 반작용

엣지(edge)에서 AI를 실행하면 가공되지 않은 센서 데이터가 서버로 전송되지 않으므로 사용자 프라이버시를 보호할 수 있습니다. 하지만 동일한 프라이버시 보호 기능이 악용될 수도 있습니다.

방어자를 위한 향후 과제

8달러짜리 칩에서 2,800만 파라미터 규모의 LLM을 실행할 수 있게 됨에 따라, 과거 클라우드 전용이었던 기능이 숨겨진 광범위한 위협으로 변했습니다. 기업은 엣지 AI를 단순한 편의 기능이 아닌 보안의 최전선으로 다루어야 합니다.