מודל השפה Gemma של Google, שצומצם ל-28.9 מיליון פרמטרים, רץ כעת על מיקרו-בקר ESP32-S3 שנמכר בערך ב-8 דולר. מפתח עצמאי בנה הוכחת יכולת (proof-of-concept), המראה שמודל שפה גדול (LLM) בעל יכולות מלאות יכול להתקיים על חומרה זולה מספיק כדי להסתתר בתוך כל מכשיר IoT.
איך הטריק עובד
כלי הדחיסה של Gemma דוחסים את המשקולות (weights) ואת גרף הביצוע של המודל עד שהם נכנסים לתוך ה-RAM ואחסון ה-flash הצנוע של ה-ESP32, כפי שמסביר המקור. השבב, המועדף על חיישנים ומוצרי לבישים בעלות נמוכה, מריץ את המודל באופן מקומי (offline) לחלוטין – ללא צורך בחיבור לענן.
למה זה מעורר אזעקה בנוגע לאבטחת IoT
- הסקה מקומית (Offline inference) שומרת על הנתונים במכשיר, מה שמוחק לוגים בצד השרת אך גם מסיר נקודת נראות עבור המגינים.
- חומרה זולה ונפוצה מאפשרת לתוקפים להטמיע בינה מלאכותית מתוחכמת במכשירים שמתמזגים בסביבות צרכניות או תעשייתיות רגילות.
- עייפות מעדכוני אבטחה (Patch and update fatigue) – מכשירי ESP32 מריצים לעיתים קרובות קושחה (firmware) שאינה מתעדכנת לעיתים קרובות, מה שהופך מודול AI פגיע לסיוט לוגיסטי.
יתרון פוטנציאלי ואיזון מולו
הרצת AI בקצה (edge) מגינה על פרטיות המשתמש מכיוון שנתוני חיישנים גולמיים לעולם אינם נשלחים לשרת. עם זאת, אותו מגן פרטיות יכול לשמש לרעה.
מה הלאה עבור המגינים
היכולת להריץ LLM בעל 28 מיליון פרמטרים על שבב של 8 דולר הופכת יכולת שהייתה בעבר מוגבלת לענן לאיום נסתר ופריץ. ארגונים חייבים להתייחס ל-edge AI כחזית אבטחה, ולא רק כנוחות.
