โมเดลภาษา Gemma ของ Google ที่ถูกปรับลดขนาดลงเหลือ 28.9 ล้านพารามิเตอร์ สามารถรันบนไมโครคอนโทรลเลอร์ ESP32-S3 ที่มีราคาขายเพียงประมาณ 8 ดอลลาร์ได้แล้ว นักพัฒนาอิสระรายหนึ่งได้สร้างตัวต้นแบบ (proof-of-concept) ขึ้นมา เพื่อแสดงให้เห็นว่า LLM ที่มีฟีเจอร์ครบถ้วนสามารถทำงานบนฮาร์ดแวร์ที่มีราคาถูกพอที่จะซ่อนไว้ในอุปกรณ์ IoT ใดก็ได้
กลไกการทำงาน
เครื่องมือการบีบอัดของ Gemma จะบีบอัดค่าน้ำหนัก (weights) และกราฟการประมวลผล (execution graph) ของโมเดลจนกระทั่งสามารถบรรจุลงใน RAM และหน่วยความจำแฟลช (flash storage) ที่มีจำกัดของ ESP32 ได้ ตามที่แหล่งข่าวระบุ ชิปตัวนี้เป็นที่นิยมสำหรับเซนเซอร์ราคาประหยัดและอุปกรณ์สวมใส่ (wearables) โดยสามารถประมวลผลโมเดลแบบออฟไลน์ได้ทั้งหมด โดยไม่จำเป็นต้องเชื่อมต่อกับคลาวด์
ทำไมเรื่องนี้จึงเป็นสัญญาณเตือนด้านความปลอดภัยของ IoT
- การประมวลผลแบบออฟไลน์ (Offline inference) ช่วยให้ข้อมูลถูกเก็บไว้ในตัวอุปกรณ์ ซึ่งจะลบประวัติ (logs) ในฝั่งเซิร์ฟเวอร์ออกไป แต่ในขณะเดียวกันก็ทำให้ผู้ดูแลระบบความปลอดภัยขาดจุดในการตรวจสอบ (visibility point) ด้วย
- ฮาร์ดแวร์ราคาถูกและแพร่หลาย ช่วยให้ผู้โจมตีสามารถฝัง AI ที่มีความซับซ้อนลงในอุปกรณ์ต่างๆ ที่กลมกลืนไปกับสภาพแวดล้อมของผู้บริโภคหรือภาคอุตสาหกรรมทั่วไป
- ความเหนื่อยล้าจากการแพตช์และอัปเดต (Patch and update fatigue) – อุปกรณ์ ESP32 มักจะรันเฟิร์มแวร์ที่แทบจะไม่เคยได้รับการอัปเดตเลย ซึ่งจะเปลี่ยนโมดูล AI ที่มีช่องโหว่ให้กลายเป็นฝันร้ายในการจัดการ (logistical nightmare)
ข้อดีที่อาจเกิดขึ้นและสิ่งที่ต้องระวัง
การรัน AI บน Edge ช่วยปกป้องความเป็นส่วนตัวของผู้ใช้ เนื่องจากข้อมูลดิบจากเซนเซอร์จะไม่ถูกส่งไปยังเซิร์ฟเวอร์ อย่างไรก็ตาม เกราะป้องกันความเป็นส่วนตัวแบบเดียวกันนี้ก็สามารถถูกนำไปใช้ในทางที่ผิดได้เช่นกัน
ก้าวต่อไปสำหรับผู้ดูแลความปลอดภัย
ความสามารถในการรัน LLM ขนาด 28 ล้านพารามิเตอร์บนชิปราคา 8 ดอลลาร์ เปลี่ยนความสามารถที่เคยจำกัดอยู่แค่บนคลาวด์ให้กลายเป็นภัยคุกคามที่ซ่อนเร้นและแพร่กระจายไปได้ทุกที่ องค์กรต่างๆ จึงต้องปฏิบัติกับ Edge AI ในฐานะพรมแดนใหม่ด้านความปลอดภัย ไม่ใช่แค่เรื่องของความสะดวกสบายเท่านั้น
