באג הדלפת הפרומפטים של Anthropic חשף נתונים של משתמשים במשך שבוע שלם.
למה הפריצה הזו משמעותית
ממשק המודל של Anthropic מאפשר למפתחים לשלוח "prompts" (פרומפטים) – הטקסט שמכוון את תגובת המודל הלשוני. באירוע זה, תקלה באחסון אפשרה לצדדים לא מורשים לקרוא את הפרומפטים הללו במשך שבעה ימים. ההדלפה לא כללה פריצה מאסיבית; מחדל קטן באופן שבו הפרומפטים נשמרו ונשלפו פתח את הדלת.
מה השתבש
הפרדה בין נתוני משתמשים לבין משקלי המודל (model weights) מגבילה את החשיפה. בניית תיעוד ביקורת (audit trails) מאפשרת לזהות פעילות חריגה בשלב מוקדם.
פעולות מיידיות עבור סטארט-אפים בתחום ה-AI
- הקשחת הטיפול בפרומפטים – התייחסו לכל פרומפט נכנס כאל קלט רגיש. הצפינו אותו במצב מנוחה (at rest), הגבילו את הרשאות הקריאה/כתיבה למצומצם ביותר של שירותים, וודאו שרק מנוע הרצת המודל יכול לשלוף אותו.
- הפרדת נתוני משתמשים ממשקלי המודל – אחסנו פרומפטים במאגר ייעודי שמופרד פיזית ולוגית מקבצי המודל. הפרדה זו מגבילה את רדיוס הפגיעה (blast radius) של כל פריצה בודדת.
- יצירת תיעוד ביקורת (audit trails) – תעדו כל גישה לאחסון הפרומפטים עם חותמות זמן, מזהי משתמש וכתובות IP של המקור. הריצו אנליטיקה בזמן אמת שמשגרת התראות על נפחי קריאה חריגים או גישה משירותים לא צפויים.
מה כדאי לעקוב אחריו בהמשך
בשורה התחתונה: תקלה בודדת בטיפול בפרומפטים עלולה להוביל לחשיפת נתונים שנמשכת שבוע שלם. מייסדי חברות AI חייבים להחיל את אותה רמת הקפדה על אחסון פרומפטים כפי שהם מחילים על כל מערכת נתוני משתמש אחרת, אחרת הם יחזרו על הטעות היקרה של Anthropic.
