Anthropic ו-OpenAI פתחו כל אחת מסלול מחקר חדש המאפשר לצוותי אבטחה שעברו אימות לעבוד עם מודלי AI שנוgeschו מרוב מסנני הבטיחות שלהם. ה-"Cyber Verification Program" של Anthropic וה-"Trusted Access for Cyber" של OpenAI מעניקים לחוקרים מאושרים גישה ישירה למודלי שפה עוצמתיים שיכולים לייצר קוד, הנחיות (prompts) והוראות ללא הגבלה. המהלך משמעותי מכיוון שהוא יוצר פיצול ברור בשרשרת האספקה של ה-AI: קבוצה קטנה של אנשי פנים יכולים לבחון את הגרסאות החלשות ביותר, בעוד שאר העולם נשאר מאחורי מגנוני הגנה (guardrails) חזקים יותר.
מדוע התוכניות הללו הופיעו
שתי החברות מציינות כי היוזמות נועדו להאיץ את גילוי הפגיעויות שעלולות לשמש כנשק נגד השירותים שלהן. על ידי מתן "ארגז חול" (sandbox) עם פחות הגבלות לקבוצה מבוקרת של מומחים, הן מקוות לחשוף וקטורי תקיפה לפני שגורמים זדוניים ימצאו אותם. הגישה משקפת את אבטחת התוכנה המסורתית, שבה מפתחים משחררים גרסאות "bug-bounty" לקהל נבחר.
חישוב סיכונים חדש עבור המגינים
הצד השני הוא מודל גישה דו-שכבתי שמאלץ כל ארגון להתוות קו מפריד בין "חוקר" ל"האקר". הקו הזה הופך כעת לשטח תקיפה פוטנציאלי. אם תוקף גונב פרטי גישה, מנצל גישה של איש פנים, או מוליך שולל את תהליך האימות, הוא יכול לחמוק מעבר למגנוני ההגנה המגינים על רוב המשתמשים. ברגע שנכנסים פנימה, ניתן להניע את המודל הלא-מוגבל לביצוע:
- יצירת סקריפטים של פישינג (phishing) החומקים מזיהוי
- יצירת ניצולי zero-day עם קטעי קוד מפורטים
- הפקת הנחיות (prompts) משכנעות להנדסה חברתית המותאמות למטרות ספציפיות
צוותי אבטחה שבנו הגנות על ההנחה שתוצרי ה-AI תמיד מסוננים, חייבים לחשוב מחדש על הנחת היסוד הזו.
כיצד המגינים יכולים להגיב
- התייחסו לתוכניות כווקטור איום. הניחו שיריבים ינסו לחדור לתהליך האימות (vetting pipeline) ונטרו דפוסי התחברות חריגים בפלטפורמות ה-AI.
- הרחיבו את הזיהוי מעבר לענן. חפשו קוד או טקסט שנוצרו על ידי AI בתעבורה היוצאת (outbound), במיוחד מחשבונות בעלי הרשאות גבוהות.
- הטמיעו בקרות מדיניות קשיחות. אכיפו כללי "הרשאה מינימלית" (least-privilege) מחמירים לכל שימוש פנימי בשירותי AI חיצוניים, ובצעו סגמנטציה של סביבות שניתן להגיע אליהן באמצעות פרטי גישה שנפרצו.
- שתפו פעולה עם הספקים. הישארו בקשר עם ערוצי קשרי האבטחה של Anthropic ו-OpenAI כדי לקבל התראות על שינויים בקריטריוני הגישה או על שימושים לרעה שהתגלו.
נקודת המבט הנגדית
התומכים בגישה טוענים כי ללא ערוץ בטוח לבדיקה מעמיקה, פגיעויות יישארו חבויות עד שיוצגו לניצול בשטח. לכן, התוכניות עשויות לצמצם את שטח התקיפה הכולל על ידי חשיפת ליקויים בשלב מוקדם. המחיר הוא ששכבה "פחות מוגנת" מזמינה ניצול אופורטוניסטי.
מה כדאי לעקוב אחריו
- עדכונים לתהליך האימות (vetting) של כל אחת מהחברות
- דיווחים על שימוש לרעה הנובע מהתוכניות
- שינויים ברחבי התעשייה באופן שבו מקטלגים שטחי תקיפה הקשורים ל-AI
השורה התחתונה: מסלולי המחקר החדשים מעניקים לחוקרי אבטחה כלים עוצמתיים, אך הם גם מעבירים את אותם הכלים לכל מי שיצליח לחמוק מהשער. צוותי ההגנה חייבים להתייחס לתוכניות הן כמקור לתובנות והן כנתיב תקיפה חדש.
