דמיינו שאתם מהנדסי אבטחת אפליקציות בכירים בחברת שירותים פיננסיים. אתם מזינים קטע קוד של מנגנון אימות שפותח פנימית לתוך מודל AI חלוצי ומבקשים ממנו לזהות כשלים לוגיים. במקום ניתוח, אתם מקבלים הרצאה. המודל מסרב בטענה שאתם עלולים להשתמש במידע כדי "לנצל מערכת". אתם לא פושעים. אתם האנשים ששכרו כדי לעצור פושעים. ובכל זאת, מנגנון ההגנה מתייחס לשני התפקידים כבלתי ניתנים להבחנה.

התרחיש הזה הופך לשגרתי. ככל שמעבדות AI גדולות מחמירות את פרוטוקולי הבטיחות (Safety) כדי למנוע שימוש זדוני, הן מתנגשות בראש עם תהליכי העבודה של אנשי אבטחת סייבר (Security) לגיטימיים. התוצאה היא פרדוקס גובר: אותם כלים שמוצגים כמכפילים של יכולת עבור הנדסת תוכנה נמנעים מלהגיע לידי המומחים שמגנים על תשתיות קריטיות.

החיכוך בין בטיחות (Safety) לאבטחה (Security)

מפתחי AI מרכזיים לא התעלמו לחלוטין מקהילת אבטחת הסייבר. OpenAI מפעילה תוכנית בשם Trusted Access for Cyber. Anthropic מפעילה את Cyber Verification Program. שתיהן נועדו לאפשר למשתמשים שעברו אימות לעקוף מנגנוני סירוב מסוימים כדי שיוכלו לבצע מחקר לגיטימי. בתיאוריה, השערים הללו מפרידים בין השחקנים הטובים לרעים.

בפועל, חוקרי אבטחה התקפית ומגיני רשת רבים חווים אותם כעיכובים בירוקרטיים. תהליכי האימות יכולים להיות עמומים. לוחות הזמנים לאישור אינם ברורים. אפילו לאחר קבלה, חוקרים מדווחים כי הגישה המוגברת אינה תמיד פועלת באופן אמין בגרסאות שונות של המודל או בשרשורי שיחה שונים. עבור צוותים שמתרוצצים כדי לתקן פגיעויות תחת ניצול פעיל, לחיכוך הזה יש משמעות.

המתח בין וושינגטון לסיליקון ואלי הגיע לנקודת רתיחה בולטת כאשר ממשלת ארה"ב הטילה בקרת ייצוא על מודלי ה-Mythos וה-Fable של Anthropic. ההגבלות הגיעו בעקבות דיווחים על כך שפרטים מסוימים עקפו את מנגנוני הבטיחות של המודלים כדי להקל על מתקפות סייבר. הרגולטורים פעלו במהירות כדי להתייחס למערכות אלו כסחורות ייצוא מסוכנות באופן ייחודי. הבקרות הוסרו או שונו מאז, אך האירוע שלח מסר ברור: מודלי AI בעלי יכולות גבוהות נתפסים יותר ויותר כמכשירי יום הדין פוטנציאליים מאשר ככלים טכניים לשימוש כללי. עבור המגנים הנשענים עליהם, תפיסה זו מתרגמת לבחינה מחמירה יותר, גישה איטית יותר וחשד בסיסי לכך שמחקר אבטחה הוא בסך הכל "האקינג" תחת שם אחר.

מדוע הגנה והתקפה אינן ניתנות להפרדה

לב הקונפליקט אינו מנהלתי. הוא טכני. אותן יכולות הנדרשות כדי להגן על רשת הן כמעט זהות לאלו הנדרשות כדי לתקוף אותה.

כריס אנלי (Chris Anley), מדען ראשי ב-NCC Group, משתמש באנלוגיה פשוטה: AI הוא פטיש. אפשר להשתמש בו כדי לבנות בית או כדי לשבור חלון. הכלי עצמו אינו יודע את ההבדל. באבטחת סייבר, הדואליות הזו בלתי נמנעת. כאשר איש מקצוע מבקש ממודל "לתקן את הקוד הזה", הבקשה מפעילה פעולה הגנתית. אך תהליך החשיבה שמייצר את התיקון — זיהוי פונקציות לא מאובטחות, מעקב אחר קלט לא מהימן, מיפוי זרימות ביצוע — חושף בהכרח כיצד ניתן להפעיל את הפגיעות. ההסבר משמש כמפת דרכים לניצול (exploitation).

מכיוון שצוותי בטיחות AI מאמנים לעיתים קרובות מודלים לסרב לכל הנחיה (prompt) שמרגישה כמו ניסיון ניצול, המערכות נוטות לעיתים קרובות לתקן יתר על המידה. חוקר השואל כיצד לנקות (sanitize) קלט משתמש מקבל תשובה. חוקר השואל כיצד א