Opus 5 של Anthropic משיגה שיעור הצלחה של 0% בהזרקות הנחיות (Prompt Injections) בדפדפן
Anthropic רשמה פריצת דרך אדירה בתחום אבטחת ה-AI עם השקת Opus 5, מה שעשוי לפתור את אחת הפגיעות העקשניות ביותר בסוכנים אוטונומיים. באמצעות הטמעת מערכת הגנה דו-שכבתית, המודל הפגין חסינות כמעט מוחלטת מפני התקפות הזרקת הנחיות (prompt injection) מבוססות דפדפן.
משבר הזרקת ההנחיות בסוכני AI
הזרקת הנחיות (Prompt injection) נותרה "עקב אכילס" של עידן ה-AI הנוכחי. פגיעות זו מתרחשת כאשר תוקף מחביא הנחיות זדוניות בתוך דף אינטרנט — לעיתים קרובות באמצעות טקסט בלתי נראה — שסוכן AI קורא בזמן הגלישה. לאחר העיבוד, הנחיות אלו יכולות לחטוף את המודל, ולאלץ אותו לעקוף פרוטוקולי בטיחות או לבצע פעולות לא מורשות. בעוד שמובילות בתעשייה כמו OpenAI הציעו בעבר שהזרקת הנחיות עשויה להיות פגם מובנה ובלתי ניתן לפתרון ב-LLMs, הנתונים האחרונים של Anthropic קוראים תיגר על התחזית הפסימית הזו.
השגת מדד ה-0%
על פי ה-system card של Anthropic, Opus 5 השיגה שיעור הצלחה מדהים של 0% בהתקפות לאורך 129 תרחישי בדיקה שונים שתוכננו במיוחד עבור סוכני דפדפן. זהו זינוק משמעותי לעומת גרסאות קודמות. בבדיקות הזרקת הנחיות כלליות שערכה חברת האבטחה Gray Swan, Opus 5 הראתה שיפור דרמטי לעומת קודמתה; לאחר 15 ניסיונות, שיעור הצלחת התוקף ירד מ-5.5% (כפי שנצפה ב-Opus 4.8) ל-2.0% בלבד.
ביצועים אלו מציבים את Opus 5 בראש מדד ה-Gray Swan IPI, תוך שהיא עוקפת מודלים מתקדמים אחרים כמו Mythos 5 (2.6%) ו-Fable 5 (2.8%).
הסוד: Auto Mode והגנה דו-שכבתית
פריצת הדרך אינה נובעת אך ורק מאינטליגנציה של המודל, אלא מהשילוב שלו עם תוכנה ייעודית. שיעור ההצלחה של "אפס אחוז" קשור ספציפית לשימוש ב-Auto Mode במוצרים כמו Claude Cowork. Anthropic משתמשת בארכיטקטורת הגנה מתוחכמת בעלת שתי שכבות כדי לאבטח את הסוכן:
- סריקת עיבוד מקדים (Pre-processing Scan): שכבה ייעודית הסורקת את כל הנתונים הנכנסים לאיתור הנחיות נסתרות או מניפולטיביות לפני שה-LLM הראשי מעבד את הטקסט.
- חסימת ביצוע (Execution Blocking): שכבה משנית המנטרת את הפעולות המתוכננות של הסוכן, וחוסמת כל פקודה מסוכנת לפני שניתן לבצע אותה בסביבת הדפדפן.
מעניין לציין כי הנתונים מראים שהמודל לבדו אינו "פתרון קסם". ללא שכבות התוכנה המגינות הללו, רמת
