חוקרי AI חשפו מסגרת עבודה חדשה בשם “Intent-as-a-Tool” המאפשרת לסוכנים אוטונומיים להכריז על תוכניות מסוכנות לפני שהן מבוצעות, ובכך מעניקה למפתחים הזדמנות להתערב לפני שנגרם נזק כלשהו. ההצעה, שפורסמה בשרת preprint בגישה חופשית, מוסיפה שכבת בטיחות פרואקטיבית לסוכנים שכעת מנסחים אימיילים, עורכים קבצים ומקבלים החלטות בשם המשתמשים.

מדוע מנגנוני ההגנה הקיימים אינם מספיקים

סוכני AI מודרניים כבר לא יושבים מאחורי ממשק של שאלה-תשובה בסיבוב בודד. הם מחברים יחד מספר פעולות – חיפוש באינטרנט, כתיבה למסד נתונים, שליחת הודעות – לעיתים קרובות ללא אדם שעוקב אחר כל שלב. מנגנוני ההגנה הנוכחיים בודקים את הפלט: האם הסוכן הדליף מסמך פרטי? האם הוא שלח אימייל פישינג? עד שהמערכת מסמנת את התוצאה, הפעולה המזיקה כבר נמצאת בעולם.

הסכנה, לעומת זאת, אורבת בשלב מוקדם יותר. תזרים העבודה הפנימי של סוכן מתחלק לחמישה שלבים:

  1. ניתוח הבקשה של המשתמש.
  2. בחירת אסטרטגיה למילוי הבקשה.
  3. שקילת פעולות שעשויות להיות אסורות (למשל, הוצאת נתונים).
  4. התחייבות למסלול שנבחר.
  5. ביצוע השלבים.

אם הסוכן מחליט בשלב 4 לפעול לפי פעולה אסורה, הוא עדיין לא גרם להשפעה חיצונית כלשהי, אך נקודת ההחלטה היא כבר נקודת חוסר חזרה. מנטרים מסורתיים, הממתינים לש