Anthropic הודיעה כי החל מה-14 באוגוסט, Claude Code תפסיק לבקש ממשתמשים ללחוץ על "approve" עבור כל קריאה לכלי (tool call). במקום זאת, מסווג סיכונים מבוסס AI יחליט אילו פעולות דורשות בדיקה אנושית. מחקר שבוצע על 1,053 בודקים הראה כי 97% מהלחיצות בוצעו מבלי לקרוא את ההודעה, והמסווג זיהה 89% מהפעולות המזיקות, בעוד שבני אדם זיהו רק 13.6%.
מדוע מודל ה-"click to approve" הישן לא ענה על הצרכים
תהליך העבודה הישן אילץ אדם לאשר כל פעולה חיצונית — כגון דחיפת קוד (pushing code) או מחיקת קבצים — באמצעות לחיצה על כפתור. בפועל, המשתמשים התייחסו לדיאלוג כאל פורמליות ואישרו אותו באופן רפלקסיבי. הנתונים מהמחקר חושפים את הבעיה: כמעט כל לחיצה הייתה רפלקס, והאזהרות האמיתיות הבודדות שזכו לתשומת לב פספסו את רוב הפעולות המסוכנות ביותר. כאשר שער הבטיחות נעלם, אבטחת המערכת נשחקת.
מה המסווג החדש עושה
התחליף של Anthropic הוא מודל מאומן המעריך כל פעולה ממתינה ומתערב רק כאשר הפעולה נופלת לאחת משלוש קטגוריות:
- בלתי הפיכות – פעולות שלא ניתן לבטל, כמו force-pushing למאגר (repository) או מחיקת טבלה ממסד נתונים (dropping a database table).
- הרסניות – מחיקות המוניות או דריסת קבצים שעלולות למחוק עבודה.
- פונות החוצה – שלבים החושפים קוד או הודעות למערכות חיצוניות, כגון פתיחת pull request או שליחת התראה ב-Slack.
אם פעולה אינה עומדת באף אחד מהקריטריונים הללו, המודל מאפשר לה להתקדם באופן אוטומטי, ובכך מסיים את שטף ההודעות שהמשתמשים התעלמו מהן.
המגבלות של גישה מבוססת AI בלבד
המסווג אינו מנגנון הגנה אוניברסלי. הוא למד מושגים כלליים של נזק, ולא את הפרטים הספציפיים של בסיס קוד (codebase) מסוים. תיקייה בשם "tmp" עשויה להיות בלתי מזיקה ברוב הפרויקטים, אך עשויה להכיל artifacts קריטיים של תהליך הבנייה (build artifacts) אצלכם; המודל ככל הנראה יחשוב שהיא בטוחה. הביצועים במחקר אינם מבטיחים תוצאות זהות בכל סביבת ייצור (production). מקרי קצה — במיוחד כאלו הכוללים כלים מותאמים אישית או תשתית רגישה — עדיין דורשים הגדרות הרשאה מפורשות או ניטור נוסף.
מה על המשתמשים לעשות כעת
- סקרו את מצב ההרשאות החדש: תוכניות Pro, Max ו-Team יאמצו את המסווג באופן אוטומטי. אם אתם מסתמכים על תהליך עבודה מותאם אישית של הרשאות, ודאו שהוא עדיין תואם למדיניות האבטחה שלכם.
- זהו פעולות בסיכון גבוה: מיפויי את צינורות ה-CI/CD וסקריפטי הפריסה (deployment scripts) לשלוש קטגוריות הטריגר. התאימו סקריפטים המבצעים שלבים בלתי הפיכים או הרסניים כך שיכללו מנגנוני הגנה מפורשים, במידה והמסווג כברירת מחדל אינו מספק.
- נטרו את התראות המסווג: עקבו אחר התדירות והדיוק של ההתערבויות. משוב מוקדם יעזור ל-Anthropic לבצע כוונון עדין (fine-tune) למודל ועשוי להוביל אתכם להפעיל מחדש אישורים ידניים עבור תהליכי עבודה מסוימים.
מה לעקוב בהמשך
המעבר מלחיצות רפלקסיביות של בני אדם למודל מאומן הוא ניסיון ברור לסגור פער בטיחות שהיה קיים בצינורות CI רבים.
מקור: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
