עוזר מבוסס AI ניהל את תפקידי הכוננות (on-call) שלי במשך שבעה ימים, עיבד 11 התראות וצמצם את זמן התיקון הממוצע שלי מ-45 דקות ל-20 דקות. הניסוי הזה חשוב משום שמודל שפה בעל היקף מוגדר יכול לחסוך חצי שעה מתגובת החירום, וזאת מבלי לוותר על פיקוח אנושי קפדני.
למה שמתי AI בכוננות
צוותי ענן מבלים את רוב משמרתם בחקירת לוגים (logs), בדיקת פריסות (deployments) אחרונות ואימות שקריאת scaling בטוחה. המשימות ה"משעממות" הללו הן חוזרות על עצמן, עתירות נתונים וחשופות לעייפות אנושית. התקדמויות אחרונות במודלי שפה גדולים (LLMs) הבטיחו לאוטומט בדיוק את עבודת זיהוי התבניות הזו, אך רוב ההדגמות הציבוריות רצות בסביבות sandbox. רציתי לראות אם ההייפ שורד בתוך אשכול (cluster) ברמת production שמשרת לקוחות משלמים בפועל.
הגדרת הבדיקה
- גישה – הסוכן יכול היה לקרוא כל מטריקה, לוג והגדרת פריסה. הוא יכול היה לבצע פעולות כתיבה רק לרשימת הרשאות (whitelist) מצומצמת: הפעלה מחדש של pod, הגדלת מספר ה-replicas או ביצוע scaling לפריסה. כל פעולה מעבר לכך דרשה את אישורי המפורש.
- תפקיד – התייחסתי למודל כאל מהנדס ג'וניור במשמרת הכוננות הראשונה שלו. הוא קיבל את ההתראה, ביצע ניתוח ופרסם המלצה בערוץ האירוע (incident channel).
- רשתות ביטחון – כל פעולות הכתיבה היו מוגבלות על ידי בקשת "כן/לא" ידנית. כמו כן, הגבלתי את צריכת ה-tokens של המודל כדי לשמור על עלויות צפויות.
איפה ה-AI הצטיין
המהירות של הסוכן הייתה הרווח הבולט ביותר. ברגע שהתקבלה התראה, הוא שלף את הלוגים הרלוונטיים, שרטט מטריקות אחרונות ופירוט של שלוש הפריסות האחרונות. עד שהספקתי לפתוח את הלפטופ, עבודת הבלשות הראשונית כבר הושלמה. מתוך 11 ההתראות:
- 8 היו בעיות שגרתיות (קפיצות בזיכרון, הפעלות מחדש של קונטיינרים, הגדרות שגויות פשוטות). ה-AI זיהה נכון את סיבת השורש בכל פעם.
- הוא סימן על עלייה הדרגתית בשימוש בזיכרון במיקרו-שירות (microservice) לפני שהבעיה הסלימה לתקלה בשעה 2 לפנות בוקר, מה שנתן לצוות הזדמנות להתערב מוקדם.
- צריכת ה-tokens לאורך כל השבוע נותרה סביב $30, בטווח המקובל בתקציב כוננות טיפוסי כאשר מגבילים את השימוש.
סוכן AI עדיין אינו יכול לנהל פעילות ענן באופן עצמאי, אך כשותף למיון (triage partner), הוא כבר מספק שיפורים מוחשיים במהירות. המפתח הוא לשמור על רמת הביטחון תחת בקרה, לאכוף guardrails קשיחים, ולאפשר למודל לטפל בעבודת השגרה הסיזיפית, בעוד שהמומחיות האנושית מנווטת את ההחלטות הקריטיות.
