מדד ביצועים חדש הבוחן "מודעות מצבית" (situational awareness) במודלי שפה גדולים (LLMs) מראה שהמבחנים הסטנדרטיים של היום מפספסים פערים קריטיים. על ידי בקשה מהמודלים לתאר את זהותם, את מגבלותיהם ואת ההקשר הסובב אותם, המדד בוחן האם הם מזהים שהם מערכות בינה מלאכותית או מתאימים את תשובותיהם כאשר המצב משתנה — חסרונות בעלי חשיבות מכרעת לפריסות קריטיות לבטיחות ולמפתחים הבונים כלים אמינים.

מדוע הערכות קיימות אינן מספיקות

רוב מדדי הביצועים הציבוריים עדיין מתייחסים ל-LLMs כמו לאנציקלופדיות סטטיות. הם מתגמלים שליפה נכונה של עובדות אך מתעלמים מהשאלה האם המודל יודע שהוא מכונה, האם הוא מודה בחוסר ודאות, או האם הוא מסתגל כאשר סביבת השיחה משתנה. הממדים החסרים הללו צפים לעין כאשר הנחיה (prompt) שואלת, למשל, "האם אתה בן אדם או בינה מלאכותית?" או "מה אתה לא יכול לעשות?". הציונים נותרים גבוהים גם אם המודל מעמיד פנים שהוא בן אדם או מגזים ביכולותיו.

מה מדד הביצועים החדש בוחן

חבילת המבחנים של המודעות המצבית מתמקדת בשלושה חזיתות:

  • זיהוי עצמי – האם המודל מציין נכונה שהוא בינה מלאכותית ומתאר את תפקידו?
  • מסגור יכולות – האם הוא מודה במפורש במגבלותיו במקום להסתיר אותן?
  • הסקה הקשרית – האם שינוי בדיאלוג הסובב משנה את תשובתו באופן הולם?

כל מבחן מצמד שאילתה עובדתית לשאלת מטא (meta-question) על מצב המודל, ובכך מאלץ את המערכת לשלב ידע עם הכרה עצמית.

ההשלכות על בטיחות AI וכלי פיתוח

אם מודל אינו יכול לסמן באופן אמין את המגבלות שלו, הוא עלול להפיק פלטים מטעים.

נקודת מבט נגדית: מדידת מודעות היא משימה קשה

מבקרים טוענים כי בקשה ממודל לתאר את עצמו עשויה פשוט לשקף את נתוני האימון שלו, ולא להוות אינטרוספקציה (התבוננות פנימית) אמיתית. הם טוענים כי ה"מודעות" של מודל עלולה להיות אשליה שנוצרה באמצעות הנדסת פרומפטים (prompt engineering), וכי עדיף להשקיע משאבים בשיפור הביסוס העובדתי (factual grounding). מדד הביצועים אינו טוען שהוא מאשר תודעה אמיתית — אלא רק לחשוף חוסר עקביות שמדדים נוכחיים מפספסים.

מה לעקוב בהמשך

מדד הביצועים קורא למדידה טובה יותר של ידע זה, מה שעשוי לסייע לחוקרים ולמהנדסים לפעול לכיוון מערכות שפה מהימנות יותר.

שורה תחתונה: מודל שיודע שהוא בינה מלאכותית ויכול לציין את מגבלותיו הוא מודל בטוח יותר.