מדוע דחיסת הקשר (Context Compression) של בינה מלאכותית מתעלמת בשקט מההוראות שלך

ככל שהשיחות עם מודלי שפה גדולים (LLMs) הופכות לארוכות יותר, מפתחים מסתמכים יותר ויותר על "דחיסת הקשר" (context compression) או דחיסה (compaction) כדי לנהל מגבלות טוקנים ולמנוע צווארי בקבוק בביצועים. עם זאת, מחקר חדש חושף פגם קריטי באופטימיזציה זו: כאשר מערכות AI מסכמות את היסטוריית השיחה כדי לחסוך במקום, הן נוטשות לעיתים קרובות דווקא את הכללים שנועדו להנחות את התנהגותן.

השבריריות של אילוצי סשן (Session Constraints)

כאשר מערכת AI עוברת דחיסה, המטרה העיקרית שלה היא לשמר את רציפות המשימה – שמירה על היעד, המצב הנוכחי והצעדים הבאים הנדרשים. בעוד שזה שומר על ה"מה" של השיחה, זה לעיתים קרובות מקריב את ה"איך".

חוקרים באוניברסיטת Penn State זיהו כי "אילוצי סשן" (session constraints) הם הקורבנות הראשונים של תהליך זה. אלו הם כללים שאינם קבועים ומוטלים על ידי המשתמש, כגון "לעולם אל תשתמש בשמי בתגובות שלך" או "אשר איתי לפני ביצוע כל שינוי". מכיוון שהוראות אלו אינן חלק מהמשימה המרכזית או מה-system prompt הקבוע, אלגוריתמי דחיסה רואים בהן פרטים משניים וחותכים אותם כדי לפנות מקום לנתונים רלוונטיים יותר.

ממצאי ה-COMPINT: שיעור הישרדות של 17% בלבד

כדי לכמת את ההתדרדרות הזו, חוקרים פיתחו את חבילת ההערכה COMPINT. התוצאות חריפות: בממוצע, רק 17 אחוזים מאילוצי הסשן שהוזנו שורדים את תהליך הדחיסה.

המחקר הדגיש ירידה משמעותית בציות לכללים. כאשר לסוכן (agent) יש גישה להקשר מלא ולא דחוס, שיעורי הציות נעים בדרך כלל בין 59% ל-71%. ברגע שמתרחשת דחיסה, הציות צונח, ולעיתים קרובות יורד לרמות שכמעט בלתי ניתנות להבחנה מתרחיש שבו לא סופק אף אילוץ מלכתחילה.

זה לא רק עניין של ניואנסים בשיחה; זהו סיכון משמעותי לאבטחה ולאמינות. בתהליכי עבודה של סוכנים (agentic workflows), אובדן של אילוץ כמו "אל תבצע קוד ללא אישור" עלול להוביל לקריאות כלים לא מורשות, דליפות נתונים או שינויים לא מאומתים במערכות חיצוניות כמו יומנים או אימייל.

פתרון קל משקל באמצעות Qwen3.5-9B

במקום לשכתב מחדש את לוגיקת הדחיסה המורכבת המשמשת מעבדות AI גדולות, החוקרים מציעים תיקון ארכיטקטוני מסוג "plug-and-play". הם פיתחו מודול תוסף קטן המבוסס על מודל Qwen3.5-9B, שנועד לשמש כחולץ (extractor) ייעודי.

מודול זה פועל על ידי:

  1. סריקת כל קלט משתמש בזמן אמת כדי לזהות ולבודד אילוצי סשן.
  2. תחזוקה של רשימה ייעודית ועצמאית של כללים אלו.
  3. הוספת הרשימה המזוקקת הזו לסיכום בכל פעם שהמערכת הראשית מבצעת דחיסה.

התוצאות של גישה זו יעילות ביותר. החולץ השיג שיעור שימור של למעלה מ-90 אחוזים בתרחישי בדיקה שונים, כולל שיעור הצלחה של 95.6% עבור מסלולי סוכנים (agent trajectories) ו-90.3% עבור צ'אטים מרובי-סבבים (multi-turn chats). מכיוון ששיטה זו אינה דורשת אימון מחדש של המודל הראשי ואינה דורשת שינויים בתשתית הדחיסה הקיימת, היא מציעה נתיב בר-הרחבה (scalable) לעבר אינטראקציות AI אמינות יותר בהקשר ארוך.

נקודות מפתח

  • מחיקת אילוצים: דחיסת הקשר נותנת עדיפות למטרות המשימה על פני כללי התנהגות, מה שגורם לרוב "אילוצי הסשן" שהוטלו על ידי המשתמש ללכת לאיבוד במהלך הסיכום.
  • סיכוני אבטחה: אובדן של הוראות — כגון דרישות לאימות אנושי (human-in-the-loop) — עלול להוביל לפעולות סוכן לא מורשות ולפגיעה באבטחה.
  • תיקונים מודולריים: שימוש במודל קטן וייעודי כמו Qwen3.5-9B למעקב נפרד אחר אילוצים יכול להחזיר את שיעור שימור ההוראות ליותר מ-90%.