AWS הוסיפה אפשרות של "ניתוב מודע-קידומת" (prefix-aware routing) ל-Amazon SageMaker Inference, המבטיחה שיעורי פגיעות מטמון (cache-hit rates) גבוהים יותר ושיהוי (latency) נמוך משמעותית עבור לקוחות המריצים מודלי שפה גדולים (LLMs) על התשתית שלהם. השינוי חשוב מכיוון שהוא מספק שיהוי נמוך יותר ועלויות מחשוב GPU מופחתות.
למה שיהוי (latency) של LLM חשוב
כאשר LLM מקבל בקשה, הוא בדרך כלל מחשב מחדש את ה-attention על פני כל הפרומפט (prompt) — שלב יקר שגדל עם כל טוקן (token) שנוסף. אם המודל יכול להשתמש מחדש במטמון ה-attention מבקשה קודמת, הוא צריך לעבד רק את החלק החדש של הטקסט. עומסי עבודה השולחים שוב ושוב את אותו system prompt או שומרים היסטוריית שיחה הם מועמדים מצוינים לשימוש חוזר במטמון.
בהגדרת SageMaker ברירת המחדל, בקשות נכנסות מופצות באופן אקראי על פני מאגר מופעי ההסקה (inference instances). הפצה אקראית פירושה שבקשה שיכולה הייתה לפגוע במטמון חם (warm cache) נוחתת לעיתים קרובות על מופע קר (cold instance), מה שמאלץ חישוב מחדש מלא. התוצאה היא שיהוי גבוה יותר ומחזורי GPU נוספים שמתרגמים ישירות להוצאות גבוהות יותר.
איך ניתוב מודע-קידומת (prefix-aware routing) עובד
מצב הניתוב החדש שומר מפה קלה של קידומות בקשות אחרונות — למעשה, החלק הראשון של הפרומפט שנוטה להישאר קבוע לאורך קריאות שונות. כאשר מגיעה בקשה חדשה, SageMaker בודק את המפה ומעביר את הבקשה למופע שכבר עיבד את אותה קידומת. אם המופע עדיין מחזיק במטמון ה-attention הרלוונטי, המודל יכול לדלג על רוב העבודה וליצור את התשובה מהר יותר.
נקודות מפתח:
- אין צורך בשינויי קוד – התכונה נמצאת כולה בשכבת שירות ההסקה (inference service layer).
- חלה רק על מודלים המאוחסנים באופן עצמאי (self-hosted) – שירותים מנוהלים כמו ה-API של OpenAI או השירות של Anthropic אינם מושפעים.
- שקוף עבור אפליקציות – כתובת ה-URL של ה-SageMaker endpoint והחוזה של ה-API נשארים ללא שינוי.
מי עומד להרוויח
ארגונים המארחים LLMs ב-SageMaker עושים זאת מסיבות הנעות בין פרטיות נתונים ועד בקרת עלויות. עבור אלו המריצים צ'אטבוטים לתמיכה, עוזרי מכירות, או כל סוכן אינטראקטיבי המשתמש שוב ושוב ב-system prompt קבוע, התאמת הניתוב יכולה להפחית את זמני התגובה הממוצעים. מבחינת עלויות, כל פגיעה במטמון (cache hit) חוסכת ל-GPU את הצורך להעריך מחדש את החלק המשותף של הפרומפט.
מגבלות ונקודות למחשבה
התועלת תלויה בנוכחותן של קידומות חוזרות. פרומפטים בעלי שונות גבוהה — כגון שאילתות חד-פעמיות או הודעות מערכת המיוצרות באופן דינמי — לא ייהנו מהיתרון של פגיעות מטמון דומה.
מכיוון שהתכונה מוגבלת לפריסות self-hosted, לקוחות שקשורים לשירותי LLM מנוהלים אינם יכולים לנצל אותה.
שורה תחתונה: ניתוב מודע-קידומת מעניק למשתמשי SageMaker דרך פשוטה וללא קוד (zero-code) לצמצם שיהוי בעומסי עבודה חוזרים של LLM תוך קיצוץ בעלויות GPU. עבור ארגונים שכבר מארחים מודלים בפלטפורמה, השדרוג הוא שינוי בסיכון נמוך שיכול לתרגם לאינטראקציות משתמש מהירות יותר וחשבונות נמוכים יותר.
