AWS הוסיפה דחיסה מודעת-שאילתה (query-aware compression) לשירות Bedrock שלה, מה שמאפשר למפתחים לצמצם מקטעי מסמכים לא רלוונטיים לפני שהם מגיעים למודל שפה. על ידי צמצום הטוקנים (tokens) שנשלחים למודל, התכונה יכולה להפחית את עלות המחשוב עבור תהליכי Retrieval-Augmented Generation (RAG).

למה תהליכי RAG "שורפים" כסף

מערכות RAG שואבות תחילה קטעי טקסט מבסיס ידע, ולאחר מכן מזינות את הקטעים הללו למודל גנרטיבי כדי לענות על שאלת המשתמש. רוב המימושים שולחים כל מקטע שנשלף ישירות למודל, גם כאשר חלקים נרחבים מהטקסט אינם קשורים לשאילתה. כל מילה נוספת הופכת לטוקן, וכל טוקן שהמודל מעבד מוסיף לעלות ב-API שבבסיס. עבור חברות קטנות ובינוניות המפעילות בוטים לתמיכה או כלי חיפוש פנימיים, ההוצאה על טוקנים עלולה במהירות להקדים את עלות הקריאות למודל עצמו.

מה דחיסה מודעת-שאילתה עושה

היכולת החדשה של Bedrock מכניסה שלב סינון בין השליפה (retrieval) לבין היצירה (generation):

  • המערכת עדיין שואבת את אותה קבוצת מסמכים עבור שאילתה.
  • לפני שהמודל רואה טקסט כלשהו, מעבד קל (lightweight processor) מעריך כל קטע אל מול השאלה הספציפית.
  • רק החלקים שנמצאו רלוונטיים נשמרים; כל השאר נזרק כרעש.

אין צורך באינדקס חדש, במודל embedding או במודל שפה שעבר fine-tuning. השינוי הוא פשוט חיבור מחדש של ה-pipeline כדי להפעיל את שכבת הדחיסה.

השפעה עסקית

מכיוון שעלויות הטוקנים עולות עם כמות הטקסט שנשלחת למודל, הסרת קטעים לא רלוונטיים יכולה לצמצם את החשבון שורה אחר שורה. חברות שראו את עלויות ה-RAG שלהן מתנפחות ככל שהשימוש גדל, יפיקו את התועלת הגדולה ביותר.

מה כדאי לעקוב אחריו בהמשך

  • בצעו פיילוט לתכונה על הנתונים שלכם: הריצו בדיקה מקבילה (side-by-side) של תזרים RAG סטנדרטי לעומת תזרים הכולל דחיסה מודעת-שאילתה. מדדו את מספר הטוקנים, השיהוי (latency) ורלוונטיות התשובה.
  • שקיפות של ספקים: בעת הערכת פלטפורמות RAG של צד שלישי, שאלו האם הם משתמשים בדחיסה או בסינון בתהליכי השליפה שלהם. ספק ששולח מקטעים גולמיים (raw chunks) צפוי לייצר חשבוניות חודשיות גבוהות יותר.

שורה תחתונה

שינוי קטן ב-pipeline — סינון טקסט לא רלוונטי לפני שהוא מגיע למודל — יכול להפוך הוצאה נסתרת לסעיף שניתן לשלוט בו. עבור ארגונים שכבר משלמים על RAG מבוסס Bedrock, הפעלת דחיסה מודעת-שאילתה היא ניסוי בעל מאמץ נמוך, אך כל חיסכון יהיה תלוי בנתונים הספציפיים שלכם.