שליפה סוכנותית (Agentic retrieval) מוצגת כצעד הבא לאחר תהליכי RAG (Retrieval-Augmented Generation) מסורתיים, ומבטיחה מערכות AI ברמת ייצור (production) שפוסקות להזות ומתחילות "לחשוב" על האופן שבו עליהן לשלוף מידע. תומכי הגישה טוענים כי היא יכולה לחסוך בעלות המענה על שאילתה באוספי מסמכים גדולים עד פי 82 בהשוואה להזנת כל הקורפוס לחלון ההקשר (context window) של המודל – חיסכון משמעותי עבור כל עסק המרחיב את השימוש ב-Generative AI.
מדוע תהליך ה-RAG הישן אינו מספיק
תהליך העבודה הקלאסי של RAG הוא רצף קבוע: פיצול מסמכים לקטעים (chunks), יצירת embedding לכל קטע במרחב וקטורי צפוף, ולאחר מכן שליפת הווקטורים בעלי הציון הגבוה ביותר עבור שאילתת המשתמש. בהדגמות השיטה נראית מסודרת – המודל מקבל כמה קטעים "רלוונטיים" ועונה בביטחון. בייצור (production), לעומת זאת, הביטחון הזה הוא לעיתים קרובות מוטעה.
שלושה כשלים מערכתיים מובילים לבעיה:
- דמיון וקטורי ≠ רלוונטיות. שני קטעים יכולים להיות קרובים מבחינה מתמטית אך להביע עובדות מנוגדות, מה שמוביל את המודל לצטט טענה שגויה.
- פיצול שובר עובדות. חלוקה קבועה לקטעים (chunking) מפרידה לעיתים קרובות משפט בודד לשניים. אם המודל מקבל רק חצי אחד, הוא אינו יכול לשחזר את החלק החסר.
- שאילתות מבולגנות. שאלות מהעולם האמיתי שונות מנתוני האימון של רוב מודלי ה-embedding, ולכן חיפוש הדמיון מחזיר קטעים לא קשורים.
כאשר תהליך השליפה מחזיר הקשר שגוי, מודל השפה בשלב הבא עדיין מייצר תשובה, לעיתים קרובות בביטחון גבוה, והמערכת אינה מעלה שגיאה. התוצאה היא "הזיה שקטה" (silent hallucination) – כשל שקט שקשה לזהות בשירות חי.
שליפה היברידית: תיקון הדרגתי
תגובה נפוצה היא הוספת חיפוש מבוסס מילות מפתח מעל הווקטורים הצפופים, מה שיוצר שליפה היברידית (hybrid retriever) שיכולה לתפוס התאמות מדויקות של מונחים שפספסו ה-embeddings. הוספת reranker – מודל שני המסדר מחדש את הרשימה שנשלפה על בסיס ציון רלוונטיות שנלמד – משפרת את הדיוק עוד יותר.
עם זאת, שליפה היברידית עדיין פועלת לפי תסריט סטטי: כל שאילתה מפעילה את אותה סדרה של שלבים, ללא קשר לרמת הקושי או חוסר הוודאות. התהליך אינו יכול להחליט אם הוא זקוק ליותר נתונים, כיצד לפרק שאלה מורכבת לשאילתות משנה, או מתי קטע שנשלף אינו מספיק.
שליפה סוכנותית מתייחסת לחיפוש כתהליך קבלת החלטות
שליפה סוכנותית (Agentic retrieval) מגדירה מחדש את הבעיה כסדרה של החלטות המתקבלות על ידי "סוכן" (agent) אוטונומי המחקה חוקר אנושי. הסוכן יכול:
- לנסח מחדש את השאילתה. הוא מנרמל ניסוחים סלנגיים או מעורפלים לפני החיפוש, מה שמשפר את הסיכוי שמודלי השליפה יבינו את הכוונה.
- לקבוע אם נדרשת שליפה. עבור שאילתות פשוטות, הסוכן עונה ישירות, מה שחוסך טוקנים ומונע רעש מיותר.
- לתכנן חיפוש רב-שלבי. שאלות מורכבות מפורקות לשאילתות משנה קטנות יותר, שכל אחת מהן נבדקת באופן עצמאי, ולאחר מכן הן משולבות מחדש.
- לבצע תיקון עצמי. אם תוצאה ראשונית נראית חלשה – למשל, ציוני ביטחון נמוכים או ראיות סותרות – הסוכן מפיק מחדש את השאילתה בניסוח שונה או מרחיב את היקף החיפוש.
טיעוני עלות: הקשר ארוך (long context) מול שליפה
ישנם פרשנים הטוענים כי חלונות הקשר (context windows) שהולכים וגדלים הופכים את השליפה למיותרת. הטיעון הנגדי הוא פרגמטי: הזנת קורפוס עצום לחלון ההקשר של מודל עולה פי כמה וכמה משליפה ממוקדת. הערכות מצביעות על כך ששליפה זולה פי 8 עד 82 עבור מאגרי נתונים גדולים, וזאת תוך אספקת הביסוס ההקשרי הדרוש לתשובות מדויקות. חלונות הקשר ארוכים נותרים שימושיים להסקה מורכבת על סט קטן ומסונן של מסמכים, אך הם אינם יכולים להחליף חיפוש בר-הרחבה (scalable).
שקיפות ואימות
עוזר AI ברמת ייצור חייב לחשוף את המקורות שלו. שליפה סוכנותית יכולה לצרף ציטוט לכל טענה, מה שמאפשר לבודק אנושי לאמת את שרשרת בדיקת העובדות. גישת ה"הראה את העבודה שלך" בונה אמון ומצביעה על נתיבי שליפה חלשים שהסוכן יכול ללמוד להימנע מהם באינטראקציות עתידיות.
מה כדאי לעקוב אחריו בהמשך
- כלי עבודה (Tooling).
- סטנדרטים של הערכה (Evaluation standards).
- פיילוטים בארגונים (Enterprise pilots).
שורה תחתונה
שליפה סוכנותית חורגת מעבר לתהליכי ה-RAG הסטטיים והחשופים לשגיאות השולטים בהרבה הדגמות. על ידי מתן אפשרות למערכת AI להחליט מתי וכיצד לחפש, היא מצמצמת את השימוש בטוקנים, מפחיתה עלויות באופן דרמטי, וחשוב מכל – מציעה מקורות ניתנים לאימות עבור כל תשובה.
