כלי ה-Deep Research החדש של Claude יכול "לעכל" 6.57 מיליון טוקנים בקריאה אחת — משהו שרק תקציב מחשוב עצום יכול להחזיק. המערכת אינה מודל שפה מונוליטי; היא פועלת כצינור (pipeline) JavaScript מסוג map-reduce קשיח, שמפזר חיפושים, שואב נתונים, מציב טענות מול שלושה מאמתים עצמאיים, ואז מסנתז דוח.
למה הארכיטקטורה חשובה
רוב עוזרי המחקר מבוססי ה-AI מציגים ממשק יחיד של "שאלה-ותשובה", המאפשר למודל לייצר טקסט וציטוטים בבת אחת. ה-Deep Research של Claude הופך את המודל הזה על פיו. הוא מפרק את המשימה לשלבים נפרדים ומוגדרים (typed) ומאלץ את המודל לציית למסגרת תוכנה (software harness). המתכננים בנו אותו כדי להחזיק את ההזיות (hallucinations) תחת שליטה, תוך מתן תשובות עשירות ומבוססות מקורות. הגישה נגזרת ממסגרת עבודה אוטומטית לציד באגים, שבה נוצרת השערה ואז מנסים בכוונה להפריך אותה. במונחים של מחקר, טענה נולדת, ואז שלושה סוכנים יריבים (adversarial agents) מנסים "להרוג" אותה לפני שהיא מגיעה לסינתזה הסופית.
זרימת ה-map-reduce
- Fan-out search (פיזור חיפוש) – המנצח (orchestrator) מפעיל עובדים מקבילים השואבים מידע ממגוון מקורות נתונים.
- Fetch data (שליפת נתונים) – כל עובד שואב קטעי טקסט גולמיים, מטא-דאטה וכל מידע מובנה זמין.
- Adversarial verification (אימות יריב) – שלושה סוכנים עצמאיים מקבלים כל טענה, כאשר כל אחד מהם מונחה להגדיר אותה כ-refuted כשהוא אינו בטוח. הטענה שורדת רק אם היא צוברת מספיק קולות בעד.
- Synthesis (סינתזה) – הטענות ששורדות נתפרות יחד לדוח JSON סופי שהמשתמש יכול להציג כטקסט רציף.
בתוך ה-harness
ה-harness הוא שכבת קוד דקה המגדירה מה מודל השפה רשאי לעשות. הכללים שלו מופיעים כמערכת של משימות מובנות:
- SCOPE – המודל מקבל תיאור תמציתי של שאלת המחקר.
- SEARCH – עליו להפיק רשימה של מזהי מקורות, לעולם לא טקסט חופשי.
- EXTRACT – עבור כל מקור, המודל מחזיר ציטוט מילה במילה התומך בכל טענה שתבוא לאחר מכן.
- VERDICT – הוא מייצר אובייקט JSON המכיל את הטענה, את הציטוט התומך ואת ציון הביטחון (confidence score).
- REPORT – השלב הסופי עוטף את כל הטענות המאומתות למסמך אחד.
ה-harness אוכף evidence binding (קישור ראיות): טענה ללא ציטוט מדויק נזרקת באופן אוטומטי. הוא גם חושף policy constants (קבועי מדיניות) שניתן לשנות ללא צורך בשינוי קוד — כמה קולות בעד טענה צריכה כדי להצליח, כמה מקורות המערכת יכולה לקרוא, או מספר הטענות המקסימלי שעובר לתהליך האימות.
שלב מיון (triage) נמצא בין השליפה לאימות. במקום לשלוח כל טענה לסוכנים היריבים היקרים, המערכת מדרגת אותן לפי חשיבות ואיכות המקור, ואז מעבירה רק את ה-25 המובילות. סינון זה מונע מצריכת הטוקנים ועלויות המחשוב לצאת משליטה.
אימות יריב בפועל
שלב האימות הוא מחמיר בכוונה. כל אחד משלושת הסוכנים מקבל את אותה טענה ואת הציטוט מהמקור, ואז פועל תחת סט הוראות שאומר לו להניח שהטענה שקרית אלא אם כן הוא מוצא הוכחה מכרעת. אם סוכן כלשהו אינו בטוח, הוא מצביע refuted. על הטענה לאסוף מספר ניתן להגדרה של קולות affirmed כדי לשרוד.
במהלך בדיקות לא רשמיות, שכבת ה-adversarial תפסה טענה שקראה בטעות מדד אגרגטיבי (aggregate metric) כמדד דיוק (precision score) ספציפי. המודל ייצר הצהרה בטוחה לגבי הדיוק, אך המקור דיווח רק על מדד אגרגטיבי.
מה העיצוב חושף על בניית מערכות AI
- הפרדת בקרה מהסקה (reasoning) – המודל נשאר אחראי על ההסקה (inference); ה-harness אוכף משמעת תהליכית.
- ממשקים מוגדרים (typed interfaces) מפחיתים הזיות – על ידי דרישת פלט JSON וציטוטים מדויקים, המערכת מבטלת סטיות של טקסט חופשי.
- סינון טענות לפני שלב האימות היקר מפחית את צריכת הטוקנים ואת עלויות המחשוב.
- התייחסות לקלט חיצוני כאל לא אמין – כל ציטוט ממקור נבדק מחדש על ידי סוכנים עצמאיים, מה שמונע ממסמך שגוי בודד לזהם את התשובה.
עקרונות אלו מהדהדים תזוזה רחבה יותר לעבר ארכיטקטורות של "מודל מחוץ למודל" (model-outside-the-model), שבהן קוד דטרמיניסטי מטפל בניהול (orchestration), אימות והקצאת משאבים במקום מודל השפה ההסתברותי.
חסרונות פוטנציאליים ושאלות פתוחות
החוזקה של ה-pipeline — הקפדנות שלה — מביאה איתה גם אתגרים.
נקודת מחלוקת נוספת היא ההסתמכות על ציטוטים מילה במילה. לא כל הידע טמון בניסוח מדויק; תובנות מסוימות עולות רק לאחר סינתזה של מידע ממסמכים מרובים.
מה כדאי לעקוב אחריו בהמשך
Claude's Deep Research עדיין נמצא בשלב מחקר, אך הארכיטקטורה שלו מרמזת על עתיד שבו מודלי שפה גדולים מוטמעים בתוך pipelines מבוקרים היטב, במקום להישאר ללא הכוונה עצמית. מדדים מרכזיים שכדאי לעקוב אחריהם כוללים:
- מדדי יעילות טוקנים – האם בסיס ה-6.57M טוקנים יצטמצם ככל שמערכת הבקרה (harness) תרכוש לוגיקת מיון (triage) סלקטיבית יותר?
- מגמות שיהוי (latency) – עד כמה מהר המערכת תוכל להחזיר דוח מלא כאשר שלושה סוכני אימות מעורבים בתהליך?
שורה תחתונה
Claude's Deep Research מראה שמודל שפה יכול להפיק תשובות מהימנות ומבוססות מקורות כאשר הוא מוגבל ל-pipeline מובנה ורב-שלבי. פריצת הדרך האמיתית אינה גודל המודל; אלא התוכנה הסובבת אותו, שמאלצת את המודל להוכיח כל טענה, לדרג ראיות לפני ניצול משאבי מחשוב, ולהתייחס לכל קטע מידע חיצוני כחשוד עד ששלושה סוכנים יסכימו אחרת. עבור כל מי שבנה כלים מבוססי בינה מלאכותית, הלקח ברור: תנו למודל לחשוב, אך תנו לקוד להחליט מה הוא יכול לומר.
