כלי MCP מוסיפים, במקום לחסוך, את חשבון ה-input tokens של Claude Code; כל פרומפט שאתם שולחים דרך כלי ניקוי עולה בסופו של דבר ביותר טוקנים, ולכן ביותר כסף. מפתחים המנסים להפחית עלויות API פונים לעיתים קרובות לכלי ניקוי מבוססי MCP, מתוך הנחה שהם יצמצמו את הפרומפט לפני שהמודל יראה אותו.
למה מונה הטוקנים חשוב
Claude Code סופר טוקנים ברגע שהטקסט שלכם מגיע לחלון ההקשר (context window) של המודל. המודל מתחיל לקרוא את הפרומפט הגולמי, ואז מחליט אם להפעיל כלי MCP. כלי הניקוי פועל אחרי שהטקסט המקורי כבר הפך לחלק מהשיחה, כך שהמונה כבר רשם את הטוקנים הללו.
תהליך טיפוסי נראה כך:
- הפרומפט הגולמי שלכם נשלח – מונה הטוקנים מתחיל לעלות.
- המודל קורא את הפרומפט ומחליט להפעיל את כלי הניקוי.
- הכלי מחזיר גרסה מקוצרת.
- ההקשר מכיל כעת שלושה דברים: הפרומפט המקורי, מטא-דאטה של קריאת הכלי (tool-call metadata), והפרומפט המנוקה.
אתם מחויבים על כל שלוש הרשומות. הגרסה ה"נקייה" אינה מחליפה את המקור; היא פשוט מופיעה לצדו.
מתי ניקוי באמצעות MCP באמת עוזר
כלי MCP חוסך טוקנים רק כאשר הטקסט הגולמי לעולם לא נכנס להקשר הראשי של Claude Code. זה קורה בקריאות downstream כגון:
- שאילתות Retrieval-augmented generation (RAG) שהמודל מעביר למנוע חיפוש או למסד נתונים.
- הוראות שנשלחות לסוב-סוכנים (sub-agents) הפועלים באופן עצמאי מהשיחה העיקרית.
במקרים אלו, המודל מעביר את המטען (payload) המנוקה ישירות למערכת החיצונית, ובכך שומר על הטקסט המקורי של המשתמש מחוץ לספירת הטוקנים העיקרית.
איך באמת לצמצם את ה-input tokens שלכם
אם אתם רוצים להפחית את מספר הטוקנים שאתם מזינים ל-Claude Code, נקו את הטקסט לפני שהוא נוגע במודל. להלן שלוש גישות מעשיות שעובדות כיום:
- מקשי קיצור ברמת המערכת (System-level hotkeys) – ב-Windows השתמשו בסקריפט AutoHotkey; ב-macOS השתמשו ב-Automator. הסקריפט בוחר את הטקסט שאתם עומדים לשלוח, מעביר אותו (pipes) ל-API חיצוני שמחזיר גרסה נקייה, ואז מחליף את הטקסט בעורך. מכיוון שהגרסה הגולמית לעולם לא עוזבת את המחשב שלכם, רק הגרסה הנקייה נשלחת.
- CLI piping – הפעילו את Claude Code מטרמינל ובצעו עיבוד מוקדם (pre-process) לפרומפט באמצעות מסנן bash (למשל, סקריפט
sedאו Python) שמסיר רווחים מיותרים, הערות או ביטויים כפולים. הפלט המסונן הוא זה שמוזן למודל. - MCP עבור קריאות downstream בלבד – שמרו את כלי ה-MCP לשלבי ה-RAG או הסוב-סוכנים שתוארו קודם לכן. תנו למודל לטפל בפרומפט הראשוני של המשתמש ישירות, ותנו לכלי הניקוי לפעול רק על המטען שעוזב את השיחה העיקרית.
מלכודות נפוצות שיש להימנע מהן
- הנחה שכלי MCP מקצרים את הפרומפט המקורי – הם מוסיפים בלוק טוקנים של קריאת כלי (tool-call) ושומרים על הטקסט הגולמי, מה שמנפח את הסכום הכולל.
- הסתמכות על hooks של Claude Code – hooks יכולים להזריק הקשר נוסף או לחסום פרומפטים, אך הם אינם יכולים לדרוס טקסט שכבר נמצא בשיחה.
- שימוש בפקודות סלאש (slash commands) עם ניקוי inline – גם אם פקודה מריצה סקריפט ניקוי, הארגומנטים הגולמיים נשארים חלק משורת הפקודה שהמודל מתעד, כך שאתם משלמים גם עליהם.
מונה הטוקנים מתחיל לפעול ברגע שהתווים שלכם מגיעים לנקודת הקצה (endpoint) של ה-API של המודל. כל דבר שמנקה לאחר נקודה זו רק מוסיף overhead.
מה זה אומר עבור מפתחים
תמחור טוקנים מופיע כסעיף בחיוב ברוב החשבונות של שירותי AI. תשלום יתר בגלל "מנקה" שמוסיף טוקנים נסתרים עלול לשחוק במהירות כל חיסכון שקיוויתם להשיג. העבירו את שלב הניקוי לצד הלקוח (client side) כדי לשמור על ספירת טוקנים אמינה ועל תקציב צפוי.
שורה תחתונה: כלי MCP שימושיים עבור מטעי downstream, אך הם אינם יכולים לקצר את הטוקנים של הפרומפט שאתם מקלידים. נקו לפני שאתם שולחים, או הגבילו את הניקוי לקריאות שלעולם לא מופיעות בהקשר הראשי, אם אתם רוצים הפחתה אמיתית בעלויות הטוקנים של Claude Code.
