يقلل الترويسة (header) التجريبية الجديدة من Anthropic تكلفة الرموز (tokens) لاستدعاء الأدوات بنسبة 14% تقريبًا لنموذج Claude 3.7 Sonnet، مما يمنح وكلاء الذكاء الاصطناعي (AI agents) انخفاضًا متواضعًا في فواتيرهم الشهرية وميزة طفيفة في زمن الاستجابة (latency).
لماذا يستهلك استخدام الأدوات الرموز (tokens)
تتضمن كل دورة يقوم بها الوكيل مع Claude ثلاث خطوات تعتمد على الرموز:
- تعريفات الأدوات (Tool definitions) – الأسماء ومخططات JSON التي ترسلها كجزء من المطالبة (prompt).
- استدعاءات الأدوات (Tool calls) – المخرجات المهيكلة التي يولدها النموذج عندما يقرر استدعاء أداة ما.
- نتائج الأدوات (Tool results) – البيانات التي يعيدها الكود الخاص بك إلى النموذج.
الخطوتان الأولى والثالثة هما رموز الإدخال (input tokens)؛ أما الخطوة الثانية فهي رموز المخرجات (output tokens). وبما أن Claude يفرض رسومًا على المخرجات أكثر من الإدخال، فإن تقليل رموز المخرجات يمكن أن يخفض التكاليف حتى لو ظل إجمالي عدد الرموز مشابهًا.
الترويسة التجريبية (The beta header)
أعلنت Anthropic عن ميزة تجريبية تسمى token-efficient tool use. يؤدي إضافة ترويسة HTTP التالية
anthropic-beta: token-efficient-tools-2025-02-19
إلى تفعيل التحسين، ولكن فقط عندما يستهدف الطلب نموذج Claude 3.7 Sonnet. إذا تم إرسال الترويسة إلى أي نموذج آخر، فسيستمر الطلب دون تغيير؛ حيث سيتم تجاهل الترويسة دون حدوث خطأ.
يعمل هذا التحسين عن طريق ضغط مخرجات استدعاء الأدوات للنموذج، مما يقلل بنسبة 14% تقريبًا من عدد رموز المخرجات لتلك الخطوة.
مقدار ما ستوفره فعليًا
رموز المخرجات أغلى من رموز الإدخال، لذا فإن خفضًا بنسبة 14% في هذا الجزء لا يترجم إلى انخفاض متناسب في الفاتورة الإجمالية. في حلقة الوكيل النموذجية المكونة من أربع خطوات، غالبًا ما تهيمن تعريفات الأدوات على تكاليف الإدخال، حيث تتجاوز أحيانًا نصف الرموز المستخدمة. وفي ظل هذه الظروف، فإن توفير 14% من رموز المخرجات يؤدي عادةً إلى انخفاض بنسبة 3% فقط في الرسوم الإجمالية.
لذلك، تبدو نسبة التوفير المعلنة متواضعة، لكن هذا التغيير يأتي بدون أي تكلفة إضافية ويقدم دفعة طفيفة في سرعة الاستجابة: فعدد أقل من رموز المخرجات يعني أن النموذج ينهي عملية التوليد بشكل أسرع قليلاً.
توفير أكبر يتطلب تكتيكات مختلفة
إذا كان الهدف هو الحد من النفقات بشكل ملموس، فإن الترويسة وحدها لن تحقق ذلك. هناك ثلاث روافع عملية تحقق مكاسب أكبر:
- تخزين المطالبات (Prompt caching) – قم بتخزين تعريفات الأدوات مرة واحدة وأعد استخدام النسخة المخزنة في الاستدعاءات اللاحقة. يتم احتساب رسوم القراءات المخزنة بسعر أقل من رموز الإدخال الجديدة.
- تقليص مجموعة الأدوات (Trim the tool set) – قم بتضمين الأدوات الضرورية للمهمة الحالية فقط. كل أداة إضافية تضيف تعريفها إلى كل طلب، مما يؤدي إلى تضخم تكاليف الإدخال.
- تبسيط نتائج الأدوات (Slim down tool results) – أعد فقط الحقول التي يحتاجها النموذج فعليًا. استجابات API الكبيرة التي يتم إرجاعها إلى المحادثة تضخم كلاً من رموز الإدخال وسجل المحادثة.
يمكن لتطبيق هذه الممارسات أن يقلص جزءًا ملحوظًا من إجمالي الإنفاق، بما يتجاوز بكثير نسبة الـ 3% التي قد تراها من الميزة التجريبية وحدها.
ما يجب مراقبته
لم توضح Anthropic متى — أو ما إذا كان — سيتم نقل وضع كفاءة الرموز (token-efficient mode) من المرحلة التجريبية إلى ميزة افتراضية. يجب على المطورين مراقبة الإعلانات المستقبلية التي قد توسع نطاق الدعم إلى ما هو أبعد من Claude 3.7 Sonnet أو تقدم تقنيات أعمق لضغط الرموز. كما ستساعد مراقبة تفاصيل الرموز لكل طلب في تحديد التأثير الفعلي مع تطور أنماط الاستخدام.
الخلاصة
الترويسة التجريبية هي تعديل مجاني ومنخفض الجهد يقلل رموز مخرجات استدعاء الأدوات بنسبة 14% تقريبًا، مما يوفر انخفاضًا متواضعًا في الفاتورة وزيادة طفيفة في السرعة. بالنسبة لأي شخص يعاني بالفعل من تكاليف الوكلاء المرتفعة، تعد الترويسة إضافة مفيدة، ولكن التوفير الحقيقي سيأتي من تخزين المطالبات، والحد من استخدام الأدوات، وإرجاع نتائج أكثر إيجازًا.
المصدر: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
