هدر بتای جدید Anthropic هزینه توکنِ فراخوانی ابزار (tool calls) را برای Claude 3.7 Sonnet حدود ۱۴ درصد کاهش می‌دهد که باعث کاهش اندک هزینه‌های ماهانه عامل‌های هوش مصنوعی و بهبود جزئی در تأخیر (latency) می‌شود.

چرا استفاده از ابزار توکن‌ها را مصرف می‌کند

هر مرحله‌ای که یک عامل (agent) با Claude طی می‌کند، شامل سه گام مبتنی بر توکن است:

  • تعاریف ابزار (Tool definitions) – نام‌ها و طرحواره‌های JSON که به عنوان بخشی از پرامپت ارسال می‌کنید.
  • فراخوانی‌های ابزار (Tool calls) – خروجی ساختاریافته‌ای که مدل هنگام تصمیم به فراخوانی یک ابزار تولید می‌کند.
  • نتایج ابزار (Tool results) – داده‌هایی که کد شما به مدل بازمی‌گرداند.

گام‌های اول و سوم توکن‌های ورودی (input tokens) هستند؛ گام دوم توکن‌های خروجی (output tokens) است. از آنجایی که Claude برای خروجی بیشتر از ورودی هزینه دریافت می‌کند، کاهش توکن‌های خروجی می‌تواند هزینه‌ها را کاهش دهد، حتی اگر تعداد کل توکن‌ها مشابه باقی بماند.

هدر بتا

Anthropic ویژگی بتایی را با نام token-efficient tool use معرفی کرد. افزودن هدر HTTP زیر:

anthropic-beta: token-efficient-tools-2025-02-19

این بهینه‌سازی را فعال می‌کند، اما تنها زمانی که درخواست برای Claude 3.7 Sonnet ارسال شود. اگر هدر به مدل دیگری ارسال شود، درخواست بدون تغییر ادامه می‌یابد و هدر بدون خطا نادیده گرفته می‌شود.

این بهینه‌سازی با فشرده‌سازی خروجیِ فراخوانی ابزارِ مدل کار می‌کند و تقریباً ۱۴ درصد از تعداد توکن‌های خروجی در آن مرحله را کاهش می‌دهد.

چقدر واقعاً صرفه‌جویی می‌کنید

توکن‌های خروجی گران‌تر از توکن‌های ورودی هستند، بنابراین کاهش ۱۴ درصدی در آن بخش، به کاهش متناسب در کل صورت‌حساب منجر نمی‌شود. در یک حلقه چهار مرحله‌ای معمولِ یک عامل، تعاریف ابزار اغلب بخش عمده‌ای از هزینه‌های ورودی را تشکیل می‌دهند و گاهی بیش از نیمی از توکن‌های مصرفی را شامل می‌شوند. در چنین شرایطی، صرفه‌جویی ۱۴ درصدی در توکن‌های خروجی معمولاً تنها حدود ۳ درصد کاهش در کل هزینه ایجاد می‌کند.

بنابراین، رقم صرفه‌جویی که در تیترها آمده است ناچیز به نظر می‌رسد، اما این تغییر بدون هیچ هزینه اضافی اعمال می‌شود و باعث بهبود جزئی در تأخیر (latency) می‌گردد: توکن‌های خروجی کمتر به این معناست که مدل تولید متن را کمی سریع‌تر تمام می‌کند.

صرفه‌جویی بیشتر نیازمند تاکتیک‌های متفاوت است

اگر هدف کاهش معنادار هزینه‌ها باشد، این هدر به تنهایی کافی نیست. سه اهرم کاربردی، سود بیشتری به همراه دارند:

  • کش کردن پرامپت (Prompt caching) – تعاریف ابزار را یک بار ذخیره کرده و در فراخوانی‌های بعدی از نسخه کش‌شده استفاده کنید. خواندن از کش با نرخ کمتری نسبت به توکن‌های ورودی جدید محاسبه می‌شود.
  • محدود کردن مجموعه ابزارها (Trim the tool set) – فقط ابزارهایی را بگنجانید که برای وظیفه فعلی ضروری هستند. هر ابزار اضافی، تعریف خود را به هر درخواست اضافه می‌کند و هزینه‌های ورودی را بالا می‌برد.
  • خلاصه‌سازی نتایج ابزار (Slim down tool results) – فقط فیلدهایی را برگردانید که مدل واقعاً به آن‌ها نیاز دارد. پاسخ‌های بزرگ API که دوباره به گفتگو بازگردانده می‌شوند، هم توکن‌های ورودی و هم تاریخچه گفتگو را افزایش می‌دهند.

به‌کارگیری این روش‌ها می‌تواند بخش قابل توجهی از کل هزینه‌ها را کاهش دهد، بسیار فراتر از آن ۳ درصدی که تنها از طریق این نسخه بتا به دست می‌آید.

آنچه باید زیر نظر داشت

Anthropic مشخص نکرده است که چه زمانی – یا اصلاً آیا – حالت بهینه‌سازی توکن از مرحله بتا به یک ویژگی پیش‌فرض تبدیل خواهد شد. توسعه‌دهندگان باید منتظر اطلاعیه‌های آینده باشند که ممکن است پشتیبانی از مدل‌های دیگر فراتر از Claude 3.7 Sonnet را فراهم کنند یا تکنیک‌های عمیق‌تر فشرده‌سازی توکن را معرفی کنند. همچنین، نظارت بر جزئیات توکن‌ها در هر درخواست به تعیین میزان تأثیر واقعی با تغییر الگوهای استفاده کمک خواهد کرد.

خلاصه کلام

هدر بتا یک تغییر رایگان و کم‌زحمت است که توکن‌های خروجیِ فراخوانی ابزار را تقریباً ۱۴ درصد کاهش می‌دهد و منجر به کاهش اندک در صورت‌حساب و بهبود جزئی در سرعت می‌شود. برای هر کسی که در حال حاضر با هزینه‌های بالای عامل‌ها (agents) دست‌وپنجه نرم می‌کند، این هدر یک افزونه مفید است، اما صرفه‌جویی واقعی از طریق کش کردن پرامپت‌ها، محدود کردن ابزارهای در دسترس و بازگرداندن نتایج خلاصه‌تر حاصل خواهد شد.

Source: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l