هدر بتای جدید Anthropic هزینه توکنِ فراخوانی ابزار (tool calls) را برای Claude 3.7 Sonnet حدود ۱۴ درصد کاهش میدهد که باعث کاهش اندک هزینههای ماهانه عاملهای هوش مصنوعی و بهبود جزئی در تأخیر (latency) میشود.
چرا استفاده از ابزار توکنها را مصرف میکند
هر مرحلهای که یک عامل (agent) با Claude طی میکند، شامل سه گام مبتنی بر توکن است:
- تعاریف ابزار (Tool definitions) – نامها و طرحوارههای JSON که به عنوان بخشی از پرامپت ارسال میکنید.
- فراخوانیهای ابزار (Tool calls) – خروجی ساختاریافتهای که مدل هنگام تصمیم به فراخوانی یک ابزار تولید میکند.
- نتایج ابزار (Tool results) – دادههایی که کد شما به مدل بازمیگرداند.
گامهای اول و سوم توکنهای ورودی (input tokens) هستند؛ گام دوم توکنهای خروجی (output tokens) است. از آنجایی که Claude برای خروجی بیشتر از ورودی هزینه دریافت میکند، کاهش توکنهای خروجی میتواند هزینهها را کاهش دهد، حتی اگر تعداد کل توکنها مشابه باقی بماند.
هدر بتا
Anthropic ویژگی بتایی را با نام token-efficient tool use معرفی کرد. افزودن هدر HTTP زیر:
anthropic-beta: token-efficient-tools-2025-02-19
این بهینهسازی را فعال میکند، اما تنها زمانی که درخواست برای Claude 3.7 Sonnet ارسال شود. اگر هدر به مدل دیگری ارسال شود، درخواست بدون تغییر ادامه مییابد و هدر بدون خطا نادیده گرفته میشود.
این بهینهسازی با فشردهسازی خروجیِ فراخوانی ابزارِ مدل کار میکند و تقریباً ۱۴ درصد از تعداد توکنهای خروجی در آن مرحله را کاهش میدهد.
چقدر واقعاً صرفهجویی میکنید
توکنهای خروجی گرانتر از توکنهای ورودی هستند، بنابراین کاهش ۱۴ درصدی در آن بخش، به کاهش متناسب در کل صورتحساب منجر نمیشود. در یک حلقه چهار مرحلهای معمولِ یک عامل، تعاریف ابزار اغلب بخش عمدهای از هزینههای ورودی را تشکیل میدهند و گاهی بیش از نیمی از توکنهای مصرفی را شامل میشوند. در چنین شرایطی، صرفهجویی ۱۴ درصدی در توکنهای خروجی معمولاً تنها حدود ۳ درصد کاهش در کل هزینه ایجاد میکند.
بنابراین، رقم صرفهجویی که در تیترها آمده است ناچیز به نظر میرسد، اما این تغییر بدون هیچ هزینه اضافی اعمال میشود و باعث بهبود جزئی در تأخیر (latency) میگردد: توکنهای خروجی کمتر به این معناست که مدل تولید متن را کمی سریعتر تمام میکند.
صرفهجویی بیشتر نیازمند تاکتیکهای متفاوت است
اگر هدف کاهش معنادار هزینهها باشد، این هدر به تنهایی کافی نیست. سه اهرم کاربردی، سود بیشتری به همراه دارند:
- کش کردن پرامپت (Prompt caching) – تعاریف ابزار را یک بار ذخیره کرده و در فراخوانیهای بعدی از نسخه کششده استفاده کنید. خواندن از کش با نرخ کمتری نسبت به توکنهای ورودی جدید محاسبه میشود.
- محدود کردن مجموعه ابزارها (Trim the tool set) – فقط ابزارهایی را بگنجانید که برای وظیفه فعلی ضروری هستند. هر ابزار اضافی، تعریف خود را به هر درخواست اضافه میکند و هزینههای ورودی را بالا میبرد.
- خلاصهسازی نتایج ابزار (Slim down tool results) – فقط فیلدهایی را برگردانید که مدل واقعاً به آنها نیاز دارد. پاسخهای بزرگ API که دوباره به گفتگو بازگردانده میشوند، هم توکنهای ورودی و هم تاریخچه گفتگو را افزایش میدهند.
بهکارگیری این روشها میتواند بخش قابل توجهی از کل هزینهها را کاهش دهد، بسیار فراتر از آن ۳ درصدی که تنها از طریق این نسخه بتا به دست میآید.
آنچه باید زیر نظر داشت
Anthropic مشخص نکرده است که چه زمانی – یا اصلاً آیا – حالت بهینهسازی توکن از مرحله بتا به یک ویژگی پیشفرض تبدیل خواهد شد. توسعهدهندگان باید منتظر اطلاعیههای آینده باشند که ممکن است پشتیبانی از مدلهای دیگر فراتر از Claude 3.7 Sonnet را فراهم کنند یا تکنیکهای عمیقتر فشردهسازی توکن را معرفی کنند. همچنین، نظارت بر جزئیات توکنها در هر درخواست به تعیین میزان تأثیر واقعی با تغییر الگوهای استفاده کمک خواهد کرد.
خلاصه کلام
هدر بتا یک تغییر رایگان و کمزحمت است که توکنهای خروجیِ فراخوانی ابزار را تقریباً ۱۴ درصد کاهش میدهد و منجر به کاهش اندک در صورتحساب و بهبود جزئی در سرعت میشود. برای هر کسی که در حال حاضر با هزینههای بالای عاملها (agents) دستوپنجه نرم میکند، این هدر یک افزونه مفید است، اما صرفهجویی واقعی از طریق کش کردن پرامپتها، محدود کردن ابزارهای در دسترس و بازگرداندن نتایج خلاصهتر حاصل خواهد شد.
Source: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
