Anthropic'in yeni beta başlığı, Claude 3.7 Sonnet için araç çağrılarının (tool calls) token maliyetini yaklaşık %14 oranında azaltarak, yapay zeka ajanlarının aylık faturalarında mütevazı bir düşüş ve küçük bir gecikme (latency) avantajı sağlıyor.
Araç kullanımı neden token tüketir?
Bir ajanın Claude ile gerçekleştirdiği her adım, token odaklı üç aşamadan oluşur:
- Araç tanımları (Tool definitions) – istemin (prompt) bir parçası olarak gönderdiğiniz isimler ve JSON şemaları.
- Araç çağrıları (Tool calls) – modelin bir aracı çağırmaya karar verdiğinde oluşturduğu yapılandırılmış çıktı.
- Araç sonuçları (Tool results) – kodunuzun modele geri döndürdüğü veriler.
Birinci ve üçüncü adımlar girdi (input) tokenlarıdır; ikinci adım ise çıktı (output) tokenlarıdır. Claude, çıktı için girdiden daha fazla ücret talep ettiğinden, toplam token sayısı benzer kalsa bile çıktı tokenlarını azaltmak maliyetleri düşürebilir.
Beta başlığı
Anthropic, token-efficient tool use adlı bir beta özelliği duyurdu. HTTP başlığı olan
anthropic-beta: token-efficient-tools-2025-02-19
eklemek optimizasyonu etkinleştirir, ancak bu yalnızca istek Claude 3.7 Sonnet'i hedeflediğinde geçerlidir. Başlık başka bir modele gönderilirse istek değişmeden devam eder; başlık hata vermeksizin görmezden gelinir.
Optimizasyon, modelin araç çağrısı çıktısını sıkıştırarak o adım için çıktı token sayısını yaklaşık %14 oranında azaltarak çalışır.
Gerçekte ne kadar tasarruf edersiniz?
Çıktı tokenları girdi tokenlarından daha pahalıdır, bu nedenle bu dilimdeki %14'lük bir kesinti, toplam faturada orantılı bir düşüşe dönüşmez. Tipik dört adımlı bir ajan döngüsünde, araç tanımları genellikle girdi maliyetlerini domine eder ve bazen kullanılan tokenların yarısından fazlasını oluşturur. Bu koşullar altında, çıktı tokenlarındaki %14'lük tasarruf genellikle toplam ücrette yalnızca yaklaşık %3'lük bir azalma sağlar.
Bu nedenle, manşetlerdeki tasarruf rakamı mütevazı görünse de, bu değişiklik sıfır ek maliyetle gelir ve hafif bir gecikme (latency) avantajı sağlar: Daha az çıktı tokenı, modelin üretimi bir nebze daha hızlı bitirmesi anlamına gelir.
Daha büyük tasarruflar farklı taktikler gerektirir
Hedef giderleri anlamlı bir şekilde kısmaksa, sadece bu başlık yeterli olmayacaktır. Üç pratik yöntem daha büyük kazançlar sağlar:
- Prompt caching (İstem önbelleğe alma) – araç tanımlarını bir kez saklayın ve sonraki çağrılarda önbelleğe alınmış sürümü yeniden kullanın. Önbelleğe alınmış okumalar, yeni girdi tokenlarından daha düşük bir oranda faturalandırılır.
- Araç setini budayın – yalnızca mevcut görev için gerekli olan araçları dahil edin. Her ekstra araç, tanımını her isteğe ekleyerek girdi maliyetlerini artırır.
- Araç sonuçlarını hafifletin – yalnızca modelin gerçekten ihtiyaç duyduğu alanları döndürün. Konuşmaya geri beslenen büyük API yanıtları, hem girdi tokenlarını hem de konuşma geçmişini şişirir.
Bu uygulamaları hayata geçirmek, sadece betadan göreceğiniz %3'ün çok ötesinde, toplam harcamadan fark edilir bir miktarı kesip atabilir.
Neler takip edilmeli?
Anthropic, token verimli modun ne zaman —veya eğer olacaksa— betadan varsayılan bir özelliğe geçeceğini belirtmedi. Geliştiriciler, Claude 3.7 Sonnet ötesinde desteği genişletebilecek veya daha derin token sıkıştırma teknikleri sunabilecek gelecekteki duyuruları takip etmelidir. Kullanım modelleri geliştikçe, istek başına token dökümünü izlemek, gerçek dünyadaki etkiyi nicelleştirmeye de yardımcı olacaktır.
Özetle
Beta başlığı, araç çağrısı çıktı tokenlarını yaklaşık %14 oranında azaltan, mütevazı bir fatura düşüşü ve küçük bir hız artışı sağlayan ücretsiz ve düşük eforlu bir iyileştirmedir. Halihazırda yüksek ajan maliyetleriyle mücadele eden herkes için bu başlık yararlı bir eklentidir, ancak asıl tasarruf istemleri önbelleğe almaktan, araç kullanımını sınırlamaktan ve daha yalın sonuçlar döndürmekten gelecektir.
Kaynak: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
