Header beta baru Anthropic memangkas biaya token untuk tool calls sekitar 14 persen bagi Claude 3.7 Sonnet, memberikan agen AI pengurangan biaya bulanan yang moderat dan sedikit keunggulan latensi.
Mengapa penggunaan tool menghabiskan token
Setiap giliran yang dilakukan agen dengan Claude melibatkan tiga langkah berbasis token:
- Definisi tool – nama dan skema JSON yang Anda kirim sebagai bagian dari prompt.
- Tool calls – output terstruktur yang dihasilkan model saat ia memutuskan untuk memanggil sebuah tool.
- Hasil tool – data yang dikembalikan oleh kode Anda ke model.
Langkah pertama dan ketiga adalah token input; langkah kedua adalah token output. Karena Claude mengenakan biaya lebih mahal untuk output daripada input, memangkas token output dapat menurunkan biaya meskipun jumlah total token tetap serupa.
Header beta
Anthropic mengumumkan fitur beta bernama token-efficient tool use. Menambahkan HTTP header
anthropic-beta: token-efficient-tools-2025-02-19
mengaktifkan optimasi tersebut, tetapi hanya jika permintaan ditujukan ke Claude 3.7 Sonnet. Jika header dikirim ke model lain, permintaan akan tetap berjalan tanpa perubahan; header tersebut akan diabaikan tanpa pesan kesalahan.
Optimasi ini bekerja dengan mengompresi output tool-call model, memangkas sekitar 14 persen jumlah token output untuk langkah tersebut.
Seberapa banyak penghematan yang sebenarnya Anda dapatkan
Token output lebih mahal daripada token input, sehingga pemangkasan 14 persen pada bagian tersebut tidak menghasilkan penurunan biaya total yang proporsional. Dalam loop agen empat langkah yang tipikal, definisi tool sering kali mendominasi biaya input, terkadang melebihi setengah dari total token yang digunakan. Dalam kondisi tersebut, penghematan 14 persen pada token output biasanya hanya menghasilkan pengurangan sekitar 3 persen pada total biaya.
Oleh karena itu, angka penghematan yang diberitakan terasa moderat, tetapi perubahan ini hadir tanpa biaya tambahan dan memberikan sedikit peningkatan latensi: lebih sedikit token output berarti model menyelesaikan pembuatan teks sedikit lebih cepat.
Penghematan yang lebih besar memerlukan taktik yang berbeda
Jika tujuannya adalah untuk menekan pengeluaran secara signifikan, header saja tidak akan cukup. Tiga tuas praktis dapat memberikan keuntungan yang lebih besar:
- Prompt caching – simpan definisi tool satu kali dan gunakan kembali versi yang tersimpan (cached) pada panggilan berikutnya. Pembacaan cache dikenakan tarif yang lebih rendah daripada token input baru.
- Pangkas set tool – hanya sertakan tool yang penting untuk tugas saat ini. Setiap tool tambahan menambahkan definisinya ke setiap permintaan, sehingga membengkakkan biaya input.
- Rampingkan hasil tool – kembalikan hanya bidang (fields) yang benar-benar dibutuhkan model. Respons API yang besar yang dimasukkan kembali ke dalam percakapan akan membengkakkan token input sekaligus riwayat percakapan.
Menerapkan praktik-praktik ini dapat memangkas sebagian besar total pengeluaran, jauh melampaui 3 persen yang Anda dapatkan dari fitur beta saja.
Apa yang perlu diperhatikan
Anthropic belum mengindikasikan kapan—atau apakah—mode token-efficient akan naik dari beta menjadi fitur default. Pengembang harus memperhatikan pengumuman di masa mendatang yang mungkin memperluas dukungan di luar Claude 3.7 Sonnet atau memperkenalkan teknik kompresi token yang lebih dalam. Memantau rincian token per permintaan juga akan membantu mengukur dampak dunia nyata seiring berkembangnya pola penggunaan.
Intinya
Header beta adalah penyesuaian gratis dan rendah upaya yang memangkas token output tool-call sekitar 14 persen, memberikan sedikit penurunan tagihan dan sedikit peningkatan kecepatan. Bagi siapa pun yang sudah berjuang dengan biaya agen yang tinggi, header ini adalah tambahan yang bermanfaat, tetapi penghematan nyata akan datang dari prompt caching, membatasi penggunaan tool, dan mengembalikan hasil yang lebih ramping.
Sumber: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
