Header beta baharu Anthropic mengurangkan kos token bagi panggilan alat sebanyak kira-kira 14 peratus untuk Claude 3.7 Sonnet, memberikan ejen AI pengurangan sederhana dalam bil bulanan mereka dan sedikit kelebihan kependaman.

Mengapa penggunaan alat memakan token

Setiap pusingan yang dilakukan oleh ejen dengan Claude melibatkan tiga langkah berasaskan token:

  • Definisi alat – nama dan skema JSON yang anda hantar sebagai sebahagian daripada prom.
  • Panggilan alat – output berstruktur yang dijana oleh model apabila ia memutuskan untuk memanggil sesuatu alat.
  • Keputusan alat – data yang dikembalikan oleh kod anda kepada model.

Langkah pertama dan ketiga adalah token input; langkah kedua adalah token output. Oleh kerana Claude mengenakan caj lebih tinggi untuk output berbanding input, mengurangkan token output boleh merendahkan kos walaupun jumlah keseluruhan token kekal hampir sama.

Header beta

Anthropic telah mengumumkan ciri beta yang dinamakan token-efficient tool use. Menambah header HTTP

anthropic-beta: token-efficient-tools-2025-02-19

akan mengaktifkan pengoptimuman tersebut, tetapi hanya apabila permintaan ditujukan kepada Claude 3.7 Sonnet. Jika header dihantar kepada mana-mana model lain, permintaan akan diteruskan tanpa perubahan; header tersebut akan diabaikan tanpa sebarang ralat.

Pengoptimuman ini berfungsi dengan memampatkan output panggilan alat model, mengurangkan kira-kira 14 peratus daripada jumlah token output untuk langkah tersebut.

Berapa banyak yang anda jimatkan sebenarnya

Token output lebih mahal daripada token input, jadi pengurangan sebanyak 14 peratus pada bahagian tersebut tidak diterjemahkan kepada penurunan yang berkadar dalam jumlah bil keseluruhan. Dalam gelung ejen empat langkah yang tipikal, definisi alat sering mendominasi kos input, kadangkala melebihi separuh daripada token yang digunakan. Dalam keadaan tersebut, penjimatan 14 peratus pada token output biasanya hanya menghasilkan pengurangan kira-kira 3 peratus dalam caj keseluruhan.

Oleh itu, angka penjimatan utama tersebut terasa sederhana, tetapi perubahan ini hadir tanpa kos tambahan dan memperkenalkan sedikit peningkatan kependaman: kurang token output bermakna model menyelesaikan penjanaan dengan lebih pantas sedikit.

Penjimatan lebih besar memerlukan taktik berbeza

Jika matlamatnya adalah untuk mengurangkan perbelanjaan secara bermakna, header sahaja tidak mencukupi. Tiga penggerak praktikal dapat memberikan keuntungan yang lebih besar:

  • Caching prom – simpan definisi alat sekali dan gunakan semula versi yang telah disimpan dalam cache pada panggilan seterusnya. Pembacaan cache dicaj pada kadar yang lebih rendah berbanding token input baharu.
  • Pangkas set alat – hanya sertakan alat yang penting untuk tugasan semasa. Setiap alat tambahan menambah definisinya pada setiap permintaan, sekali gus meningkatkan kos input.
  • Ringkaskan keputusan alat – pulangkan hanya medan yang diperlukan oleh model. Respons API yang besar yang dimasukkan semula ke dalam perbualan akan meningkatkan kedua-dua token input dan sejarah perbualan.

Mengaplikasikan amalan ini boleh mengurangkan sebahagian besar daripada jumlah perbelanjaan, jauh melampaui 3 peratus yang anda lihat daripada ciri beta sahaja.

Apa yang perlu diperhatikan

Anthropic belum menyatakan bila—atau jika—mod cekap-token ini akan beralih daripada beta kepada ciri lalai. Pembangun harus memerhatikan pengumuman masa hadapan yang mungkin meluaskan sokongan melampaui Claude 3.7 Sonnet atau memperkenalkan teknik pemampatan token yang lebih mendalam. Memantau pecahan token bagi setiap permintaan juga akan membantu mengukur impak dunia nyata apabila corak penggunaan berkembang.

Kesimpulan

Header beta ini adalah pelarasan percuma dan mudah yang mengurangkan token output panggilan alat sebanyak kira-kira 14 peratus, memberikan sedikit penurunan bil dan sedikit peningkatan kelajuan. Bagi sesiapa yang sudah bergelut dengan kos ejen yang tinggi, header ini adalah tambahan yang membantu, tetapi penjimatan sebenar akan datang daripada caching prom, mengehadkan pendedahan alat, dan memulangkan keputusan yang lebih ringkas.

Sumber: https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l