Claude Code menghabiskan tiga perempat dari anggaran tokennya hanya untuk membaca basis kode, menurut analisis Red Hat terhadap 219 sesi dunia nyata. Temuan ini membalikkan asumsi umum bahwa agen pengodean berbasis AI membuang-buang waktu dalam menghasilkan kode dan menyarankan bahwa pengembang harus mengatasi masalah manajemen konteks, bukan sekadar kecepatan model.

Data di balik klaim tersebut

Red Hat memeriksa 219 interaksi dengan Claude Code milik Anthropic dan menghitung penggunaan token per giliran (turn). Di seluruh sampel, median giliran mengalokasikan 75% token untuk menyerap kode dan dokumentasi di sekitarnya, sementara hanya 25% yang digunakan untuk menghasilkan baris baru. Karena sebagian besar penyedia AI menagih token input dan output dengan tarif yang sama, bagian "membaca" dari transaksi tersebut mendorong sebagian besar biaya.

Mengapa biaya membaca itu penting

Strategi optimasi

Banyak tim mencurahkan sumber daya ke model yang lebih cepat atau lebih besar, dengan harapan peningkatan kecepatan akan memangkas beberapa detik dari setiap proses generasi. Jika tiga perempat dari pekerjaan tersebut hanyalah menarik konteks, model yang lebih cepat hanya menghemat sebagian kecil dari total waktu. Faktor penentu utamanya adalah seberapa banyak konteks yang harus diproses model pada setiap giliran.

Kontrol biaya

Ketika asisten AI membaca ulang status repositori yang sama pada setiap permintaan, token input membengkak. Proyek dengan jendela konteks (context window) yang besar dapat melihat tagihan mereka melonjak drastis, meskipun jumlah kode yang dihasilkan tetap moderat.

Fokus rekayasa

Pembuat alat sering kali mengejar kualitas model yang lebih tinggi sambil mengabaikan bagaimana prompt disusun. Analisis tersebut menyarankan bahwa "rekayasa konteks" (context engineering) – memangkas, melakukan caching, dan meringkas kode yang diberikan ke model – memberikan ROI yang lebih besar daripada peningkatan model secara bertahap.

Langkah praktis untuk menekan biaya overhead membaca

  • Pangkas file yang tidak relevan – Hapus file yang tidak dibutuhkan oleh tugas saat ini dari prompt. Prompt yang lebih kecil berarti lebih sedikit token input.
  • Cache pembacaan berulang – Simpan interpretasi model terhadap bagian-bagian basis kode yang stabil dan gunakan kembali di berbagai giliran daripada mengirim ulang teks yang sama.
  • Kompres output alat – Ketika alat eksternal mengembalikan data besar (misalnya, laporan lint), ringkaslah sebelum memberikannya kembali ke Claude.
  • Gunakan diff inkremental – Kirim hanya perubahan sejak giliran terakhir, bukan seluruh isi file.

Taktik-taktik ini bertujuan untuk menghentikan AI agar tidak membaca ulang snapshot repositori yang sama pada setiap interaksi, sehingga memangkas latensi sekaligus biaya.

Argumen tandingan: kecepatan tetap penting

Beberapa pengembang berpendapat bahwa model yang lebih cepat tetap penting karena mengurangi latensi dari 25% token yang memang dihasilkan. Dalam lingkungan yang sensitif terhadap latensi—seperti plugin IDE yang harus merespons secara instan—setiap milidetik sangat berharga. Profil yang didominasi oleh aktivitas membaca tidak menghilangkan manfaat dari model yang lebih cepat; itu hanya mengurangi dampak relatifnya.

Apa yang perlu diperhatikan selanjutnya

Studi Red Hat didasarkan pada set sesi yang terbatas, sehingga pengambilan sampel yang lebih luas dapat mengungkapkan distribusi token yang berbeda untuk bahasa atau ukuran proyek lainnya. Jika data di masa depan mengonfirmasi angka pembacaan 75%, kita mungkin akan melihat pergeseran ke arah alat yang secara otomatis memangkas dan melakukan caching konteks, atau bahkan arsitektur model yang disetel untuk penyerapan konteks yang cepat.

Kesimpulan: Untuk pengodean berbantuan AI, peningkatan performa termurah berasal dari memberikan lebih sedikit data ke model, bukan dengan membuatnya menulis lebih cepat. Angka-angka dari Red Hat memberikan argumen yang jelas: pangkas, cache, dan ringkas prompt Anda, maka Anda akan melihat penghematan nyata baik dalam waktu maupun uang.