Claude Code menghabiskan tiga perempat daripada bajet tokennya hanya untuk membaca kod sumber, menurut analisis Red Hat terhadap 219 sesi dunia nyata. Penemuan ini mengubah andaian biasa bahawa ejen pengekodan dipacu AI membazirkan masa menjana kod dan mencadangkan bahawa pembangun harus menangani masalah pengurusan konteks, bukan sekadar kelajuan model.

Data di sebalik dakwaan tersebut

Red Hat meneliti 219 interaksi dengan Claude Code milik Anthropic dan mengira penggunaan token bagi setiap pusingan. Merentasi sampel tersebut, median pusingan memperuntukkan 75% token untuk menyerap kod dan dokumentasi sekeliling, manakala hanya 25% digunakan untuk menghasilkan baris baharu. Oleh kerana kebanyakan penyedia AI mengenakan caj token input dan output pada kadar yang sama, bahagian "membaca" dalam transaksi tersebut memacu sebahagian besar kos.

Mengapa kos pembacaan itu penting

Strategi pengoptimuman

Banyak pasukan mencurahkan sumber untuk model yang lebih pantas atau lebih besar, dengan harapan peningkatan kelajuan akan menjimatkan beberapa saat bagi setiap penjanaan. Jika tiga perempat daripada kerja tersebut hanyalah untuk menarik masuk konteks, model yang lebih pantas hanya menjimatkan sebahagian kecil daripada jumlah masa keseluruhan. Pemacu sebenar adalah sejauh mana konteks yang perlu diproses oleh model bagi setiap pusingan.

Kawalan kos

Apabila pembantu AI membaca semula keadaan repositori yang sama pada setiap permintaan, token input akan melonjak. Projek dengan tetingkap konteks (context window) yang besar boleh melihat bil mereka meningkat secara mendadak, walaupun jumlah kod yang dijana kekal sederhana.

Fokus kejuruteraan

Pembina alatan sering mengejar kualiti model yang lebih tinggi sambil mengabaikan cara prom (prompt) dibina. Analisis tersebut mencadangkan bahawa "kejuruteraan konteks" (context engineering) – seperti memangkas, menyimpan cache, dan meringkaskan kod yang diberikan kepada model – memberikan ROI yang lebih besar berbanding naik taraf model secara berperingkat.

Langkah praktikal untuk mengurangkan beban pembacaan

  • Pangkas fail yang tidak relevan – Buang fail yang tidak diperlukan oleh tugasan semasa daripada prom. Prom yang lebih kecil bermakna kurang token input.
  • Simpan cache pembacaan berulang – Simpan interpretasi model terhadap bahagian kod sumber yang stabil dan gunakannya semula merentasi pusingan berbanding menghantar semula teks yang sama.
  • Mampatkan output alatan – Apabila alatan luaran mengembalikan data yang besar (contohnya, laporan lint), ringkaskannya sebelum memberikannya semula kepada Claude.
  • Gunakan perbezaan (diff) berperingkat – Hantar hanya perubahan sejak pusingan terakhir berbanding keseluruhan kandungan fail.

Taktik-taktik ini bertujuan untuk menghalang AI daripada membaca semula tangkapan (snapshot) repositori yang sama pada setiap interaksi, sekali gus mengurangkan kependaman (latency) dan kos.

Hujah balas: kelajuan tetap penting

Sesetengah pembangun berhujah bahawa model yang lebih pantas tetap penting kerana ia mengurangkan kependaman bagi 25% token yang dijana. Dalam persekitaran yang sensitif terhadap kependaman—seperti pemalam (plugin) IDE yang mesti bertindak balas dengan serta-merta—setiap milisaat adalah berharga. Profil yang didominasi oleh pembacaan tidak menghapuskan manfaat model yang lebih pantas; ia hanya mengurangkan impak relatifnya.

Apa yang perlu diperhatikan seterusnya

Kajian Red Hat adalah berdasarkan set sesi yang terhad, jadi pensampelan yang lebih luas mungkin mendedahkan taburan token yang berbeza untuk bahasa atau saiz projek yang lain. Jika data masa hadapan mengesahkan angka pembacaan 75% tersebut, kita mungkin akan melihat peralihan ke arah alatan yang memangkas dan menyimpan cache konteks secara automatik, atau malah seni bina model yang ditala untuk pengambilan konteks yang pantas.

Rumusan: Untuk pengekodan berbantu AI, peningkatan prestasi yang paling murah datang daripada memberikan input yang lebih sedikit kepada model, bukannya dengan menjadikannya menulis dengan lebih pantas. Angka daripada Red Hat memberikan hujah yang jelas: pangkas, simpan cache, dan ringkaskan prom anda, dan anda akan melihat penjimatan ketara dari segi masa dan wang.