Mengapa pengujian ini penting

Asisten kode berbasis AI sering kali membiarkan tim menaruh file "aturan" di repositori dan mengharapkan model mematuhi instruksinya pada setiap permintaan. Dalam praktiknya, model mungkin tidak pernah melihat file tersebut, atau mungkin melihatnya tetapi mengabaikan isinya. Eksperimen terbaru dengan Claude Code menunjukkan kedua masalah tersebut. Alat tersebut secara diam-diam melewatkan file AGENTS.md berukuran 72 KB; ketika file yang sama diubah namanya menjadi CLAUDE.md, asisten memuatnya dan meningkatkan jumlah token untuk setiap permintaan. Anggaran token tambahan tersebut membengkakkan latensi, biaya, dan dapat membuat permintaan melampaui batas model.

Pengembang yang berasumsi bahwa "file ada" berarti "model mengikuti aturan" berisiko menghadapi inefisiensi tersembunyi dan output yang tidak terprediksi. Pengujian tiga langkah ini memaksa adanya bukti konkret di setiap tahap: konfigurasi, pemuatan, dan kegunaan.

Tiga pertanyaan yang perlu diajukan

  1. Terkonfigurasi – Apakah file ditempatkan di lokasi yang dicari oleh asisten? Berbagai alat menggunakan jalur (path) atau konvensi nama file yang sudah ditentukan (hard-coded); ketidakcocokan berarti file tersebut tidak pernah masuk ke dalam alur prompt.
  2. Dimuat – Apakah asisten menunjukkan bukti bahwa ia menerima file tersebut? Hash dapat mengonfirmasi identitas file di disk, tetapi hanya jejak pengiriman (misalnya, baris log atau jumlah token) yang membuktikan bahwa model benar-benar membacanya.
  3. Berguna – Apakah keberadaan file tersebut meningkatkan hasil tugas? File yang dimuat tetapi menambah token tanpa mengubah hasil adalah kerugian bersih.

Menjalankan pengujian

Prosedurnya sengaja dibuat minimal agar dapat diulang di platform mana pun.

  1. Buat aturan yang terlihat – Tulis instruksi sederhana yang dapat diamati. Misalnya: “Sebutkan tepat dua file sebelum melakukan pengeditan.” Efek dari aturan tersebut dapat diperiksa dalam respons asisten.

  2. Periksa versi alat dan model – Buka sesi baru, catat string versi dan pengenal model. Versi yang berbeda mungkin mengubah nama file yang mereka kenali.

  3. Eksekusi dua kali pengujian Run A: Gunakan nama file yang tidak dikenali oleh alat (misalnya, AGENTS.md). Run B: Gunakan nama file asli alat tersebut (misalnya, CLAUDE.md).

    Catat:

    • Hash sumber file (untuk membuktikan konten di disk tidak berubah).
    • Jalur (path) tepat yang digunakan.
    • Bukti apa pun yang dicatat asisten tentang pemuatan file (peningkatan jumlah token, pesan eksplisit “loaded X.md”, dll.).
    • Jumlah token untuk setiap permintaan.
    • Hasil tugas (apakah asisten menyebutkan tepat dua file?).

Jika Run B menunjukkan aturan dipatuhi dan jumlah token naik sesuai jumlah yang diharapkan, maka file tersebut dimuat sekaligus berguna. Jika aturan diabaikan meskipun ada peningkatan token, file tersebut dibaca tetapi penguraian (parsing) prompt model membuang instruksinya. Dalam kasus tersebut, menambah lebih banyak teks ke dalam file tidak akan membantu; pindahkan aturan tersebut ke gerbang kebijakan (policy gate) yang sudah ditentukan atau ke alat pengujian (test harness) sebagai gantinya.

Apa yang diungkapkan oleh data

Kasus Claude Code menunjukkan kesenjangan yang mencolok antara konfigurasi dan pemuatan. File 72 KB tersebut ada, memiliki hash yang benar, dan telah disinkronkan ke repositori, namun asisten tidak pernah merujuknya. Mengubah nama file menjadi CLAUDE.md yang asli memicu pemuatan, tetapi juga menambah beban token yang substansial. Setiap token tambahan mengonsumsi siklus komputasi dan dapat membuat permintaan melampaui batas kecepatan (rate limits).

Pengujian tiga langkah ini mengungkap biaya tersembunyi tersebut sebelum menjadi penghambat produksi. Dengan menangkap selisih (delta) token, tim dapat memutuskan apakah manfaat aturan tersebut sebanding dengan biayanya.

Kesimpulan

Jangan pernah berasumsi bahwa file aturan berfungsi hanya karena file tersebut ada di repositori. Gunakan pengujian tiga langkah—konfigurasi, muat, buktikan kegunaan—untuk mengubah asumsi tersebut menjadi bukti yang terukur. Ketika bukti menunjukkan bahwa sebuah file hanyalah penghisap token (token sink), pindahkan logikanya keluar dari prompt dan ke dalam gerbang deterministik. Hasilnya adalah alur kerja pengodean AI yang lebih ramping, lebih cepat, dan lebih terprediksi.