Agen AI yang saya luncurkan lolos 23 unit test, tetapi dalam waktu satu jam setelah aktif, ia mengarang fitur produk dan memberikan penawaran harga tiga kali lebih rendah dari kenyataan. Ketika pengguna menegurnya, bot tersebut justru bersikeras, percakapan berakhir, dan saya kehilangan klien. Kesalahan tersebut membuktikan bahwa rangkaian unit test yang deterministik tidak dapat menjamin keandalan sebuah agen.

Mengapa unit test tidak cukup untuk agen AI

Unit test berfungsi untuk kode tradisional karena input yang sama selalu menghasilkan output yang sama. “2 + 2 = 4” adalah jaminan yang dapat Anda verifikasi dengan pemeriksaan kesamaan sederhana. Namun, agen berbasis LLM mengubah outputnya berdasarkan prompt, konteks sekitarnya, dan status alat eksternal apa pun yang dipanggilnya. Sebuah tes yang memeriksa kesamaan string secara tepat akan melewatkan halusinasi, perubahan nada, atau pelanggaran guardrail. Kegagalan senyap yang membuat saya kehilangan klien menunjukkan bahwa Anda harus mengevaluasi seluruh interaksi, bukan hanya fungsi-fungsi yang terisolasi.

Membangun evaluation harness sebelum menulis kode fitur apa pun

Saya membalik urutan pengembangannya: rancang evaluation harness empat lapis terlebih dahulu, baru kemudian menulis agennya. Harness ini menjalankan 131 tes dalam satu kali jalan, biayanya sekitar tiga sen per jalan, dan selesai dalam waktu sekitar sebelas menit. Saya menetapkan setiap tes ke model terkecil yang mampu menanganinya, dan mencadangkan model yang lebih besar dan lebih mahal untuk momen-momen di mana mereka benar-benar memberikan nilai tambah.

Lapisan 1 – Fungsionalitas alat (tool)

Lini pertahanan pertama memeriksa apakah agen dapat memanggil alatnya dengan benar. Tes mencakup pencarian yang berhasil, kueri yang sengaja dibuat salah, dan simulasi kegagalan API. Karena penggunaan alat sebagian besar bersifat deterministik—entah permintaannya dibentuk dengan benar atau API mengembalikan error—assertion Python sederhana sudah cukup. Menangkap permintaan yang salah di sini akan mencegah kebingungan di tahap selanjutnya.

Lapisan 2 – Kepatuhan instruksi

Selanjutnya, harness memverifikasi apakah agen mematuhi guardrail. LLM yang lebih kecil bertindak sebagai evaluator, memindai respons agen untuk kepatuhan: tetap pada karakter, menghindari topik terlarang, dan mengeluarkan skema JSON yang diperlukan. Lapisan ini menangkap pergeseran semantik yang terlewatkan oleh unit test, seperti masuk ke persona yang tidak diinginkan atau membocorkan prompt internal.

Lapisan 3 – Perilaku berorientasi tujuan

Lapisan ketiga adalah yang paling kritis. Lapisan ini mempertanyakan apakah agen benar-benar mencapai tujuannya. Untuk bot penghasil prospek (lead-generation), itu berarti memastikan ia mengajukan pertanyaan kualifikasi yang tepat dan melakukan eskalasi ke manusia jika diperlukan. Saya menggunakan model yang berorientasi pada penalaran (reasoning-oriented) di sini karena ia dapat menilai alur secara keseluruhan tanpa membengkakkan biaya. Jika bot gagal mencapai tujuannya—bahkan setelah lolos dua lapisan pertama—ia akan ditandai untuk desain ulang.

Lapisan 4 – Performa

Terakhir, harness mencatat latensi dan kecepatan pembuatan token. Respons yang lambat merusak pengalaman pengguna, terutama dalam chat real-time. Dengan melacak metrik ini bersama dengan kebenaran fungsional, saya memastikan agen tersebut akurat sekaligus responsif.

Pilihan penghematan biaya

Angka $0,03 per jalan bukanlah trik pemasaran; itu berasal dari penyesuaian kompleksitas tes dengan ukuran model. Pemeriksaan alat yang deterministik berjalan pada runtime termurah, kepatuhan instruksi menggunakan model ringan, dan hanya penilaian berorientasi tujuan yang memanggil model yang lebih mumpuni, meskipun lebih mahal. Pendekatan bertingkat ini menjaga total pengeluaran tetap cukup rendah untuk menjalankan seluruh rangkaian tes pada setiap perubahan kode.

Trade-off: kecepatan versus keamanan

Memperkenalkan harness menambah hambatan di awal. Siklus pengembangan menjadi lebih panjang, dan lini masa peluncuran pun bergeser.

Apa yang perlu diperhatikan selanjutnya

  • Evaluator berbasis model: Seiring meningkatnya kemampuan LLM, evaluator di Lapisan 2 dapat menjadi lebih bernuansa, mengurangi false positive sambil tetap dapat mendeteksi pelanggaran kebijakan yang halus.

Kesimpulan

Jika Anda membangun agen AI untuk produksi, evaluation harness yang berlapis bukanlah pilihan; itu adalah fondasi. Dengan membebankan biaya pengujian yang komprehensif di awal—$0,03 per jalan, sebelas menit per rangkaian—Anda melindungi diri dari kegagalan senyap yang tidak dapat dideteksi oleh unit test.