AgentInspect memungkinkan pengembang untuk menangkap tindakan langkah demi langkah dari agen AI sebagai log JSONL, sehingga memungkinkan verifikasi bahwa alat (tool) yang diperlukan telah dijalankan – semuanya tanpa perlu menghubungkan OpenTelemetry ke dalam stack.

Dalam pengujian cepat dengan contoh pengecekan cuaca yang dibangun di atas Vercel AI SDK, AgentInspect menandai sebuah “silent failure”: jawaban akhirnya benar, tetapi pemanggilan weather-tool tidak pernah terjadi. Pemeriksaan tingkat proses dari library ini menangkap masalah yang mungkin terlewatkan oleh pengujian output biasa.

Mengapa jalur eksekusi itu penting

Respons agen AI adalah produk akhir dari sebuah rantai yang dapat mencakup beberapa pemanggilan model dan pemanggilan alat eksternal. Jika sebuah prompt seharusnya mengambil data langsung (live data), ketiadaan pengambilan data tersebut mengubah profil risiko meskipun teksnya terlihat benar. Pengujian tingkat jawaban memungkinkan bug yang melewatkan langkah krusial lolos ke produksi tanpa terdeteksi.

Apa yang dilakukan AgentInspect

  • Perekaman ringan – Sebuah adapter TypeScript terhubung ke kode agen dan menulis setiap pemanggilan model, pemanggilan alat, serta urutannya ke dalam file JSON yang dipisahkan baris (JSONL).
  • Mesin aturan – Pengembang dapat mendeklarasikan predikat sederhana seperti “weather tool harus dipanggil” atau “finance API tidak boleh digunakan.” Library ini mengevaluasi aturan-aturan tersebut setelah setiap pengujian.
  • Inspeksi CLI – Pengujian yang gagal disimpan sebagai file yang dapat dibuka oleh alat baris perintah (command-line tool) bawaan untuk pemutaran ulang (replay) jejak eksekusi yang dapat dibaca manusia.

Karena log tersebut berupa file lokal, tidak diperlukan backend tracing, konfigurasi jaringan, atau layanan observabilitas terpisah.

Bagaimana pengujian diatur

  1. Pemeriksaan proses – Sebuah aturan memverifikasi bahwa endpoint weather-tool telah dipanggil.
  2. Pemeriksaan jawaban – Sebuah asersi terpisah membandingkan teks yang dihasilkan dengan rekomendasi wisata dalam ruangan yang diharapkan.

Dua skenario dijalankan:

Skenario Pemeriksaan jawaban Pemeriksaan proses
Happy path (cuaca diambil) Lulus Lulus
Cuaca dilewati (alat tidak pernah dipanggil) Lulus Gagal

Pengujian kedua menunjukkan nilai dari pemeriksaan proses: jawabannya terlihat baik-baik saja, tetapi hilangnya pemanggilan alat menandakan adanya cacat tersembunyi.

AgentInspect vs. Promptfoo

Promptfoo, kerangka kerja pengujian yang lebih mapan, menangkap jejak melalui OpenTelemetry. Pendekatan tersebut bekerja dengan baik untuk tim yang sudah mengirimkan data telemetri ke pengumpul (collector), tetapi menambah beban konfigurasi dan ketergantungan pada infrastruktur tracing.

AgentInspect terasa lebih cocok untuk tahap awal pengembangan, tetapi sangat mudah untuk diatur.

Siapa yang perlu peduli

  • Pipeline CI – Menambahkan satu langkah yang menjalankan AgentInspect dan menghentikan build jika terjadi pelanggaran aturan akan mengubah bug senyap menjadi penghentian paksa (hard stop).
  • Debugging – Log JSONL dapat dibuka secara lokal untuk memutar ulang urutan pemanggilan yang tepat, sehingga menghemat waktu dibandingkan harus menggali dasbor trace jarak jauh.
  • Tim produk – Mengetahui bahwa pengambilan data penting benar-benar terjadi sebelum merilis fitur akan mengurangi risiko keluhan pengguna di kemudian hari.

Intinya: ketika kebenaran agen AI bergantung pada tindakan yang diambilnya, bukan hanya teks akhirnya, perekam ringan seperti AgentInspect dapat mengubah bug proses yang tersembunyi menjadi kegagalan yang terlihat dan dapat diuji—tanpa beban stack tracing yang lengkap.