Tim Foundry Microsoft telah menambahkan tracing berbasis OpenTelemetry ke dalam framework agent mereka, memberikan cara bagi pengembang untuk melihat eksekusi end-to-end di seluruh agent berbasis LLM yang heterogen.
Mengapa sistem multi-agent membutuhkan lebih dari sekadar file log
Simulasi respons insiden berbasis AI yang umum menggunakan agent komandan yang mengorkestrasi beberapa agent spesialis: satu memproses log, yang lain mendeteksi anomali metrik, yang ketiga mencocokkan gejala dengan runbook, dan sebuah router memilih model bahasa terbaik untuk setiap sub-tugas. Setiap spesialis mungkin memanggil model yang berbeda—misalnya, varian “gpt-5-mini”—dan memanggil tool miliknya sendiri. Ketika terjadi kesalahan, para engineer hanya menatap log yang terisolasi yang menunjukkan apa yang dilakukan setiap komponen, tetapi tidak memiliki pandangan tentang bagaimana bagian-bagian tersebut saling terhubung.
Tanpa trace yang terpadu, akar masalah tersembunyi dalam proses serah terima (hand-off) antar agent. Komandan mungkin mengirimkan permintaan yang ditangani dengan benar oleh pembaca log, namun spesialis metrik salah menafsirkan data dan menyarankan runbook yang salah. Melakukan debugging pada rantai tersebut secara manual memakan waktu dan rentan terhadap kesalahan.
Bagaimana OpenTelemetry menyatukan alur kerja
OpenTelemetry mendefinisikan dua konsep inti: traces dan spans. Sebuah trace adalah pengenal unik yang mengikuti permintaan dari awal hingga respons akhir. Sebuah span mencatat satu operasi tunggal—seperti panggilan ke model bahasa atau pemanggilan tool—di dalam trace tersebut.
Saat sebuah agent menerima permintaan, ia mengambil Trace ID yang masuk dari metadata permintaan dan membuat child span yang mewarisi ID yang sama. Child span tersebut mencatat waktu mulai, durasi, atribut (nama model, tool yang digunakan), dan kesalahan apa pun. Proses ini berulang untuk setiap agent downstream, membangun sebuah pohon (tree) yang mencerminkan alur logis dari tugas secara keseluruhan.
OpenTelemetry juga mendukung Baggage, sebuah pembawa ringan untuk pasangan key-value kustom. Dengan melampirkan “drill-id” atau konteks bisnis lainnya ke dalam baggage di bagian atas trace, setiap span downstream secara otomatis mewarisi pengenal tersebut. Sebuah span processor kemudian mempromosikan baggage tersebut menjadi atribut reguler, sehingga memudahkan untuk melakukan query pada semua span yang termasuk dalam simulasi insiden tertentu.
Seperti apa tampilan surface tracing yang baru
Dengan instrumentasi yang sudah terpasang, Azure Monitor (atau backend apa pun yang kompatibel dengan OpenTelemetry) menampilkan hierarki visual:
- Agent name / ID – menunjukkan komponen mana yang melakukan operasi tersebut.
- Tool usage – mencatat layanan atau fungsi eksternal mana yang dipanggil.
- Model version – mencatat LLM tepat yang digunakan, berguna untuk melacak regresi setelah upgrade model.
- Token consumption – menangkap berapa banyak token yang dikirim ke dan diterima dari model, membantu tim mengelola biaya.
- Latency / duration – menyoroti di mana kemacetan (bottleneck) muncul, baik dalam inferensi model maupun I/O tool.
Dalam contoh simulasi insiden, root span dari komandan melahirkan child span untuk setiap spesialis, dan setiap spesialis melahirkan anak (child) lebih lanjut untuk panggilan modelnya. Mengklik node mana pun akan menampilkan set atribut lengkap, sehingga engineer dapat langsung melihat detail dari setiap operasi.
Risiko dan kepentingan bagi operasi yang berpusat pada AI
- Kecepatan analisis akar masalah – Tim dapat melacak kegagalan kembali ke span tepat yang memicu error, sehingga memangkas waktu rata-rata penyelesaian (mean time to resolution).
- Visibilitas biaya – Jumlah token disandingkan dengan latensi, memungkinkan tim keuangan mendeteksi penggunaan yang tidak terkendali sebelum tagihan cloud membengkak.
- Penyetelan performa (Performance tuning) – Span dengan latensi tinggi di berbagai agent menunjukkan di mana caching, pemilihan model, atau desain ulang tool dapat meningkatkan throughput.
Apa yang perlu diperhatikan selanjutnya
Proyek yang dibangun di atas LangChain, OpenAI SDK, atau lapisan orkestrasi lainnya dapat mengadopsi konvensi semantik yang sama untuk GenAI, membuka jalan bagi trace yang mengalir di berbagai penyedia cloud dan deployment on-premise.
Organisasi cukup mengaktifkan OpenTelemetry SDK di dalam agent mereka dan mengirimkan data ke Azure Monitor atau collector open-source.
Kesimpulan
OpenTelemetry memberikan "perekat" yang hilang bagi sistem AI multi-agent yang mengubah kumpulan log yang tersebar menjadi narasi yang koheren. Dengan menyebarkan satu Trace ID tunggal di seluruh LLM yang heterogen, router, dan panggilan tool, pengembang dapat menemukan kegagalan, memantau biaya, dan mengoptimalkan performa tanpa harus membangun ulang infrastruktur tracing.
