A equipe Foundry da Microsoft adicionou rastreamento baseado em OpenTelemetry ao seu framework de agentes, oferecendo aos desenvolvedores uma maneira de visualizar a execução de ponta a ponta entre agentes heterogêneos baseados em LLM.

Por que sistemas multiagentes precisam de mais do que arquivos de log

Um exercício típico de resposta a incidentes impulsionado por IA utiliza um agente comandante que orquestra vários agentes especialistas: um analisa logs, outro detecta anomalias de métricas, um terceiro associa sintomas a runbooks e um roteador escolhe o melhor modelo de linguagem para cada subtarefa. Cada especialista pode chamar um modelo diferente — por exemplo, uma variante “gpt-5-mini” — e invocar suas próprias ferramentas. Quando algo dá errado, os engenheiros ficam olhando para logs isolados que mostram o que cada componente fez, mas sem uma visão de como as peças se encaixam.

Sem um trace unificado, a causa raiz se esconde na passagem de bastão entre os agentes. O comandante pode enviar uma solicitação que o leitor de logs processa corretamente, mas o especialista em métricas interpreta os dados de forma errada e sugere o runbook incorreto. Depurar essa cadeia manualmente consome tempo e induz ao erro.

Como o OpenTelemetry une o fluxo de trabalho

O OpenTelemetry define dois conceitos centrais: traces e spans. Um trace é um identificador único que acompanha uma solicitação desde a entrada até a resposta final. Um span registra uma única operação — como uma chamada a um modelo de linguagem ou uma invocação de ferramenta — dentro desse trace.

Quando um agente recebe uma solicitação, ele extrai o Trace ID de entrada dos metadados da solicitação e cria um child span que herda o mesmo ID. O child span registra seu horário de início, duração, atributos (nome do modelo, ferramenta usada) e quaisquer erros. O processo se repete para cada agente subsequente, construindo uma árvore que reflete o fluxo lógico da tarefa geral.

O OpenTelemetry também suporta Baggage, um transportador leve para pares de chave-valor personalizados. Ao anexar um “drill-id” ou outro contexto de negócio ao baggage no topo do trace, cada span subsequente herda automaticamente esse identificador. Um processador de spans então promove o baggage para atributos regulares, facilitando a consulta de todos os spans pertencentes a um exercício de incidente específico.

Como é a nova interface de rastreamento

Com a instrumentação implementada, o Azure Monitor (ou qualquer backend compatível com OpenTelemetry) renderiza uma hierarquia visual:

  • Nome / ID do agente – mostra qual componente realizou a operação.
  • Uso de ferramentas – registra qual serviço externo ou função foi chamada.
  • Versão do modelo – registra o LLM exato utilizado, útil para acompanhar regressões após uma atualização de modelo.
  • Consumo de tokens – captura quantos tokens foram enviados e recebidos do modelo, ajudando as equipes a gerenciar custos.
  • Latência / duração – destaca onde surgem os gargalos, seja na inferência do modelo ou no I/O de ferramentas.

No exemplo do exercício de incidente, o root span do comandante gera child spans para cada especialista, e cada especialista gera novos filhos para suas chamadas de modelo. Ao clicar em qualquer nó, o conjunto completo de atributos é revelado, permitindo que um engenheiro veja instantaneamente os detalhes de cada operação.

O que está em jogo para operações centradas em IA

  • Velocidade da análise de causa raiz – As equipes rastreiam uma falha até o span exato que gerou um erro, reduzindo o tempo médio de resolução.
  • Visibilidade de custos – A contagem de tokens aparece ao lado da latência, permitindo que o setor financeiro identifique o uso desenfreado antes que as faturas de nuvem disparem.
  • Ajuste de desempenho – Spans de alta latência entre agentes apontam onde o cache, a seleção de modelos ou o redesenho de ferramentas poderiam aumentar o throughput.

O que observar a seguir

Projetos construídos sobre LangChain, o OpenAI SDK ou outras camadas de orquestração podem adotar as mesmas convenções semânticas para GenAI, abrindo caminho para traces que fluem entre provedores de nuvem e implantações on-premise.

As organizações simplesmente habilitam o OpenTelemetry SDK em seus agentes e enviam os dados para o Azure Monitor ou para um coletor de código aberto.

Conclusão

O OpenTelemetry fornece aos sistemas de IA multiagentes a "cola" que faltava para transformar um conjunto disperso de logs em uma narrativa coerente. Ao propagar um único Trace ID através de LLMs heterogêneos, roteadores e chamadas de ferramentas, os desenvolvedores localizam falhas, monitoram custos e otimizam o desempenho sem precisar reinventar a infraestrutura de rastreamento.