대부분의 엔지니어링 팀은 여전히 수학 숙제를 채점하는 것과 똑같은 방식으로 AI 에이전트를 평가합니다. 최종 결과물만 확인하는 것이죠. 정답이면 출시를 승인하고 다음 단계로 넘어갑니다. 이는 위험한 지름길입니다. 정답이 나왔다고 해서 시스템 내부의 심각한 결함이 가려질 수 있기 때문입니다.

진짜 이야기는 에이전트가 그 결과에 도달하기 위해 거쳐온 경로에 담겨 있습니다. 이 경로를 '에이전트 궤적(agent trajectory)'이라고 부릅니다. 여기에는 모든 도구 호출(tool call), 모든 라우팅 결정, 에이전트가 재고를 위해 멈춰 선 모든 일시 정지 단계가 포함됩니다. 이를 에이전트가 남긴 '빵 부스러기 흔적'이라고 생각할 수 있습니다. 목적지만 확인한다면, 그 과정 곳곳에 흩어져 있는 모든 경고 신호를 놓치게 됩니다.

무질서한 경로의 문제점

에이전트는 마치 음주 운전자처럼 행동하면서도 결과적으로는 정답에 도달할 수 있습니다. 잘못된 도구를 사용하며 갈지자로 움직이고, 라우터로 되돌아갔다가, 불필요한 추론을 반복한 끝에 마침내 우연히 정답을 찾아내는 식입니다. 사용자는 깔끔한 결과를 보겠지만, 보이지 않는 곳에서 시스템은 자원이 새어나가고 리스크가 쌓여가고 있습니다.

이러한 혼란은 실제로 어떤 모습으로 나타날까요?

첫째, 중복된 도구 호출(redundant tool call)이 있습니다. 에이전트가 고객 데이터베이스를 조회하여 결과를 얻은 뒤, 5초 만에 이를 잊어버리고 동일한 파라미터로 같은 레코드를 다시 조회하는 경우입니다. 이는 데이터의 문제가 아니라 궤적의 문제입니다. 에이전트가 상태(state)를 유지하는 데 실패하여 작업을 반복하는 것입니다.

다음은 잘못된 도구를 먼저 사용하는 패턴(wrong-tool-first pattern)입니다. 코딩 에이전트가 이미 로컬 저장소에 있는 함수 정의를 찾기 위해 웹 검색을 시도할 수 있습니다. 또는 고객 지원 에이전트가 사용자의 질문이 명확하게 계정 설정 도구를 필요로 함에도 불구하고 결제 API를 호출할 수도 있습니다. 잘못된 선택을 할 때마다 토큰이 소모되고, 지연 시간(latency)이 늘어나며, 실제 작업이 시작되기도 전에 컨텍스트 제한(context limits)을 초과할 확률이 높아집니다.

라우터 루프(Router loops) 또한 위험 신호입니다. 결정 노드가 결정을 내리지 못하는 경우입니다. 작업을 A 분기로 보냈다가 마음을 바꿔 다시 가져오고, B 분기로 전달했다가, 아무 이유 없이 범용 폴백(fallback) 노드로 라우팅하는 식입니다. 루프가 발생할 때마다 네트워크 홉(network hop)이 추가되고, 결과적으로 디버그 로그에 혼란만 가중됩니다.

마지막으로 반복적인 분석이 있습니다. 에이전트가 이미 결론이 난 사항을 확정된 것으로 처리하지 않고, 매 단계마다 같은 결론을 계속해서 다시 도출하는 경우입니다. 이는 마치 나무를 자르기 전에 매번 판자의 길이를 열 번씩 재는 목수와 같습니다. 첫 번째 측정은 괜찮았지만, 나머지 아홉 번은 낭비된 움직임일 뿐입니다.

이러한 불필요한 단계들은 실질적인 결과를 초래합니다. 지연 시간이 누적됩니다. 동기식 채팅 인터페이스에서 추가된 3초는 영겁의 시간처럼 느껴집니다. 대규모 서비스에서는 이 몇 초가 수천 달러의 컴퓨팅 비용으로 이어집니다. 실패 리스크도 상승합니다. 불필요한 홉이 발생할 때마다 외부 API의 타임아웃, 컨텍스트 윈도우(context window)의 오버플로, 또는 레이스 컨디션(race condition)이 발생할 기회가 늘어납니다. 그리고 실제로 문제가 발생했을 때, 스파게티처럼 꼬인 트레이스(trace)를 디버깅하려면 고생 좀 하실 겁니다. 에이전트가 왜 7단계를 거쳤는지 재구성하는 데 몇 시간을 허비하다가, 결국 7단계 자체가 존재할 필요가 없었다는 사실을 깨닫게 될 것입니다.

수렴(Convergence)의 진정한 의미

궤적이 경로라면, 수렴(convergence)은 그 경로의 효율성을 측정하는 척도입니다. 수렴도는 에이전트가 사용자의 요청과 올바른 해결책 사이의 최단 경로를 얼마나 밀접하게 따르는지를 알려줍니다.

이는 정확도(accuracy)와는 다릅니다. 정확도는 단순한 도구입니다. 최종 상태가 올바른지만을 묻습니다. 반면 수렴도는 그 과정이 합리적이었는지를 묻습니다. 정확도는 높지만 수렴도가 낮은 에이전트는 성공이라는 가면을 쓴 리스크(liability)와 같습니다. 반면 수렴도가 높고 정확도가 중간 정도인 에이전트는 대개 수정하기가 더 쉽습니다. 추론 과정이 깔끔하고 실수가 국소적이기 때문입니다.

에이전트가 실제로 수행한 단계와 해당 작업 유형에 대해 정의한 최단 경로를 비교함으로써 대략적인 수렴 점수를 계산할 수 있습니다. 표준 환불 요청에 정확히 3번의 도구 호출이 필요함에도 에이전트가 9번을 사용했다면, 수렴 비율이 떨어진 것입니다. 이를 개선하기 위해 다양한 유형의 낭비에 가중치를 부여할 수 있습니다. 도구의 지연 시간과 비용에 따라 단 한 번의 잘못된 도구 호출이 단 한 번의 중복 호출보다 더 큰 비용을 초래할 수 있습니다. 아무런 가치를 더하지 않는 라우터 루프는 가장 큰 페널티를 받을 수도 있습니다. 왜냐하면 이는 아키텍처적