Yuxing Lu, Yicheng Chen, Shanchan Wu 연구진은 대규모 언어 모델(LLM) 에이전트가 작업 수행 중에 자신의 작업 실행 계획을 스스로 재작성할 수 있도록 하는 “Procedural Graph” 프레임워크를 공개했습니다.

오늘날 에이전트의 문제점

대부분의 LLM 기반 어시스턴트는 레시피를 암기해서 읊기만 하는 요리사와 같습니다. 모델은 단계를 일시적인 메모리에 저장하고, 다음 도구를 선택하며, 다음 토큰이 올바르게 생성되기를 기대할 뿐입니다. 실제로 다음과 같은 세 가지 실패 사례가 자주 발생합니다.

  • 목표 이탈(Goal drift) – 몇 차례의 턴이 지나면 에이전트가 원래의 목표를 잊어버립니다.
  • 도구 오용(Tool misuse) – API를 잘못된 순서로 호출하거나 동일한 호출을 반복합니다.
  • 학습되지 않는 실수(Unlearned mistakes) – 실패를 영구적으로 기록하는 것이 없기 때문에, 관련 없는 세션에서도 동일한 오류가 다시 나타납니다.

추론 과정이 암묵적인 상태로 유지되기 때문에, 개발자는 특정 동작이 왜 발생했는지 알 수 없고 사용자는 체계적인 결함을 수정할 수 없습니다.

프롬프트를 그래프로 전환하기

Procedural Graph는 "메모리 전용" 방식을 명시적이고 편집 가능한 구조로 대체합니다. 이 프레임워크는 세 가지 핵심 요소를 정의합니다.

요소 역할
노드(Node) "항공편 검색" 또는 "결제 확인"과 같은 구체적인 단계.
엣지(Edge) 노드 간의 흐름 – 직선형 시퀀스, 조건부 분기(if/then) 및 루프.
속성(Attribute) 노드나 엣지에 부착된 메타데이터(예: 성공률, 평균 실행 시간 또는 신뢰도 점수).

LLM 에이전트가 요청을 받으면, 먼저 요청을 기존 그래프에 매핑하거나 즉석에서 새로운 그래프를 구축합니다. 그런 다음 엣지를 따라 실행하며 도구를 호출하고, 결과를 속성에 저장합니다. 그래프가 모델의 토큰 스트림 외부에 존재하기 때문에 사용자는 이를 검사, 시각화 및 편집할 수 있습니다.

5단계의 자가 진화

이 기술의 참신함은 에이전트가 자신의 그래프를 개선할 수 있게 하는 루프에 있습니다.

  1. 기록(Record): 에이전트가 통과하는 모든 경로를 기록하고 입력, 도구 호출 및 결과를 로그로 남깁니다.
  2. 비교(Compare): 성공한 경로와 실패한 경로를 비교하여 어느 지점에서 차이가 발생하는지 정확히 찾아냅니다.
  3. 진단(Diagnose): 노드 속성(예: 낮은 성공률)과 엣지 조건을 검토하여 오류를 진단합니다.
  4. 제안(Propose): LLM이 실패 분석 내용을 전달받아 그래프 수정 사항을 제안합니다(누락된 검증 단계 추가, 불필요한 루프 제거, 조건 강화 등).
  5. 검증(Validate): 테스트 인스턴스에서 수정된 그래프를 검증합니다. 성능이 향상되면 변경 사항이 확정됩니다.

그래프가 단일 진실 공급원(single source of truth) 역할을 하기 때문에, 에이전트는 사람의 도움 없이도 단계를 추가하거나, 막다른 길을 제거하거나, 로직을 재구성할 수 있습니다. 서투르게 사람이 만든 워크플로라도 시간이 지나면서 스스로 치유될 수 있습니다.

이러한 변화가 중요한 이유

암기를 넘어선 일반화

정적인 프롬프트는 단 하나의 작업 사례만 포착합니다. 반면 그래프는 검색 및 예약, 데이터 입력 파이프라인, 문제 해결 대화와 같은 전체 클래스에 대한 "방법(how-to)"을 추상화하므로, 동일한 구조를 다양한 매개변수에 적용할 수 있습니다. 팀은 이제 변형이 생길 때마다 모델에 프롬프트를 다시 입력할 필요가 없습니다.

투명한 의사 결정

그래프는 순서도(flowchart)와 같은 형태를 띱니다. 이해관계자는 어떤 노드가 도구 호출을 트리거했는지, 그리고 왜 특정 분기가 선택되었는지를 정확하게 추적할 수 있습니다.

뉴로-심볼릭 시너지(Neuro-symbolic synergy)

Procedural Graph는 딥러닝 패턴 인식(LLM의 언어 이해)과 심볼릭 추론(명시적인 그래프 로직)을 결합합니다. LLM은 단계를 생성하거나 수정하기 위한 직관을 제공하고, 그래프는 논리적 일관성을 강제합니다. 저자들은 이를 LLM에 "시스템 2(System 2)" 뇌를 부여하는 것이라고 설명합니다. 즉, 원시 토큰 예측의 빠르고 연상적인 "시스템 1(System 1)"을 보완하는, 신중하고 검증 가능한 컨트롤러를 제공하는 것입니다.

요약

Procedural Graph는 LLM 에이전트에게 매 실행으로부터 학습할 수 있는 가변적이고 검사 가능한 중추(backbone)를 제공합니다. 찰나의 프롬프트를 지속적인 구조로 전환함으로써, 이 방식은 더 견고하고, 이해하기 쉬우며, 새로운 과제에 더 잘 적응하는 AI 어시스턴트를 구현할 것을 약속합니다.