ABSeeker의 새로운 “Answer-Backtracked Credit Assignment”(ABC) 방식은 장기 탐색 에이전트가 최종 답변뿐만 아니라 각 개별 단계에 대해 보상을 받을 수 있게 하며, 이 방식으로 학습된 40억 매개변수 모델은 이미 훨씬 더 큰 규모의 경쟁 모델들과 대등하거나 이를 능가하는 성능을 보여줍니다.
이 돌파구가 중요한 이유는 기존의 대부분의 에이전트가 작업이 끝난 시점에서만 평가받기 때문입니다. 최종 답변이 맞으면 전체 과정이 '좋음'으로 표시되고, 틀리면 전체 시퀀스가 '나쁨'으로 표시됩니다. 이러한 '전부 아니면 전무(all-or-nothing)' 방식의 피드백은 실제 학습 신호를 가립니다. 즉, 실수로 이어졌을 뿐인 훌륭한 움직임이나, 운 좋게 정답으로 이어진 무의미한 클릭 같은 것들 말입니다. ABSeeker의 접근 방식은 이러한 규칙을 새로 씁니다.
기존 방식이 부족한 이유
에이전트가 검색을 수행하거나, 코드를 작성하거나, 증거를 수집할 때는 일반적으로 쿼리 실행, 페이지 열기, 명령 실행, 시스템 상태 확인 등 많은 동작을 수행합니다. 15단계의 과정 중 단 한 번의 실수만으로도 이전 단계들이 완벽했음에도 불구하고 최종 답변을 망칠 수 있습니다. 반대로, 정답으로 끝난 과정이라 하더라도 대부분의 단계가 아무런 가치가 없었음에도 단순히 운에 기대어 성공했을 수도 있습니다. 최종 결과로만 학습하면 모델은 전체 궤적을 하나의 블랙박스로 취급하게 되어, 어떤 하위 행동이 실제로 유용한지 학습하기 어려워집니다.
이 상황은 소프트웨어 공학의 디버깅 과정과 유사합니다. 개발자는 모든 코드를 추적하고, 실패한 호출을 격리하여 수정합니다. 하지만 에이전트에게는 내부 작업에 대한 그와 유사한 '영수증(receipt)'이 제공되지 않았습니다. 이러한 감사 추적(audit trail)이 없다면, 개발자는 성능 향상이 더 나은 추론 덕분인지 아니면 단순한 우연인지 판단할 수 없으며, 나쁜 습관을 체계적으로 교정할 수도 없습니다.
ABC가 보상 할당을 재구성하는 방법
Answer-Backtracked Credit Assignment는 정답인 최종 답변으로부터 역방향으로 작동합니다. 먼저 답변이 의존하는 핵심 단서(특정 증거, 중간 결과 또는 상태 확인 등)를 추출합니다. 그런 다음 기록된 추적 경로를 역으로 따라가며, 각 동작을 해당 단서와 대조하여 점수를 매깁니다. 필요한 단서에 직접적으로 기여한 동작에는 긍정적인 보상을 주고, 무관하거나 해로운 동작에는 부정적이거나 0점의 점수를 부여합니다.
이 점수 산정 방식을 기반으로 두 가지 학습 체계가 구축됩니다:
- ABC-SFT (Supervised Fine-Tuning)는 보상이 높은 단계가 모델에 더 강력한 영향을 미치도록 손실 함수(loss function)의 가중치를 재조정합니다. 이를 통해 모델은 과거에 유용한 단서로 이어졌던 동작을 우선시하도록 학습합니다.
- ABC-GRPO (Gradient-based Reward Policy Optimization)는 단계별 점수를 강화 학습을 위한 보상 신호로 취급하여, 답변 도출에 도움이 된 탐색의 특정 부분을 강화합니다.
ABC는 이진법적인 합격/불합격 라벨을 세밀한 기여도 지도로 변환함으로써 모델에 훨씬 더 풍부한 학습 신호를 제공합니다.
초기 결과가 증명하는 성과
연구진은 변화하는 탐색 상태를 추적하는 컨텍스트 관리 레이어가 장착된 소규모 40억 매개변수 모델에 ABC를 적용했습니다. 전통적으로 훨씬 더 큰 에이전트에게 유리했던 벤치마크 작업에서, ABC로 학습된 모델은 더 큰 시스템들과 대등하거나 오히려 능가하는 성능을 보였습니다. 이러한 성능 향상은 모델 크기를 키우지 않고도 이루어졌으며, 이는 더 나은 보상 할당(credit assignment)이 단순히 매개변수 수를 늘리는 것을 대체할 수 있음을 시사합니다.
핵심 요점은 간단합니다. 모델에게 무엇이 효과적이었는지에 대한 명확한 '영수증'을 제공하면, 동일한 양의 학습 데이터에서도 더 많은 가치를 추출할 수 있다는 것입니다.
실제 환경의 에이전트에게 갖는 의미
코딩 어시스턴트, 문헌 검토 봇, 고객 지원 도구와 같이 다단계 작업을 수행하는 모든 에이전트는 자신의 동작 추적(trace)에 의존합니다. ABC는 이러한 추적을 보존하고 평가하는 것이 단순히 있으면 좋은 부가 기능이 아니라, 효과적인 학습을 위한 필수 요소임을 보여줍니다.
- 코딩 에이전트는 계획, 실행된 각 명령, 그리고 코드를 검증하는 테스트 결과를 기록해야 합니다.
- 연구 에이전트는 전송한 쿼리, 열람한 출처, 추출한 증거를 유지해야 합니다.
- 지원 에이전트는 문제 해결로 이어진 모든 상태 확인과 의사 결정 지점을 기록해야 합니다.
이러한 추적 데이터가 확보되면 ABC는 보상을 정밀하게 할당할 수 있으며, 이를 통해 모델이 좋은 습관을 강화하고 실력으로 오해받을 수 있는 '운 좋은 지름길'을 버리도록 할 수 있습니다.
반론 및 실질적인 장애물
ABC의 이점에는 추가적인 복잡성이 따릅니다.
결론
Answer-Backtracked Credit Assignment는 에이전트에게 검색, 코딩, 추론을 가르치는 방식을 완전히 뒤바꿉니다. 최종 목적지에만 보상을 주는 대신 과정에서의 올바른 움직임에 보상을 줌으로써, 적당한 규모의 모델도 훨씬 더 거대한 모델만큼 효과적으로 학습할 수 있게 합니다. 다단계 작업을 수행해야 하는 에이전트를 구축하는 이들에게 트레이스 중심(trace-centric)의 학습 체계를 도입하는 것은 선택이 아닌 필수입니다. 이는 신뢰할 수 있고, 감사 가능하며, 궁극적으로 더 똑똑한 AI로 나아가는 길입니다.
