Claude Code 2.1.212를 통해 이제 개발자는 AI 세션이 생성할 수 있는 서브 에이전트와 웹 검색 횟수에 대해 엄격한 제한(hard limits)을 설정할 수 있으며, 이를 통해 비용 폭증을 막을 수 있는 구체적인 수단을 갖게 되었습니다.

이번 업데이트에서는 서브 에이전트 생성과 웹 검색 호출에 대해 각각 설정 가능한 두 가지 상한선(caps)이 추가되었으며, 기본값은 세션당 200회입니다. 개발자는 환경 변수를 사용하여 이 수치를 낮출 수 있습니다. 또한, 2분 이상 실행되는 모든 MCP(Model-Control-Plane) 호출은 자동으로 백그라운드로 전환되어, 단일 도구의 지연이 전체 워크플로우를 멈추게 하는 것을 방지합니다.

지금 이 제한이 중요한 이유

제약 없이 다른 에이전트를 호출하거나 웹을 스크레이핑할 수 있는 AI 에이전트는 유용하지만, 동시에 재정적 위험 요소가 될 수도 있습니다. 모호한 프롬프트 하나가 서브 에이전트의 연쇄 호출을 유발할 수 있으며, 각 에이전트는 토큰을 소비하고 외부 도구를 호출합니다. 그 결과, 인지하기도 전에 청구 금액이 눈덩이처럼 불어날 수 있습니다. 실제로 팀들은 다음과 같은 사례를 보고했습니다:

  • 원래 작업 예산을 훨씬 초과하는 예상치 못한 토큰 소비.
  • 중복된 서브 에이전트가 서로의 편집 내용을 덮어써서 발생하는 충돌 결과.
  • 하나로 합치기 어려운 파편화된 출력물의 범람.
  • 느린 외부 도구로 인해 전체 세션이 지연되어, 간단한 쿼리가 몇 분간의 대기로 이어지는 현상.

Claude Code는 엄격한 상한선을 설정함으로써 비용이 걷잡을 수 없이 커지기 전에 시스템을 중단시키는 동시에, 사람이 검토할 수 있는 부분적인 답변을 제공합니다.

상한선을 설정하는 방법

세 가지 조절 옵션은 환경 변수로 제공됩니다:

export CLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION=12   # default 200
export CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION=30   # default 200
export CLAUDE_CODE_MCP_AUTO_BACKGROUND_MS=120000   # 2 minutes

기본값은 대부분의 탐색적 작업에 충분할 만큼 넉넉하지만, 팀은 특정 작업의 리스크 프로필에 맞춰 이를 더 엄격하게 조정할 수 있습니다. 출시를 발표한 기사에서는 몇 가지 기준점을 제시했습니다:

  • 로컬 버그 수정: 서브 에이전트 02개, 검색 05회.
  • PR 리뷰: 서브 에이전트 35개, 검색 010회.
  • 장애 조사: 서브 에이전트 24개, 검색 1025회.
  • 광범위한 아키텍처 연구: 합성기(synthesizer) 1개, 연구원(researcher) 24개, 검색 2040회.

이는 정해진 규칙이 아니라, 개발자가 반복 실험을 통해 조정해 나갈 수 있는 기준점입니다.

트레이드오프 (Trade-off)

에이전트 활동에 엄격한 상한선을 두는 것이 훌륭한 작업 설계(task design)를 대신할 수는 없습니다. 만약 문제가 단일 세션으로 처리하기에 너무 크다면, 작업을 단계별로 나누고 각 단계에 예산을 할당하며, 다음 단계로 넘어가기 전에 사람이 확인하는 체크포인트를 두는 방식이 권장됩니다. 제한된 시스템은 반복적인 루프에 돈을 계속 낭비하는 대신, 해결되지 않은 질문을 포함한 유용한 부분적 결과를 반환해야 합니다.

상한선을 너무 공격적으로 설정할 경우, 에이전트가 실행 가능한 솔루션에 도달하기 전에 멈춰버려 개발자가 더 높은 제한을 설정하고 작업을 다시 실행해야 하는 위험이 있습니다. 이러한 추가 반복 작업은 오버헤드를 발생시킬 수 있지만, 제어되지 않는 세션으로 인해 발생하는 비용은 훨씬 더 클 수 있습니다.

프로덕션 적용 방법

  1. 업그레이드: 스테이징 환경에서 Claude Code 2.1.212로 업그레이드합니다.
  2. 워크플로우 선택: 예를 들어 PR 리뷰와 같은 워크플로우를 선택하고 보수적인 예산을 설정합니다.
  3. 로그 구성(Instrument): 실행된 서브 에이전트 수, 수행된 웹 검색 횟수, 2분 임계값에 도달한 MCP 호출 등을 캡처할 수 있도록 로그를 구성합니다.
  4. 검토: 상한선에 도달한 모든 실행 건을 검토합니다. 상한선 설정이 비용을 절감했는지, 아니면 실제 진행을 방해했는지 판단하여 그에 따라 제한을 조정합니다.

상한선은 런타임에 적용되므로 로그에서 즉시 확인할 수 있습니다. 이러한 지표를 추적하는 팀은 피드백 루프를 구축할 수 있습니다. 즉, 에이전트가 작업을 완료하지 못하기 시작할 때까지 예산을 낮추었다가, 핵심 작업을 완료할 수 있을 만큼만 다시 높이는 방식입니다.

향후 주목할 점

아직 초기 단계이므로 비용 절감에 대한 실제 데이터는 제한적입니다. 상한선을 도입하는 조직은 다음 사항을 모니터링해야 합니다:

  • 변경 전후의 세션당 비용.
  • 다양한 예산 수준에서의 작업 완료율.
  • 에이전트가 조기에 중단될 때와 끝까지 실행될 때의 사용자 만족도.

상한선이 효과적임이 입증되면, 업계 전반에 걸쳐 예산을 고려하는(budget-aware) AI 에이전트에 대한 움직임이 확산될 수 있습니다. 만약 개발자들이 제한이 너무 엄격하다고 느낀다면, 다음 버전에서는 도구별 예산이나 관찰된 지출에 기반한 동적 스케일링과 같은 더 세밀한 제어 기능이 도입될 수 있습니다.

결론적으로, Claude Code 2.1.212는 AI 기반 자동화가 예상치 못한 재정적 충격으로 이어지지 않도록 팀에 간단하고 실행 가능한 방법을 제공합니다. 상한선을 활용하고 결과를 모니터링하며, 데이터를 바탕으로 에이전트에게 부여할 자율성의 정도를 결정하십시오.