AWS와 Anthropic은 Amazon Web Services에 셀프 호스팅 방식의 Claude Apps Gateway를 출시했으며, Google Cloud는 에디터를 Jupyter notebook에 직접 연결하는 VS Code Workbench 확장 프로그램을 추가했습니다. Stripe의 별도 벤치마크에 따르면, 이러한 발전에도 불구하고 AI 에이전트는 자신이 생성한 코드를 검증하는 단계에서 여전히 어려움을 겪고 있습니다.
새로운 제어 기능이 중요한 이유
Claude와 같은 대규모 언어 모델(LLM)을 내부 도구에 통합하기 시작한 기업들은 이제 사용량을 확장하면서 액세스, 비용 및 데이터를 안전하게 유지해야 하는 익숙한 문제에 직면해 있습니다. Claude Apps Gateway는 제어 평면(control plane)을 고객의 AWS 계정 내에 배치하여, IT 팀이 ID, 감사 로그 및 비용을 관리할 수 있는 단일 지점을 제공합니다. 이제 개발자는 데이터를 외부 서비스에 노출하지 않고도 Claude 기반의 Code 또는 Desktop 세션을 실행할 수 있습니다.
Google의 VS Code Workbench는 또 다른 마찰 지점을 해결합니다. 데이터 과학자와 엔지니어들은 종종 로컬 IDE와 클라우드 노트북 사이를 오가며 코드를 복사하고 붙여넣는 작업을 반복하곤 합니다. 새로운 확장 프로그램을 사용하면 개발자는 Google Cloud에서 노트북 커널을 열고, 로컬에서 파일을 편집하며, 변경 사항이 실시간으로 동기화되는 것을 확인할 수 있습니다. 익숙한 VS Code UI에서 원격 실행 및 디버깅이 이루어지므로, 실험 속도를 늦추는 "도구 간 전환(tool-hopping)" 단계가 사라집니다.
논의의 객관성을 유지해 주는 벤치마크
Stripe의 최근 AI 에이전트 벤치마크는 현재의 에이전트들이 소프트웨어 통합을 얼마나 잘 처리하는지 테스트했습니다. 에이전트들은 통합 코드는 잘 작성하지만, 검증 단계에서는 예외 케이스(edge cases)와 오류 체크를 놓치는 등 어려움을 겪었습니다. 결과는 명확했습니다. 에이전트들은 생성 단계에서는 강력한 성능을 보였으나, 검증 단계에서는 한계를 드러냈습니다.
승자와 패자
- 기업은 Claude 배포에 대해 더 강력한 거버넌스를 확보하여 노출 위험을 줄일 수 있습니다.
- Google Cloud 개발자는 도구를 전환할 필요 없이 단일 에디터에서 클라우드 머신의 강력한 컴퓨팅 성능을 활용하며 작업할 수 있습니다.
반면, Stripe의 벤치마크가 보여주듯 내부 정책을 업데이트하지 않은 채 이러한 도구를 도입하는 조직은 여전히 검증 단계의 공백에 직면할 수 있습니다. 이러한 도구들은 접근성을 간소화하지만, 인간의 감독 필요성을 없애지는 않습니다.
향후 주목해야 할 점
AI를 실험 중인 팀이 얻을 수 있는 즉각적인 교훈은 간단합니다. 새로운 제어 기능을 사용하여 보안을 강화하고 워크플로우를 효율화하되, 검증을 위해 반드시 사람이 개입(human in the loop)하도록 해야 합니다. 에이전트가 자신의 실수를 안정적으로 잡아낼 수 있을 때까지, 검토자로서의 개발자의 역할은 여전히 필수적입니다.
