AWS는 Amazon SageMaker Inference에 “접두사 인식 라우팅(prefix-aware routing)” 옵션을 추가했습니다. 이는 자체 인프라에서 대규모 언어 모델(LLM)을 실행하는 고객에게 더 높은 캐시 히트율과 눈에 띄게 낮은 지연 시간을 제공할 것을 약속합니다. 이 변화는 지연 시간을 현저히 낮추고 GPU 연산 비용을 절감할 수 있다는 점에서 매우 중요합니다.
LLM 지연 시간이 중요한 이유
LLM이 요청을 받으면 일반적으로 프롬프트 전체에 대해 어텐션(attention)을 다시 계산하는데, 이는 토큰이 추가될 때마다 비용이 증가하는 단계입니다. 만약 모델이 이전 요청의 어텐션 캐시를 재사용할 수 있다면, 텍스트의 새로운 부분만 처리하면 됩니다. 동일한 시스템 프롬프트를 반복해서 보내거나 대화 기록을 유지하는 워크로드는 캐시 재사용의 최적의 대상입니다.
기본 SageMaker 설정에서는 들어오는 요청이 추론 인스턴스 풀에 무작위로 분산됩니다. 무작위 분산은 웜 캐시(warm cache)를 활용할 수 있는 요청이 종종 콜드 인스턴스(cold instance)에 할당되어 전체 재계산을 강제하게 된다는 것을 의미합니다. 그 결과 지연 시간이 높아지고 추가적인 GPU 사이클이 소모되어 비용 상승으로 직결됩니다.
접두사 인식 라우팅의 작동 방식
새로운 라우팅 모드는 최근 요청 접두사의 경량 맵을 유지합니다. 여기서 접두사란 호출 간에 일정하게 유지되는 경향이 있는 프롬프트의 첫 부분을 의미합니다. 새로운 요청이 도착하면 SageMaker는 맵을 확인하고 동일한 접두사를 이미 처리한 인스턴스로 요청을 전달합니다. 해당 인스턴스가 관련 어텐션 캐시를 여전히 보유하고 있다면, 모델은 작업의 대부분을 건너뛰고 더 빠르게 답변을 생성할 수 있습니다.
주요 사항:
- 코드 변경 불필요 – 이 기능은 완전히 추론 서비스 계층에서 작동합니다.
- 자체 호스팅 모델에만 적용 – OpenAI API나 Anthropic 서비스와 같은 관리형 서비스에는 영향을 받지 않습니다.
- 애플리케이션에 투명함 – 동일한 SageMaker 엔드포인트 URL과 API 규약이 그대로 유지됩니다.
수혜 대상
SageMaker에서 LLM을 호스팅하는 기업들은 데이터 프라이버시부터 비용 제어에 이르기까지 다양한 이유로 이를 선택합니다. 고객 지원 챗봇, 영업 어시스턴트 또는 고정된 시스템 프롬프트를 반복적으로 사용하는 대화형 에이전트를 운영하는 경우, 이 라우팅 개선을 통해 평균 응답 시간을 단축할 수 있습니다. 비용 측면에서는 각 캐시 히트마다 GPU가 프롬프트의 공유 부분을 다시 평가할 필요가 없어 비용이 절감됩니다.
한계 및 반론
이 이점은 반복되는 접두사의 존재 여부에 달려 있습니다. 일회성 쿼리나 동적으로 생성되는 시스템 메시지와 같이 변동성이 큰 프롬프트는 동일한 캐시 히트 이점을 누릴 수 없습니다.
또한 이 기능은 자체 호스팅 배포로 제한되어 있기 때문에, 관리형 LLM 서비스에 종속된 고객은 이를 활용할 수 없습니다.
요약: 접두사 인식 라우팅은 SageMaker 사용자에게 코드 변경 없이 반복적인 LLM 워크로드의 지연 시간을 줄이면서 GPU 비용을 절감할 수 있는 간단한 방법을 제공합니다. 이미 플랫폼에서 모델을 호스팅하고 있는 조직에게 이 업그레이드는 더 빠른 사용자 상호작용과 비용 절감으로 이어질 수 있는 저위험 개선 사항입니다.
