SGLang의 RadixAttention은 듀얼 RTX 3090 환경에서 웜업 첫 토큰 생성 시간(TTFT)을 68ms로 대폭 단축한 반면, vLLM의 PagedAttention은 184ms에 머물렀습니다. 이 **82.9%**의 지연 시간 격차는 멀티턴 에이전트 상호작용을 눈에 띄게 더 매끄럽게 만듭니다.
두 프로젝트 모두 대규모 언어 모델(LLM) 추론 속도를 높이려 노력하지만, 이번 벤치마크는 자율형 어시스턴트를 구동하는 워크로드, 즉 긴 시스템 프롬프트, 도구 호출(tool-calling) 스키마, 그리고 사용자-어시스턴트 간의 연속적인 대화 기록을 대상으로 합니다. 이러한 반복되는 토큰들은 GPU 메모리에 저장됩니다. 만약 캐시가 효율적으로 관리되지 않으면, 이는 대화를 지연시키는 연산 병목 현상이 됩니다.
승패를 가른 워크로드
전통적인 LLM 서버는 사용자 프롬프트, 모델 답변, 종료로 이어지는 단일 교환에 최적화되어 있습니다. 하지만 현대적인 에이전트는 수십 번의 턴에 걸쳐 지속되는 "대화 상태(conversation state)"를 유지하며, 각 턴마다 수백 개의 토큰이 캐시에 추가됩니다. 테스트 스위트는 두 개의 RTX 3090 카드에서 이러한 멀티턴 루프를 재현하며 다음 항목들을 측정했습니다:
- 웜업 첫 토큰 생성 시간(TTFT) – 새로운 턴이 시작된 후 첫 번째 토큰이 나타나기까지의 지연 시간.
- 전체 지연 시간(Overall latency) – 전체 루프 동안 토큰당 평균 시간.
- 지속 처리량(Sustained throughput) – 루프가 연속적으로 실행될 때 초당 처리되는 토큰 수.
- 캐시 적중률(Cache-hit ratio) – 재계산하는 대신 키-값(KV) 캐시에서 재사용되는 토큰의 비율.
SGLang은 모든 지표에서 vLLM을 압도했습니다. TTFT는 68ms 대 184ms로 **82.9%**의 지연 시간을 단축했으며, 처리량은 39.8% 더 높았고, 캐시 적중률은 vLLM의 84.2% 대비 **96.8%**를 기록했습니다.
PagedAttention vs RadixAttention
두 엔진 모두 중간 KV 쌍을 GPU 메모리에 저장하지만, 메모리를 구성하는 방식은 다릅니다.
- **PagedAttention (vLLM)**은 캐시를 고정된 크기의 블록으로 나눕니다. 프롬프트가 블록 중간에서 끝나면, 블록을 부분적으로 재사용할 수 없기 때문에 매 턴마다 남은 토큰들을 다시 계산해야 합니다. 이 방식은 단순하며 프롬프트가 블록 경계와 일치할 때는 잘 작동하지만, 에이전트 루프에서 가장 자주 바뀌는 "가장자리(edge)" 토큰들에 대해 연산 자원을 낭비하게 됩니다.
- **RadixAttention (SGLang)**은 캐시를 트리 구조로 취급합니다. 블록 제한에 구애받지 않고 현재 프롬프트와 이미 캐싱된 내용 사이의 가장 긴 공통 접두사(longest common prefix)를 찾아내며, 사용되지 않는 리프(leaf) 노드는 제거합니다. 이를 통해 거대한 시스템 프롬프트를 GPU 메모리에 고정해 둔 상태에서 최신 턴만 처리할 수 있어, 캐시 적중률을 높이고 불필요한 작업을 줄여줍니다.
각 엔진이 빛을 발하는 경우
| 시나리오 | 권장 엔진 |
|---|---|
| 멀티턴 자율 에이전트, 빈번한 도구 호출, Tree-of-Thought 추론 | SGLang (RadixAttention) |
| 폭넓은 하드웨어 지원 (AMD 및 Gaudi 가속기 포함), 투기적 디코딩(speculative decoding), 시각-언어 모델(VLM) | vLLM (PagedAttention) |
이러한 차이는 성능뿐만 아니라 생태계와도 관련이 있습니다. vLLM의 폭넓은 하드웨어 호환성은 이기종 컴퓨팅 클러스터를 보유한 조직에 더 안전한 기본 선택지가 됩니다. 또한 여러 토큰 후보를 병렬로 생성하는 투기적 디코딩 기능은 단일 턴 생성 속도를 높일 수 있는데, 이는 RadixAttention의 트리 기반 캐싱이 상대적으로 큰 이점을 제공하지 못하는 영역입니다.
요약
긴 프롬프트와 점진적인 업데이트를 처리해야 하는 멀티턴 에이전트를 구축하는 개발자라면, SGLang의 RadixAttention이 소비자용 GPU에서 훨씬 더 빠르고 캐시 효율적인 경험을 제공할 것입니다. 반면, 폭넓은 하드웨어 지원이 필요하거나 단일 턴 생성에 특화된 팀은 여전히 vLLM을 선호할 수 있습니다. 결국 선택의 기준은 워크로드가 "에이전트 중심(agent-heavy)"인지, 아니면 "하드웨어 다양성(hardware-diverse)" 중심인지에 달려 있습니다.
