Vercel의 6월 토큰 점유율 보고서에 따르면, 게이트웨이 토큰 중 오픈 웨이트(open-weight) 모델이 처리하는 비중이 4월 11%에서 29%로 증가했으며, 이 중 DeepSeek 혼자서 22.6%의 물량을 차지했습니다. 이러한 급증은 개발자들이 단일한 "최고" 모델에서 벗어나 AI 모델을 라우팅 가능한 인프라로 취급하기 시작했다는 급격한 변화를 시사합니다.
개발자들이 모델을 인프라로 취급하는 이유
저렴한 오픈 웨이트 모델(대부분 중국 제공업체 제품)은 Anthropic과 같은 프리미엄 서비스에 비해 비용이 매우 저렴합니다. 코드 추출, 텍스트 정제 또는 간단한 데이터 조회와 같은 일상적인 작업의 경우, 정확도가 몇 퍼센트 낮더라도 달러 단위가 아닌 센트 단위의 비용이 드는 모델이 더 매력적일 수 있습니다.
그 결과 새로운 설계 패턴이 등장했습니다. 애플리케이션은 먼저 작업의 "지루한" 부분을 처리하기 위해 저비용 모델에 요청을 보냅니다. 출력 결과가 간단한 품질 검사를 통과하면 파이프라인이 계속 진행되지만, 통과하지 못하면 두 번째 검토나 최종 결정을 위해 더 높은 가격의 모델을 호출합니다. 이제 중요한 것은 단일 모델의 선택이 아니라 라우팅 로직이 됩니다.
수치가 말해주는 것
여러 AI 제공업체를 연결하는 게이트웨이에서 추출한 Vercel의 데이터에 따르면, 오픈 웨이트 모델은 주변부에서 주류로 이동하고 있습니다. 4월에는 전체 토큰의 1/10을 약간 넘는 수준이었으나, 6월에는 1/3에 육박했습니다. 중국 모델인 DeepSeek은 토큰 물량의 5분의 1 이상을 혼자서 차지했습니다.
지출 측면에서는 여전히 하이엔드 모델이 지배적입니다. 예를 들어, Anthropic은 토큰당 가격이 더 높기 때문에 여전히 대부분의 비용 지출을 차지하고 있습니다. 계산은 간단합니다. 저렴한 모델은 물량이 많고 마진이 낮은 작업을 맡고, 비싼 모델은 마진이 높고 영향력이 큰 작업을 유지합니다.
AI 에이전트에 미치는 영향
AI 에이전트는 일반적으로 계획, 데이터 검색, 도구 호출, 결과 정제와 같은 일련의 단계를 수행합니다. 각 단계를 가장 비용 효율적인 모델에 할당할 수 있으면 전체 운영 비용이 획기적으로 낮아집니다.
- 데이터 검색 및 추출은 종종 기본적인 언어 이해 능력만 필요하며, 이는 저렴한 모델이 매우 잘 수행하는 작업입니다.
- 최종 판단—답변이 수용 가능한지 결정하는 부분—은 신뢰도가 높은 프리미엄 모델의 영역으로 남습니다.
이러한 계층적 접근 방식은 개발자가 예산을 초과하지 않으면서 더 큰 워크로드를 자동화할 수 있게 해줍니다. 또한 "최고의 모델을 선택하는 것"에서 "단계별 성공을 측정하고 그에 따라 라우팅하는 것"으로의 전환을 강제합니다.
리스크 및 한계
경제성은 매력적이지만, 전환 과정이 순탄하기만 한 것은 아닙니다.
- 컴플라이언스(Compliance): 일부 관할 구역은 외국에 호스팅된 모델의 사용을 제한할 수 있는 엄격한 데이터 처리 규칙을 적용합니다.
- 호스팅 복잡성: 대규모 프리미엄 모델은 자체적으로 실행하기 어렵기 때문에 조직은 외부 API에 의존해야 하며, 이는 지연 시간(latency) 및 벤더 종속(vendor-lock) 문제를 일으킬 수 있습니다.
이러한 요인들 때문에 저렴한 모델이 프리미엄 모델을 완전히 대체할 가능성은 낮습니다. 대신, 저렴한 모델은 일상적인 작업의 기본값이 되고, 프리미엄 모델은 높은 비용이 정당화되는 "결정 계층(decision layer)"에 머물게 될 것입니다.
향후 주목해야 할 점
- 라우팅을 위한 툴링: 라우팅 계층이 더욱 핵심적인 역할을 하게 됨에 따라, 지연 시간, 비용 및 신뢰도 임계값을 기준으로 모델 선택을 자동화하는 SDK와 플랫폼의 물결이 나타날 것으로 예상됩니다.
작업 수준의 성공을 측정하고, 재시도(retry)를 추적하며, "물량(volume)"과 "판단(judgment)"을 명확히 분리하기 시작하는 개발자들이 새롭게 등장하는 인프라 사고방식으로부터 이익을 얻기에 가장 유리한 위치를 점하게 될 것입니다.
핵심 요약: AI 스택은 단일 모델 선택에서 라우팅 문제로 변모하고 있습니다. 저렴한 오픈 웨이트 모델이 대부분의 작업을 처리하고, 프리미엄 모델은 영향력이 큰 결정에만 사용되는 구조입니다. 이러한 라우팅을 마스터하는 것이 AI 빌더들에게 차세대 경쟁 우위가 될 것입니다.
