LLM 가격 책정은 유동적입니다. 어떤 달에는 추론 예산이 예측한 대로 정확히 맞아떨어지지만, 다음 달에는 제공업체가 토큰당 요금을 조정하여 추가 요청이 없어도 월간 지출액이 변할 수 있습니다. 바로 그런 일이 최근에 일어났습니다. GMICloud, Novita, StreamLake 모두 모델 가격을 업데이트했으며, 프로덕션 워크로드나 실험적 파이프라인을 운영 중이라면 이러한 개정 사항을 면밀히 살펴봐야 합니다. 시장이 붕괴하고 있기 때문이 아니라, 하루에 수백만 개의 토큰을 처리할 때 토큰 경제학의 미세한 차이가 무섭게 누적되기 때문입니다.
이 제공업체들은 누구인가
GMICloud, Novita, StreamLake는 각각 AI 인프라 스택에서 고유한 역할을 수행하지만, 이제 대규모 언어 모델(LLM) 운영 비용 측면에서 직접적으로 겹치는 영역이 생겼습니다.
GMICloud는 고성능 GPU 클라우드를 운영하며, 자체 클러스터를 관리하지 않고 API에 액세스하려는 개발자를 위해 점점 더 많은 호스팅 LLM 카탈로그를 제공합니다. Novita는 저렴한 GPU 대여와 모델 서빙을 중심으로 명성을 쌓았으며, 대형 하이퍼스케일러들이 부과하는 프리미엄 가격보다 할인된 가격으로 오픈 웨이트 모델을 선호하는 엔지니어들을 끌어모으고 있습니다. ByteDance의 클라우드 및 미디어 생태계에서 성장한 StreamLake는 비디오 인프라 전문성을 추론 경쟁에 도입했으며, 대규모 미디어 처리 워크로드도 처리할 수 있는 플랫폼을 통해 모델을 제공합니다.
이들은 OpenAI나 Anthropic처럼 누구나 아는 이름은 아닙니다. 바로 그렇기 때문에 이들의 가격 변동이 중요합니다. 이들은 마진이 적고, 할인이 흔하며, 개발자를 유치하기 위한 경쟁이 치열한 시장의 공격적인 미들 티어(middle tier)에 위치해 있습니다. 이 티어의 세 플랫폼이 거의 동시에 요금표를 변경하면, 오픈 소스 또는 미세 조정(fine-tuned)된 모델을 운영하는 데 드는 비용의 기준점이 집단적으로 재설정됩니다.
무엇이 바뀌었나
이번 업데이트는 세 서비스 모두의 LLM 사용 요금에 영향을 미쳤습니다. Dev.to에서 narevbot이라는 이름으로 활동하는 Naren은 GMICloud, Novita, StreamLake의 모델별 세부 조정 사항을 분석한 게시물을 통해 구체적인 내용을 기록했습니다. 전체 비교 내용은 여기서 확인할 수 있습니다.
이 단락을 다 읽기도 전에 다시 바뀔지도 모르는 토큰당 몇 센트 단위의 수치를 나열하기보다는, 중요한 점은 이번 변화가 구조적이라는 것입니다. 각 제공업체는 토큰 요금 부과 방식을 재조정했으며, 어떤 경우에는 이번 개정으로 인해 특정 워크로드에 가장 저렴한 모델이 달라지기도 합니다. 이는 단순히 전체적으로 가격을 올리거나 내리는 방식이 아닙니다. 어떤 제공업체는 출력 가격을 올리는 대신 입력 가격을 낮출 수도 있습니다. 또 다른 업체는 작은 파라미터 모델의 가격은 그대로 두면서 롱 컨텍스트(long-context) 엔드포인트의 요금을 올릴 수도 있습니다. 세 업체 모두 Llama, Qwen, Mistral 및 기타 아키텍처의 다양한 조합을 지원하므로, 어떤 모델을 어떤 API를 통해 라우팅하느냐에 따라 손해를 볼 수도, 이득을 볼 수도 있습니다.
트래픽이 그대로인데 왜 청구 금액이 변하는가
영향을 이해하려면 LLM 과금 방식이 실제로 어떻게 작동하는지 살펴보아야 합니다. 입력 토큰과 출력 토큰에 대해 거의 항상 별도로 요금이 부과되며, 이 둘 사이의 비율이 실질 비용을 결정합니다. 하루에 만 건의 대화를 처리하는 고객 지원 봇의 경우, 채팅당 평균 2,000개의 입력 토큰과 400개의 출력 토큰을 사용한다고 가정해 봅시다. 백만 토큰당 혼합 요금이 3달러라면, 하루 비용은 약 84달러입니다. 만약 제공업체가 출력 가격을 단 20%만 인상하더라도 일일 비용은 90달러를 넘어서게 됩니다. 분기 단위로 계산하면 동일한 트래픽에 대해 거의 1,000달러의 추가 지출이 발생하는 셈입니다.
이를 시간당 수백만 개의 토큰을 처리하는 콘텐츠 생성 파이프라인이나 검색 증강 생성(RAG) 시스템으로 확장하면, 선택한 제공업체는 매우 중요한 비용 항목이 됩니다. GMICloud, Novita, StreamLake는 이 점을 잘 알고 있습니다. 이들의 가격 변경은 대량 배치 작업, 저지연 채팅 애플리케이션 또는 롱 컨텍스트 요약 작업과 같은 특정 사용 사례를 겨냥한 의도적인 포지셔닝 전략입니다.
복잡성 또한 또 다른 변수입니다. 일부 플랫폼은 요청당 최소 요금을 부과하거나, 프로비저닝된 처리량(provisioned throughput)에 대한 유휴 요금, 또는 속도 제한(rate-limit) 급증에 대한 추가 요금을 부과합니다. 최소 요청 요금의 변경은 대량 사용자보다 소량 사용자에게 훨씬 더 큰 타격을 줍니다. 배치 추론 할인의 변화는 실시간 API 요금은 그대로 둔 채 야간 보고서 생성 비용만 낮출 수도 있습니다. "가격 업데이트"라는 헤드라인만 읽어서는 부족합니다. 요금 매트릭스를 읽어야 합니다.
과잉 반응하지 않고 대응하는 방법
요율이 변동될 때, 대부분의 엔지니어링 팀은 두 가지 실수 중 하나를 범합니다. 변화를 무시하고 비용 초과분을 조용히 감수하거나, 아니면 패닉에 빠집니다.
