최신 비용 분석에 따르면, 대규모 언어 모델(LLM)을 직접 호스팅하는 것이 상업용 API보다 경제적인 시점은 기업이 매달 약 500만 개에서 1,000만 개의 입력 토큰을 처리할 때부터입니다. AI 서비스 예산을 세우는 사람들에게는 이 손익분기점이 "무료" 오픈 웨이트(open weights)의 유혹이 실제 비용 절감으로 이어질지 여부를 결정하는 기준이 됩니다.
API 모델
API 제공업체는 토큰당 요금을 부과하며 모든 하드웨어, 전력 및 냉각 문제를 처리합니다. 현재 공개된 요율은 다음과 같습니다:
- Claude Sonnet 5 – 입력 토큰 100만 개당 $2
- GPT-5.6 – 입력 토큰 100만 개당 약 $1
- Meta Muse Spark – 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $4.25
이 모델은 사용한 만큼 지불하는(pay-as-you-go) 방식입니다. 트래픽이 0으로 떨어지면 비용도 0이 됩니다. 또한 사용자는 GPU 장애, 펌웨어 업데이트, 용량 계획과 같은 번거로운 문제로부터 자유롭습니다.
셀프 호스팅 모델
자체 하드웨어에서 오픈 웨이트 모델을 실행한다는 것은 사용량과 관계없이 컴퓨팅 비용을 직접 부담해야 함을 의미합니다. LLM 추론을 위한 일반적인 선택인 NVIDIA H100 한 대의 비용은 다음과 같습니다:
- 일반 GPU 클라우드 서비스 이용 시 시간당 $2 – $3
- 주요 클라우드 플랫폼(AWS, Azure) 이용 시 시간당 $7 – $12
이는 H100 한 대를 지속적으로 운영할 경우 한 달에 약 $1,800 – $2,000가 소요됨을 의미합니다. 하드웨어 가격은 청구되는 비용 중 눈에 보이는 부분일 뿐입니다.
수치가 만나는 지점
분석 결과, 월간 입력 토큰량이 500만~1,000만 개 범위에 도달하면 셀프 호스팅이 프리미엄 API보다 저렴해지는 것으로 나타났습니다. 이 임계값 미만에서는 토큰당 API 요율이 더 유리합니다. 월간 토큰량이 1억 개 이상이 되면 하드웨어 전용 비용 곡선이 API 비용 곡선 아래로 내려가며, 서류상으로는 셀프 호스팅이 매우 매력적으로 보입니다.
숨겨진 운영 비용
GPU 대여료는 실제 운영 환경에서 모델을 실행하는 데 드는 총비용의 약 30%에 불과합니다. 나머지 비용은 다음과 같은 항목에서 발생합니다:
- 네트워킹 및 스토리지 – 높은 처리량의 연결과 빠른 디스크를 통해 지연 시간을 낮게 유지해야 합니다.
- 중복성 및 모니터링 – 다중 인스턴스 구성, 상태 확인(health checks), 알림 파이프라인 구축에 소프트웨어 및 하드웨어 비용이 추가됩니다.
- 엔지니어링 인력 – 모델을 안정적으로 온라인 상태로 유지하려면 통상 1.5~2명의 전담 엔지니어가 필요합니다. 시장 임금을 적용하면 연간 비용이 $270,000 – $550,000 추가됩니다.
이러한 요소들이 추가되면 하드웨어만으로 얻을 수 있는 겉보기 절감 효과는 빠르게 사라집니다.
셀프 호스팅을 고려해야 하는 대상
셀프 호스팅은 다음과 같은 특정 조건 하에서만 의미가 있습니다:
- 지속적인 대규모 볼륨 – 조직이 정기적으로 500만 토큰 임계값을 초과해야 합니다. 그렇지 않으면 토큰당 API 가격이 더 저렴하게 유지됩니다.
- 규제 또는 데이터 프라이버시 제약 – 일부 분야에서는 독점 데이터나 개인 데이터를 제3자 엔드포인트로 전송하는 것을 금지합니다.
- 특화된 커스텀 또는 지연 시간 보장 – 내부 데이터로 모델을 미세 조정(fine-tuning)해야 하거나 1초 미만의 응답 속도를 보장해야 하는 경우, 자체 스택을 소유하는 것이 정당화될 수 있습니다.
이러한 압박 요인이 없다면, 숨겨진 인력 및 인프라 비용이 하드웨어 절감액을 상회하는 경우가 많습니다.
하이브리드 전략
셀프 호스팅이 실행 가능한 규모에 도달한 대부분의 팀은 여전히 혼합된 접근 방식을 유지합니다:
- API로 시작하기 – API는 저렴하고 통합이 빠르며, 실험이나 낮은 처리량의 워크로드에 완벽합니다.
- 대규모 스트림 마이그레이션 – 토큰 수가 지속적으로 손익분기점을 넘어서면, 해당 파이프라인을 사내 클러스터로 전환합니다.
- 안전망 유지 – 온프레미스(on-prem) 리소스의 과잉 할당을 피하기 위해 간헐적이거나 급증하는 요청은 API를 계속 사용합니다.
정기적으로 토큰 수치를 계산하되, 단순 하드웨어 가격에는 포함되지 않는 운영 오버헤드까지 고려하십시오. 이러한 전체적인 그림을 바탕으로 내린 결정은 근거 없는 믿음에 휘둘릴 가능성이 훨씬 낮습니다.
요약
AI 제품이 매달 수백만 개 미만의 토큰을 처리한다면, 가장 간단하고 저렴한 방법은 여전히 API를 호출하는 것입니다. 지속적이고 대규모인 수요, 엄격한 규정 준수, 또는 맞춤형 지연 시간 요구 사항이 발생하는 경우에만 셀프 호스팅이 재정적으로 타당해집니다. 설령 그렇다 하더라도, 클라우드보다 낫다고 선언하기 전에 인력과 인프라의 숨겨진 비용을 반드시 고려해야 합니다.
