Whisper vs API: "무료" 모델이 가장 비싼 비용 항목이 되는 순간
팀원들이 AssemblyAI 청구서를 봅니다. 누군가 묻습니다. "비용을 아끼려면 그냥 Whisper를 직접 호스팅하면 안 되나요?"
간단해 보입니다. 체크포인트를 다운로드하고, 명령어를 실행하면 됩니다. 오후 한나절이면 끝날 일이죠.
하지만 진짜 질문은 이것입니다. 향후 2년 동안 해당 엔드포인트를 운영하는 데 드는 비용은 얼마일까요?
API 비용이 저렴해 보이는 이유
관리형 전사(transcription) 서비스는 처리된 오디오의 초 단위로 비용을 청구합니다. 예를 들어, AssemblyAI는 비동기 파이프라인을 통과하는 콘텐츠 1시간당 약 0.15~0.21달러를 청구합니다. 이 수치 뒤에는 수많은 작업이 숨겨져 있습니다. 서비스 제공업체는 추론 하드웨어를 유지 관리하고, 노이즈가 있는 오디오를 정제하며, 화자를 분리하고, 엔티티(신용카드 번호, 이메일, 인증 코드 등)를 포맷팅하고, 결과를 실시간으로 스트리밍하며, 24시간 내내 서비스를 모니터링합니다. 여러분이 받는 청구서는 이 모든 작업이 합쳐져 단순한 초당 요율로 묶인 결과물입니다.
GPU 가격의 실질적인 의미
Whisper Large-v3는 단일 A100 또는 H100 GPU에서 실행할 수 있습니다. 클라우드 제공업체는 이러한 카드를 온디맨드(on-demand) 방식으로 시간당 24달러에 제공합니다. 문제는 칩이 유휴 상태(idle)일 때도 시간당 전체 비용을 지불해야 한다는 점입니다. 워크로드가 GPU 용량의 15%만 사용하더라도, 여전히 24달러의 전체 비용이 발생합니다.
떠안게 되는 엔지니어링 부채
자체 호스팅은 모델 체크포인트를 실행하는 것으로 끝나지 않습니다. 숨겨진 작업량은 곧 표면적인 하드웨어 비용을 훨씬 상회하게 됩니다.
- 화자 분리(Speaker diarization) – 오픈 소스 Whisper는 목소리를 분리하지 못합니다. 신뢰할 수 있는 화자 분리 파이프라인을 구축하려면 별도의 모델, 데이터 및 지속적인 튜닝이 필요합니다.
- 스트리밍 지원 – Whisper는 전체 파일을 비동기 방식으로 처리합니다. 실시간 자막이나 음성 에이전트 응답을 구현하려면 백프레셔(back-pressure) 처리와 지연 시간(latency) 모니터링 기능이 포함된 커스텀 스트리밍 레이어가 필요합니다.
- 엔티티 포맷팅 – 원본 전사 데이터에는 민감한 문자열을 마스킹하거나 재포맷팅하는 로직이 없습니다. 신용카드 번호, 이메일 주소 또는 OTP 코드에 대한 규칙을 추가하는 것은 결코 간단한 엔지니어링 작업이 아니며, 단 하나의 오타만으로도 전사 데이터를 사용할 수 없게 만들 수 있습니다.
- 신뢰성 엔지니어링 – GPU 한 대에서 돌아가는 데모를 만드는 것은 쉽지만, 프로덕션 서비스는 동시성, 재시도, 무중단 업그레이드 및 알림(alerting) 등을 모두 관리해야 합니다.
자체 호스팅이 실제로 이득이 되는 경우
수지타산이 바뀌는 경우는 다음과 같은 몇 가지 제한적인 시나리오뿐입니다.
- 대규모의 지속적인 배치 처리 – GPU 사용률을 수개월 동안 거의 100%에 가깝게 유지할 수 있을 만큼 충분한 오디오 데이터가 있다면, 시간당 하드웨어 비용을 방대한 전사량에 분산시켜 오디오당 비용을 API 요율보다 낮출 수 있습니다.
- 엄격한 데이터 프라이버시 규정 – 오디오 데이터의 외부 유출을 금지하는 규정으로 인해 비용에 상관없이 반드시 내부에서 처리를 수행해야 하는 경우입니다.
- 프로토타이핑을 위한 완전한 모델 제어 – Whisper의 아키텍처나 프롬프트를 수정하거나 독자적인 데이터로 미세 조정(fine-tuning)이 필요한 초기 단계의 실험에서는 체크포인트를 직접 소유하는 것이 유리합니다.
이 범주를 벗어나면, 숨겨진 엔지니어링 부채와 활용되지 못하는 GPU 시간이 API의 저렴한 초당 요율을 순식간에 추월하기 때문에 "무료" 모델이 가장 비싼 비용 항목이 됩니다.
요약: Whisper의 라이선스 비용 0원은 매력적이지만, 총 소유 비용(TCO)에는 GPU 가격, 유휴 시간, 그리고 대부분의 팀이 이미 전사 API에 외주를 주고 있는 일련의 엔지니어링 작업들이 포함됩니다. 하드웨어를 완전히 활용할 수 있거나, 데이터를 온프레미스(on-prem)로 유지해야 하거나, 심도 있는 모델 제어가 필요한 경우에만 자체 호스팅이 더 저렴한 선택지가 됩니다. 그렇지 않다면, "무료" 모델은 전사 예산에서 가장 큰 비중을 차지하는 항목이 될 가능성이 높습니다.
