이번 달 AI 서비스 비용이 $31,000로 급증했습니다. 이는 예산의 3배가 넘는 금액으로, 단 한 줄의 코드 때문에 전체 트래픽의 약 **80%**가 가장 비싼 모델인 GPT-4o로 전송되었기 때문입니다.

비용이 폭발한 이유

우리는 빠른 응답, 중단 없는 서비스, 원활한 확장성을 위해 신뢰성 중심의 시스템을 구축했습니다. 하지만 이러한 선택은 토큰 사용량 측면에서 전형적인 “메모리 누수(memory leak)” 현상을 초래했습니다. 대부분의 상호작용에 과도하게 높은 사양의 모델이 계속 사용되면서 토큰이 낭비된 것입니다.

엔지니어링의 전환: 아키텍처 관점에서의 비용 관리

AI 지출을 단순한 재무 문제로만 취급하면 진짜 핵심인 '각 요청에 어떤 모델을 실행할지 결정하는 코드'를 놓치게 됩니다. 모델 선택 과정을 라우팅 계층(routing layer)으로 옮기면서, 숨겨진 비용을 통제 가능한 변수로 전환할 수 있었습니다.

1. 작업에 맞는 모델 매칭

원칙은 간단합니다. 품질 요구 사항을 충족하는 가장 작은 모델을 사용하라는 것입니다. 우리는 네 가지 일반적인 요청 유형을 더 저렴한 대안 모델로 매핑했습니다.

  • 단순 채팅 → DeepSeek V4 Flash (97.5% 절감)
  • 분류 → Qwen3-8B (98.3% 절감)
  • 코드 생성 → DeepSeek Coder (97.5% 절감)
  • 요약 → Qwen3-32B (97.2% 절감)

이 백분율은 선택한 모델과 GPT-4o 사이의 직접적인 토큰 가격 차이를 나타냅니다. 트레이드오프(trade-off)는 최상위 수준의 추론이 필요하지 않은 작업에서 성능이 약간 저하될 수 있다는 점입니다.

2. CDN과 같은 계층형 라우팅

우리는 모든 요청을 먼저 저렴한 모델로 보내는 2단계 라우터를 구축했습니다. 만약 응답이 빠른 품질 검사(신뢰도가 임계값 미만이거나 필수 엔티티가 누락된 경우 등)를 통과하지 못하면, 자동으로 상위 계층 모델로 재라우팅합니다. 이러한 폴백(fallback) 방식은 프리미엄 모델을 정말 필요할 때만 사용함으로써 사용자 경험을 유지하면서 비용을 절감합니다.

3. 반복되는 프롬프트 캐싱

많은 상호작용에서 동일한 시스템 프롬프트나 FAQ 텍스트를 재사용합니다. 이러한 출력을 캐싱함으로써 동일한 응답을 다시 계산하는 것을 방지할 수 있습니다. 테스트 결과, 인메모리(in-memory) 캐시를 통해 반복 프롬프트 비용을 약 30% 절감했습니다.

4. 전송 전 프롬프트 압축

긴 시스템 프롬프트는 사용자 콘텐츠와 동일한 비율로 토큰을 소비합니다. 우리는 프롬프트에 저렴한 요약 모델을 실행하여, 비싼 모델로 전달하기 전에 필수적인 컨텍스트만 남기고 다듬는 전처리기를 추가했습니다. 이 단계 하나만으로 연간 토큰 비용을 수천 달러 절감했습니다.

실제 적용 사례

이전에는 월 $420이 들던 챗봇 하나가, 쿼리의 **85%**를 저렴한 모델로 라우팅하고 캐싱을 적용한 결과 비용이 $28로 줄었습니다. 가벼운 모델이 더 빠르게 응답했기 때문에 지연 시간(latency)도 개선되었으며, 폴백 경로가 실행되는 경우도 거의 없었습니다.

시사점

AI 지출을 최우선적인 아키텍처 결정 사항으로 다루십시오. 요청을 적절한 모델로 라우팅하고, 품질 기반의 폴백을 추가하며, 반복되는 프롬프트를 캐싱하고, 입력을 압축하십시오. 이렇게 하면 신뢰성을 유지하면서도 비용을 획기적으로 줄일 수 있습니다.