한 1인 연구자가 자신의 LLM 기반 연구 에이전트가 한 달 동안 소비한 모든 토큰을 기록한 결과, 비용을 31% 절감할 수 있었습니다. 지출은 945달러에서 651달러로 줄어든 반면, 성공률은 91%에서 93%로 소폭 상승했습니다. 이는 비용에 민감한 AI 워크플로우를 운영하는 사람이라면 누구나 주목할 만한 결과입니다.
토큰 단위 데이터가 중요했던 이유
대부분의 LLM 사용자는 각 하위 작업의 비용을 숨기고 있는 일괄 금액인 최종 청구서만 확인합니다. 이 연구자의 에이전트는 SEC 공시 검색, 보고서 초안 작성, 연구 종합 내용 결합이라는 세 가지 핵심 작업을 수행했습니다. 세부적인 데이터 없이는 6월에 지불한 312달러가 적절하게 사용되었는지 알 수 없었습니다.
숨겨진 비용 누수를 파악하기 위해 그는 모델명, 토큰 수, 작업 유형, 호출당 비용을 캡처하는 PostgreSQL 로깅 레이어를 추가했습니다. 30일 후, 데이터는 명확한 그림을 보여주었습니다:
- SEC 공시 검색 – 전체 지출의 41%
- 보고서 초안 작성 – 28%
- 연구 종합 – 17%
- 품질 검사 – 9%
- 기타 – 5%
수치를 통해 가장 비용이 많이 드는 단계는 모델 자체가 아니라, 에이전트가 가공되지 않은 검색 결과를 프롬프트에 입력하는 방식이라는 점이 드러났습니다.
비용 절감을 이끈 세 가지 조정 사항
1. 프롬프트 입력 전 요약하기
원래 에이전트는 각 프롬프트에 20개의 가공되지 않은 검색 결과를 쏟아부어 입력 토큰 수를 크게 늘렸습니다. 그는 먼저 저렴한 요약 모델을 삽입하여 입력을 대폭 줄였습니다. 그 결과 검색 작업당 비용이 0.84달러에서 0.19달러로 77% 감소했습니다.
2. 단순 검사는 더 저렴한 모델로 라우팅하기
품질 검사는 호출당 0.09달러가 드는 고성능 모델에서 실행되었습니다. 그는 대부분의 통과/실패(pass/fail) 검사에 더 저렴한 모델을 도입하여 검사당 비용을 0.01달러로 낮췄습니다. 저렴한 모델은 89%의 정확도로 정답을 맞혔으며, 오류가 발생할 경우 원래 모델로 에스컬레이션하여 정확도를 유지하면서도 비용을 87% 절감했습니다.
3. 신뢰도가 높을 때는 검사 건너뛰기
그는 작업의 과거 성공률이 높고 출력 길이가 예상 범위 내에 있는 경우 품질 검사 단계를 건너뛰는 규칙을 추가했습니다. 이를 통해 어차피 실행되었을 검사의 약 60%를 제거했습니다.
성과
세 가지 변경 사항을 적용한 후, 월간 내역은 다음과 같았습니다:
- 전체 지출: $945 → $651 (31% 절감)
- 작업당 SEC 검색 비용: $0.84 → $0.19 (77% 절감)
- 작업당 품질 검사 비용: $0.09 → $0.01 (87% 절감)
- 전체 성공률: 91% → 93%
성공률이 높아진 것은 프롬프트가 짧아지면서 노이즈가 줄어들고 모델이 핵심 질문에 더 집중할 수 있었음을 시사합니다.
주의 사항 및 반론
이 접근 방식은 두 가지 가정을 전제로 합니다. 첫째, 저렴한 요약 모델이 후속 추론에 필요한 충분한 정보를 유지해야 합니다. 만약 중요한 세부 정보를 누락한다면 출력 품질이 저하될 수 있습니다. 둘째, 품질 검사에 사용되는 저비용 모델은 완벽하지 않습니다. 89%의 정확도는 오류의 일부가 최종 결과물에 도달할 수 있음을 의미하지만, 에스컬레이션 경로를 통해 대부분의 오류를 잡아냅니다. 규정 준수(compliance) 요구 사항이 엄격한 사용자는 더 좁은 임계값이나 추가 검증 단계가 필요할 수 있습니다.
LLM 실무자들에게 주는 시사점
- 세분화된 대시보드가 승리합니다. 상위 수준의 지출 보고서는 토큰 낭비를 숨깁니다. 작업별 사용량을 기록하면 그렇지 않으면 발견하지 못했을 비효율성을 찾아낼 수 있습니다.
- 프론티어 모델이 항상 필요한 것은 아닙니다. 저렴한 모델도 전체 품질을 저해하지 않으면서 데이터를 압축하거나 간단한 이진 결정을 내릴 수 있습니다.
LLM 에이전트의 숨겨진 비용은 종종 측정되지 않은 작업에서 발생합니다. 토큰 흐름을 계측하고 타겟팅된 최적화를 적용함으로써, 이 연구자는 월 945달러의 청구서를 성능을 높이면서도 더 효율적인 651달러 규모의 운영으로 전환했습니다. AI 워크로드 예산을 짜는 모든 이들에게 교훈은 명확합니다. 모든 토큰을 측정하고, 데이터가 어디를 절감해야 할지 결정하게 하십시오.
