Claude Opus 5는 동일한 작업량에 대해 Opus 4.8보다 3배 더 많은 비용이 듭니다. 두 모델의 토큰당 가격은 동일하게 표시되어 있음에도 불구하고 말이죠. 원인은 기본 설정된 “adaptive thinking” 기능으로, 이 기능이 숨겨진 추론 과정으로서 출력 토큰을 조용히 소비하기 때문입니다. 이 기능을 끄면 정확도를 해치지 않으면서 비용을 동일한 수준으로 되돌릴 수 있습니다.

Why the price gap appears

두 버전 모두 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25를 청구합니다. 벤치마크 결과, 동일한 프롬프트를 실행했을 때 Opus 5의 비용은 Opus 4.8보다 3.1배 높았습니다. 추가 비용은 더 높은 표시 가격 때문이 아니라, Opus 5가 내부 추론 과정을 처리하는 방식에 포함되어 있습니다.

What adaptive thinking does

adaptive thinking이 활성화되면 모델은 최종 답변을 내놓기 전에 추가적인 내부 추론을 수행합니다. 이 추론 과정은 사용자에게 전달되지 않더라도 출력 토큰으로 계산됩니다. 단순한 질의의 경우, 청구되는 출력 토큰의 42%에서 95%가 이 숨겨진 추론 토큰입니다. 따라서 한 자리 숫자의 답변만 내놓으면 되는 간단한 산술 문제도 수십 개의 보이지 않는 토큰을 생성하여 비용을 급격히 상승시킬 수 있습니다.

이 기능은 버그가 아닙니다. Claude의 설계자들은 복잡한 작업에서 답변의 품질을 높이기 위해 이 기능을 의도했습니다. 실제로 숨겨진 추론은 어려운 프롬프트, 특히 모델이 여러 단계를 연결하거나 외부 도구와 상호작용해야 하는 경우에 약간의 정확도 향상을 가져오는 경우가 많습니다.

How to control costs

모델은 adaptive thinking을 비활성화하는 단일 파라미터를 지원합니다:

{
  "thinking": {"type": "disabled"}
}

이 설정을 Opus 5에 적용하면, 테스트한 단순 작업에서 결과의 정확도는 유지하면서 작업당 비용을 Opus 4.8과 정확히 동일한 수준으로 낮출 수 있습니다.

When to disable

  • 텍스트에서 데이터 추출
  • 포맷팅 작업 (예: JSON 변환)
  • 답변이 직접적인 조회나 단순 계산인 단일 단계 호출

이러한 경우에 추론 기능을 비활성화하면 숨겨진 토큰 세금을 없애고 비용을 예측 가능하게 유지할 수 있습니다.

When to keep it on

  • 깊은 논리적 연쇄나 미묘한 추론이 필요한 작업
  • 외부 도구를 반복적으로 호출하는 에이전트 워크플로우

도구 사용 비중이 높은 시나리오에서는 모델이 도구 호출을 반복하는 동안 내부 추론에 쓰는 비용이 줄어들기 때문에 비용 격차가 약 33%로 좁혀집니다.

Other notable differences

  • 컨텍스트 윈도우(Context window): Opus 5는 최대 100만 토큰을 보유할 수 있으며, 이는 969,950번째 토큰에 배치된 대상 문자열을 검색함으로써 확인되었습니다.
  • 캐시 하한선(Cache floor): 최소 캐시 크기가 512 토큰으로 줄어들어 Opus 4.8의 절반 수준이 되었으며, 이는 모델이 재토큰화 없이 이전 대화를 얼마나 재사용할 수 있는지에 영향을 미칩니다.

What to watch next

개발자는 “reasoning tokens” 또는 adaptive thinking이 활성화되었음을 나타내는 유사한 항목이 포함된 사용 보고서를 모니터링해야 합니다. 더 많은 애플리케이션이 에이전트 방식의 운영을 위해 Claude를 채택함에 따라, 비용과 품질 사이의 절충안이 핵심적인 최적화 결정 요소가 될 것입니다. 향후 업데이트에서는 사용자가 단순히 켜고 끄는 것이 아니라 추론의 깊이를 조절할 수 있게 하여 비용 곡선을 완만하게 만들 수도 있습니다.

요약: Opus 5의 기본 adaptive thinking은 쉬운 작업에서 토큰 사용량을 늘립니다. 위에서 설명한 간단한 설정을 통해 이를 비활성화하여 Opus 4.8과 비용을 맞추고, 추가적인 추론이 추가 비용을 정당화할 때만 활성화하십시오.