OpenAI는 2026년 7월 30일, GPT-5.6 API가 이전 모델보다 훨씬 저렴한 가격으로 출시될 것이라고 발표했습니다. 이번 발표에는 Sol, Terra, Luna의 세 가지 계층형 모델과 캐시된 읽기(cached reads)에 대한 대폭적인 할인 혜택이 포함되었습니다.
새로운 가격 정책이 중요한 이유
GPT-5 출시 이후, API 비용은 대화형 에이전트, 검색 증강 생성(RAG) 파이프라인 또는 대규모 데이터 추출 도구를 구축하는 모든 이들에게 주요 비용 항목이었습니다. OpenAI는 Sol, Terra, Luna의 입력 비용을 각각 100만 토큰당 $5, $2, $0.20로 대폭 인하함으로써, 개발자들이 전체 스택을 재설계하지 않고도 필요한 추론 수준을 더 저렴하게 선택할 수 있는 길을 열어주었습니다. 특히 Terra는 기존 플래그십 가격의 40% 수준으로, Luna는 해당 기준의 단 4% 수준으로 낮아져 비용 절감 효과가 가장 큽니다.
세 가지 모델 상세 분석
| 모델 | 입력 가격 (100만 토큰당) | 출력 가격 (100만 토큰당) | 주요 용도 |
|---|---|---|---|
| Sol | $5 | $30 | 심층 추론, 사고의 사슬(chain-of-thought) 작업 |
| Terra | $2 | $12 | 프로덕션 워크로드, 균형 잡힌 성능 |
| Luna | $0.20 | $1.20 | 대량 처리, 단순 추출 또는 분류 |
Sol은 여전히 가장 비싸지만 가장 풍부한 추론 깊이를 제공합니다. Terra는 대부분의 애플리케이션을 위한 기본 모델로 자리 잡았으며, Luna는 비용을 위해 추론 깊이를 희생할 수 있는 "대규모(high-scale)" 옵션입니다.
캐싱을 통한 추가 비용 절감
OpenAI는 읽기 작업에 대해 90% 할인을 제공하는 캐싱 레이어를 도입했습니다. 캐시된 입력 요금은 다음과 같습니다:
- Sol: $0.50 / 100만 토큰
- Terra: $0.20 / 100만 토큰
- Luna: $0.02 / 100만 토큰
캐시에 쓰는(Write) 비용은 해당 입력 요금의 1.25배이며, 캐시 항목은 삭제되기 전 최소 30분 동안 유지되어야 합니다.
컨텍스트 길이에 따른 추가 요금 주의
이제 API 요청의 입력값이 272K 토큰을 초과할 경우 추가 요금이 부과됩니다. 입력 기본 가격은 두 배로 뛰고, 출력 가격은 1.5배 인상됩니다. Sol의 초과 요금은 100만 토큰당 입력 $10, 출력 $45로 책정되어 있어, 비정상적으로 긴 컨텍스트에 대한 페널티를 쉽게 계산할 수 있습니다.
개발자가 감수해야 할 점
이번 가격 인하에는 두 가지 눈에 띄는 제한 사항이 있습니다. 첫째, 영구적인 무료 티어가 없습니다. 즉, 아무리 작은 요청이라도 비용이 발생합니다. 둘째, OpenAI는 아직 GPT-5.6에 대해 배치 엔드포인트(batch-endpoint) 할인을 도입하지 않았습니다. 이는 이전 버전에서 대규모 사용자들이 호출당 비용을 낮추는 데 도움이 되었던 기능입니다.
비용을 낮추는 방법
- 적절한 모델 선택: 심층 추론이 정말로 필요한 작업에만 Sol을 사용하고, 대부분의 프로덕션 작업에는 Terra를 기본으로 사용하며, 처리량이 많고 복잡도가 낮은 작업에는 Luna를 활용하세요.
- 캐싱 활용: 여러 호출에서 재사용되는 프롬프트와 중간 결과물을 저장하세요. 90%의 읽기 할인 혜택은 기본 가격 인하보다 훨씬 더 큰 절감 효과를 가져올 수 있습니다.
- 컨텍스트 길이 주의: 2배의 입력 추가 요금을 피하기 위해 매우 긴 입력값은 작은 청크(chunk)로 나누거나 불필요한 부분을 잘라내세요.
- 캐시 유지 시간 확인: 최소 캐시 유지 시간은 30분입니다.
향후 전망
개발자들은 캐시 쓰기 요금이나 컨텍스트 길이 임계값과 관련된 변경 사항이 있는지 공식 가격 페이지를 계속 주시해야 합니다.
요약: GPT-5.6의 계층형 가격 책정과 공격적인 캐싱 할인은 이를 저렴한 OpenAI 모델로 만들어 주지만, 무료 티어와 배치 할인 기능의 부재로 인해 대규모 배포 시에는 여전히 영리한 비용 관리가 필수적입니다.
