Moonshot AI의 새로운 Kimi K3가 AA-Briefcase 벤치마크에서 GPT-5.6을 제치고 1,527점을 기록하며 앞섰습니다. GPT-5.6의 점수는 1,495점이었습니다. 이번 승리는 2.8조 개의 파라미터를 가진 오픈 웨이트(open-weight) 모델임에도 불구하고, 긴 분량의 코딩 작업에 놀라울 정도로 저렴한 가격 모델을 갖추었다는 점에서 더욱 의미가 큽니다.
이 벤치마크가 중요한 이유
AA-Briefcase는 단편적인 상식 퀴즈가 아니라 지속적인 실제 워크로드에서의 성능을 측정합니다. 점수가 높다는 것은 모델이 수천 개의 토큰에 걸쳐 문맥을 유지하고, 미리 계획을 세우며, 작업 흐름을 놓치지 않을 수 있음을 의미합니다. 이는 개발자들이 어시스턴트, 코드 생성기 또는 연구 보조 도구를 구축할 때 직면하는 조건과 정확히 일치합니다. Kimi K3가 GPT-5.6을 앞선 것은, 기존에 폐쇄형 모델들이 독점해 왔던 영역에서 이제 오픈 모델도 충분히 경쟁할 수 있음을 보여줍니다.
기술적 특징
- 크기 – 2.8조 개의 파라미터로, 현재까지 출시된 오픈 웨이트 모델 중 가장 큽니다.
- 아키텍처 – 896개의 전문가(expert)를 가진 Stable LatentMoE(Mixture-of-Experts) 구조이며, 이 중 16개가 매 순간 활성화됩니다.
- 컨텍스트 윈도우 – 100만 토큰 이상으로, 책 한 권 전체나 긴 코드베이스를 담기에 충분합니다.
- 어텐션(Attention) – 스케일링 효율을 개선한다고 알려진 커스텀 기술인 Kimi Delta Attention을 사용합니다.
이러한 선택 덕분에 모델은 "장기적 관점(long-horizon)"의 작업을 처리할 수 있는 능력을 갖추게 되었지만, 동시에 연산 요구 사항도 높아져 속도와 비용 수치에 영향을 미칩니다.
눈길을 사로잡는 가격 정책
Moonshot은 토큰 가격을 세 가지 범주로 나눕니다.
| 사용 유형 | 100만 토큰당 비용 |
|---|---|
| 입력 – 캐시 미스(cache miss) | $3.00 |
| 입력 – 캐시 히트(cache hit) | $0.30 |
| 출력 | $15.00 |
회사 측은 코딩 워크로드의 경우 캐시 히트율이 90%에 달한다고 밝혔습니다. 이것이 사실이라면, 코딩 에이전트를 위한 매우 저렴한 옵션이 될 것입니다.
체감하게 될 트레이드오프(Trade-offs)
- 속도 – 모델의 처리 속도는 초당 약 62토큰으로, 업계 중앙값보다 낮습니다. 긴 프롬프트의 경우 처리하는 데 몇 분이 걸릴 수도 있어, 대화형 사용 시 문제가 될 수 있습니다.
- 추론 비용 – Kimi K3는 기본적으로 "최대 추론 노력(max reasoning effort)" 모드로 작동하며, 이를 낮출 수 있는 설정이 없습니다. 따라서 간단한 질문도 복잡한 질문과 동일한 토큰 예산을 소모하므로, 일상적인 작업의 비용이 높아질 수 있습니다.
- 숨겨진 토큰 사용량 – 일부 사용자는 모델이 자동으로 삽입하는 상당한 양의 시스템 프롬프트가 있다고 보고했습니다. 이는 비용은 청구되지만 사용자의 요청에는 보이지 않는 토큰을 추가합니다.
이러한 요인들로 인해, 겉으로 보이는 낮은 가격이 실제로는 느린 처리 속도와 높은 토큰 소비로 인해 상쇄될 수 있습니다.
가용성 및 향후 계획
API는 오늘부터 바로 사용할 수 있어 개발자들이 즉시 실험해 볼 수 있습니다. 모델 가중치(weights) 자체는 7월 27일에 공개될 예정이며, 그 이후에는 셀프 호스팅이 가능해집니다. 그때까지 사용자는 Moonshot의 호스팅 서비스에 의존해야 하며, 그에 따른 지연 시간과 가격 구조를 감수해야 합니다.
폐쇄형 모델 진영의 반론
시사점
핵심적인 시사점은 폐쇄형 모델과 오픈 모델 사이의 격차가 줄어들고 있다는 것입니다. Kimi K3는 오픈 웨이트 모델도 복잡하고 장기적인 작업을 처리할 수 있음을 증명했습니다.
