Kimi K3, 사이버 공격에서 미국 프런티어 모델에 뒤처지다: 증류(Distillation)의 격차
영국 AI 보안 연구소(UK AISI)와 미국 AI 표준 및 혁신 센터(CAISI)의 공동 평가 결과, 중국과 미국의 AI 모델 간 공격적 사이버 작전 수행 능력에 상당한 격차가 있음이 드러났다. Moonshot AI의 Kimi K3는 가능성을 보여주었으나, 복잡한 소프트웨어 취약점 공격 및 네트워크 공격 과제에서는 선도적인 미국 프런티어 모델들에 비해 여전히 크게 뒤처져 있다.
ExploitBench: 취약점 연구에서의 격차
취약점 공격 개발 능력을 측정하기 위해 연구진은 2023년 이후 Chrome의 V8 엔진에서 발견된 41개의 취약점을 포함하는 카네기 멜런 대학교의 벤치마크인 ExploitBench를 활용했다. 결과는 극명한 성능 차이를 보여주었다. 선도적인 미국 모델들은 평균 76.2%의 점수를 기록한 반면, Kimi K3는 32.2%로 현저히 낮은 점수를 받았다. Kimi K3는 중국의 GLM-5.2(24.4%)보다는 우수한 성능을 보였으나, 가장 높은 수준의 공격인 임의 코드 실행(Arbitrary Code Execution, ACE) 단계에는 도달하지 못했다.
이와 대조적으로, 미국의 최상위 모델들은 테스트된 41개 작업 중 20개에서 ACE를 성공적으로 수행하여 대상 시스템에 대한 완전한 제어권을 획득했다. 이는 Kimi K3가 재현할 수 없는 수준의 정교함이다.
"The Last Ones"를 통한 네트워크 공격 시뮬레이션
이번 평가는 또한 4개의 서브넷에 걸친 20개의 호스트를 포함하는 복잡한 32단계 기업 네트워크 공격 시뮬레이션인 "The Last Ones"(TLO)를 사용하여 모델을 테스트했다. 이 테스트는 에이전트가 다단계 침투 경로를 탐색하는 능력을 측정하도록 설계되었다.
Kimi K3는 32단계 중 평균 17단계에 도달하여 중간 정도의 능력을 보여주었다. 10번의 시도 중 한 번은 전체 공격 경로를 완수했지만, 평균 28.5단계를 기록한 미국 모델들에 비해 일관성이 부족했다. 이러한 결과는 Kimi K3가 방어 체계가 취약한 기업 시스템을 자율적으로 공격할 수는 있지만, 정교하고 긴 체인의 작전을 수행하는 데 필요한 서구권 프런티어 모델 수준의 신뢰성은 부족함을 시사한다.
증류(Distillation) 이론: 격차가 존재하는 이유
한 가지 중요한 의문이 남는다. 왜 중국 모델들은 일반적인 벤치마크에서는 우수한 성능을 보이면서도 사이버 작업에서는 뒤처지는가? 보고서는 이것이 "증류(distillation)" 때문일 수 있다고 시사한다. 증류란 Anthropic의 Claude와 같은 프런티어 모델의 고품질 출력을 학습 데이터로 사용하는 관행을 말한다.
만약 Moonshot AI가 Kimi K3를 학습시키기 위해 증류 방식을 사용했다면, 핵심적인 사이버 공격 데이터를 놓쳤을 가능성이 크다. 선도적인 미국 모델들은 고도의 공격적 질의를 차단하는 엄격한 안전 분류기(safety classifiers)를 채택하고 있다. 결과적으로, 이러한 모델들의 공개된 출력을 기반으로 구축된 데이터셋은 고수준의 취약점 공격에 필요한 지식이 자연스럽게 결여될 수밖에 없다. 이는 Kimi K3가 일반적인 프로그래밍 및 추론 능력에서는 서구권 모델과 대등하면서도, 특화된 공격적 사이버 작업에서는 왜 현저히 실패하는지를 설명해 준다.
성장하는 능력과 지속되는 위험
현재의 격차에도 불구하고, CAISI의 시계열 분석에 따르면 미국과 중국 모델 모두 Elo 기반의 상승 궤도에 있다. 오픈 모델의 성능 격차는 2025년 초 610개월 수준에서 최근 47개월로 좁혀졌다. UK AISI는 이러한 격차의 축소가 곧 안전을 의미하는 것은 아니라고 경고한다. 오픈 웨이트(open-weight) 모델의 능력이 향상되는 것은 글로벌 사이버 보안 환경에서 "지속적이고 되돌릴 수 없는 오용의 위험"을 나타낸다.
핵심 요약
- 사이버 성능 격차: Kimi K3는 ExploitBench에서 32.2%를 기록하여 선도적인 미국 모델의 평균인 76.2%에 크게 뒤처졌으며, 임의 코드 실행(ACE)을 달성하는 데 실패했다.
- 네트워크 공격 능력: TLO 시뮬레이션에서 Kimi K3는 32단계 공격 경로 중 평균 17단계를 수행했다. 이는 취약한 시스템을 공격할 수는 있지만, 최상위 미국 모델 수준의 신뢰성은 부족함을 입증한다.
- 증류의 역할: 사이버 기술의 결핍은 증류 관행에서 기인할 수 있다. Claude와 같은 모델의 검열된 공개 출력을 학습할 경우, 고도의 공격에 필요한 공격적 데이터가 부족하기 때문이다.
