DeepSeek는 2026년 9월 14일, 자사의 V4-Pro 대규모 언어 모델(LLM)을 은퇴시키고 모든 API 요청을 최신 버전인 V4.1-Flash로 라우팅할 것이라고 발표했습니다.

DeepSeek가 V4-Pro를 중단하는 이유

V4-Pro는 출시 이후 폭넓은 지식을 갖춘 범용 LLM으로 마케팅되며 DeepSeek의 최상위 제품군 역할을 해왔습니다. 지난 1년 동안 DeepSeek는 API 고객들이 중요하게 여기는 작업인 코드 생성, 터미널 명령 합성, 짧은 프롬프트에 대한 빠른 응답을 기준으로 V4.1-Flash를 V4-Pro와 비교 측정했습니다. 데이터에 따르면 최신 모델이 더 빠르게 작동하고, 요청당 비용이 더 저렴하며, 여러 작업별 벤치마크에서 더 높은 점수를 기록했습니다.

이러한 변화는 시장의 압박을 반영합니다. 클라우드 기반 AI 서비스는 이제 토큰당 또는 컴퓨팅 단위당 비용을 청구하며, 개발자들은 속도를 희생하지 않으면서 운영 비용을 절감할 방법을 찾고 있습니다. 모든 트래픽을 V4.1-Flash로 전환함으로써, DeepSeek는 V4-Pro를 구동하는 더 비싼 추론 파이프라인을 폐쇄하고 절감된 비용을 사용자에게 돌려줄 수 있습니다.

성능 및 비용 한눈에 보기

벤치마크 V4.1-Flash V4-Pro
Terminal-Bench 2.1 (코딩 및 명령 생성) 90.6 87.9
Terminal-Bench 4.0 (복잡한 다단계 작업) 31.2 12.4
DeepSWE v1.1 (소프트웨어 엔지니어링 추론) 74.2 62.7

각 테스트에서 V4.1-Flash는 더 높은 점수를 기록했으며, 때로는 큰 차이를 보이기도 했습니다. DeepSeek의 내부 비교에 따르면, 이 모델은 동일한 코딩 중심 벤치마크에서 Claude Opus 5 및 GPT-5.6 Sol보다도 뛰어난 성능을 보였습니다.

일반적인 작업당 비용도 유사한 패턴을 보입니다:

  • GLM-5.3-Flash: $0.25
  • DeepSeek V4.1-Flash: $0.27
  • Moonshot Kimi K3: $2.00

개발자가 더 크고 비싼 대안 대신 Flash 모델을 선택하면 약 8분의 1의 비용으로 대등한 수준의 지능을 확보할 수 있습니다.

트레이드오프: 줄어든 백과사전식 지식

효율성 향상에는 사실 회상(factual recall) 능력의 저하가 따릅니다. SimpleQA-Verified 사실 확인 벤치마크에서 V4.1-Flash는 42.3점을 기록한 반면, V4-Pro는 55.2점을 기록했습니다. DeepSeek는 최신 모델을 “더 뛰어난 작업자이지만, 백과사전으로서의 능력은 약하다”라고 설명합니다. 뉴스 요약, 법률 조사와 같이 최신 세계 지식에 크게 의존하는 애플리케이션은 외부 지식 베이스를 사용하거나 더 큰 모델로 폴백(fallback)하는 기능이 필요할 수 있습니다.

업계의 포지셔닝 현황

DeepSeek의 올인(all-in) 전략은 다른 AI 제공업체들과 대조를 이룹니다:

  • Z.ai는 소형부터 대형까지 다양한 모델 스펙트럼을 제공하여 고객이 프로젝트별로 규모와 효율성의 균형을 맞출 수 있도록 합니다.
  • Moonshot은 Kimi K3 모델을 통해 규모에 집중하며, 원시 용량(raw capacity)을 위해 더 높은 비용을 감수합니다.
  • DeepSeek는 모든 API 요청을 Flash로 전환하며, 시장이 단순한 규모보다는 속도와 가격을 우선시할 것이라는 데 도박을 걸었습니다.

이러한 상이한 접근 방식은 시장이 아직 단일한 경로로 정착하지 않았음을 보여줍니다. 일부 개발자는 여전히 거대 모델의 방대한 지식을 가치 있게 여기는 반면, 다른 이들은 이를 더 빠르고 저렴한 응답과 맞바꿉니다.

개발자를 위한 실질적인 조언

  1. 모델 이름이나 토큰 가격만으로 모델을 선택하지 마세요. "Flash" 모델이 여러분이 중요하게 생각하는 작업에서 "Pro" 모델보다 더 뛰어난 성능을 낼 수 있습니다.
  2. 스택에 유연성을 구축하세요. 대대적인 코드 수정 없이도 제공업체나 모델 버전을 전환할 수 있도록 시스템을 설계하십시오.
  3. 자체 데이터로 검증하세요. 공개 벤치마크는 유용한 기준점을 제공하지만, 실제 성능은 여러분의 워크로드에 따라 달라집니다.

이러한 단계를 따르면 팀이 특정 기술에 종속(lock-in)되는 것을 방지하고, LLM 생태계가 진화함에 따라 최상의 가치를 확보하는 데 도움이 됩니다.

향후 주목해야 할 점

V4-Pro의 은퇴는 효율성 중심의 LLM으로의 명확한 전환을 의미합니다. 이것이 "플래그십" 시대의 종말을 의미할지, 아니면 급변하는 시장의 새로운 단계의 시작일지는 지켜봐야 하겠지만, 민첩하게 대처하는 개발자들이 이러한 변화로부터 이익을 얻기에 가장 유리한 위치를 점할 것입니다.