DeepSeek의 DSpark 프레임워크를 통해 이제 주요 대규모 언어 모델(LLM)이 재학습이나 품질 저하 없이 텍스트를 최대 85% 더 빠르게 생성할 수 있게 되었습니다. 이 속도 향상은 현재 DeepSeek의 API를 통해 제공되며, 누구나 자신의 배포 환경에 바로 적용할 수 있는 MIT 라이선스의 오픈 소스 라이브러리로도 제공됩니다.
지금 추론 속도가 중요한 이유
2026년까지 AI 컴퓨팅 예산의 대부분은 추론(학습된 모델이 질의에 답변하는 단계)에 사용될 것입니다. 기업들이 점점 더 큰 모델을 구축하는 것에서 대규모로 모델을 서비스하는 것으로 전환함에 따라, 지연 시간(latency)과 하드웨어 비용이 결정적인 요소가 되고 있습니다. 추론 속도가 빨라진다는 것은 더 저렴한 GPU 클러스터, 낮은 클라우드 비용, 그리고 더 빠른 사용자 경험을 의미합니다.
Speculative decoding 기법
전통적인 생성 방식은 토큰을 하나씩 순차적으로 처리합니다. 모델이 다음 단어를 예측하고, 그다음 단어를 예측하는 식입니다. 이러한 순차적 방식은 병렬 처리에 강점이 있는 현대적 GPU의 성능을 저하시킵니다. DSpark는 speculative decoding을 통해 이러한 병목 현상을 해결합니다.
- 경량화된 "draft" 모델이 여러 개의 토큰을 미리 예측합니다.
- 훨씬 더 큰 메인 모델이 해당 예측들을 단일 배치(batch)로 검증합니다.
- draft 모델의 추측이 메인 모델의 예상과 일치하면, 시스템은 전체 배치를 한 번에 출력하여 토큰당 대기 시간을 단축합니다.
- 만약 추측이 틀리면 배치는 거부되고 프로세스가 반복되어, 최종 출력이 메인 모델이 단독으로 생성했을 때와 동일하도록 보장합니다.
메인 모델이 여전히 최종 검증을 수행하기 때문에, 생성된 텍스트는 단일 토큰 방식으로 실행했을 때와 정확히 동일한 품질과 정확도를 유지합니다.
DSpark가 현재 지원하는 기능
- 허용 범위가 넓은 MIT 라이선스 기반의 오픈 소스로, 팀에서 라이선스 문제 없이 감사, 수정 또는 임베딩할 수 있습니다.
- DeepSeek, Alibaba의 Qwen, Google의 Gemma 등 다양한 인기 오픈 소스 LLM 제품군과 호환됩니다.
- 기존 하드웨어에서 즉각적인 속도 향상을 제공합니다. 사용자들은 추론 속도가 60%에서 85%까지 빨라졌다고 보고하고 있으며, 이는 동일한 작업량에 대해 GPU 사용 시간을 줄여줍니다.
- 스타트업과 기업 모두에게 중요한 비용 절감 요소인 최신 고가 GPU로의 업그레이드 압박을 줄여줍니다.
이미 DeepSeek의 호스팅 API를 사용 중이라면, DSpark 최적화는 백그라운드에서 자동으로 실행됩니다. 온프레미스(on-premise) 배포의 경우, GitHub의 DeepSpec 코드베이스가 자체적인 speculative pipeline을 구축하는 데 필요한 draft 모델 인프라를 제공합니다.
요약
DSpark는 소프트웨어적인 조정만으로도 과거에는 새로운 하드웨어가 필요하다고 여겨졌던 지연 시간 단축을 달성할 수 있음을 증명합니다. speculative decoding을 공개적으로 제공함으로써, DeepSeek는 AI 효율성 경쟁의 중심을 "더 큰 칩"에서 "더 스마트한 코드"로 옮겼으며, 대규모 모델을 실행할 수 있는 모든 이에게 더 빠르고 저렴하게 실행할 수 있는 기회를 제공합니다.
