DeepMind는 이번 주에 DiffusionGemma를 공개했습니다. 이는 단일 H100 GPU에서 초당 약 1,500개의 토큰을 생성할 수 있는 오픈 웨이트(open-weight) 언어 모델로, 표준 Gemma 4 모델이 초당 약 303개의 토큰을 생성하는 것과 대조적입니다. 이러한 속도 향상은 실시간 애플리케이션에서 AI 기반 에이전트의 속도를 늦추는 지연 시간(latency) 병목 현상을 줄일 수 있다는 점에서 중요합니다.
DiffusionGemma가 토큰 단위 생성 방식의 관행을 깨는 방법
대부분의 현대적 언어 모델은 자기회귀(autoregressive) 방식으로 텍스트를 생성합니다. 즉, 토큰 하나를 예측하고 이를 다시 모델에 입력한 뒤 다음 토큰을 예측하는 방식입니다. 이러한 "왼쪽에서 오른쪽으로" 진행되는 루프는 모델의 가중치(weights)에 매 토큰마다 접근해야 하므로 연산(compute)과 메모리 간의 긴밀한 결합을 강제합니다. DiffusionGemma는 이 루프를 256개 토큰 덩어리를 하나의 노이즈 섞인 데이터 블록으로 취급하는 이산 확산(discrete diffusion) 프로세스로 대체합니다. 그런 다음 모델은 전체 블록을 병렬로 노이즈 제거(denoise)하여, 반복적인 가중치 조회 대신 단계당 더 많은 양의 연산을 수행하도록 작업 부하를 전환합니다. Nvidia의 H100과 같이 병렬 연산에 뛰어난 하드웨어에서는 이러한 트레이드오프가 효과를 발휘합니다.
AI 에이전트에게 속도가 중요한 이유
자율 에이전트는 일반적으로 검색, 요약, 테스트의 사이클을 실행합니다. 각 단계마다 여러 번의 모델 호출이 포함될 수 있으므로, 토큰당 지연 시간이 발생하면 그 영향이 빠르게 누적됩니다. 모델이 정체되면 전체 에이전트 파이프라인이 지연되어 비용이 상승하고 사용자 경험이 저하됩니다.
성능 트레이드오프
DiffusionGemma의 속도는 원천 성능 면에서 측정 가능한 대가를 치릅니다. 추론, 사실성, 언어 이해 능력을 측정하는 벤치마크인 AIME에서 DiffusionGemma는 69.1점을 기록한 반면, Gemma 4는 88.3점에 도달했습니다. 또한 확산 방식은 매우 짧은 출력물에서 약점을 보이며, 생성된 텍스트가 반복되거나 주춤하는 토큰 "스터터링(stuttering)" 현상이 간혹 발생합니다. 동시에 약 32명 이상의 사용자가 모델에 쿼리를 보내면 병렬 처리의 이점이 줄어들고, 전체 처리량(throughput) 측면에서 표준 자기회귀 방식이 따라잡게 됩니다.
각 방식의 적합한 용도
데이터는 다음과 같은 하이브리드 배포 전략을 시사합니다.
- 확산 모델(Diffusion models): 깊은 추론을 요구하지 않으면서 지연 시간에 민감한 저동시성(low-concurrency) 작업 — 예: 짧은 프롬프트 생성, 템플릿 채우기 또는 초안 텍스트 작성.
- 자기회귀 모델(Autoregressive models): 높은 동시성(high-concurrency) 워크로드, 복잡한 추론 또는 정확도가 속도보다 중요한 긴 글 생성.
이러한 변화가 AI 인프라에 시사하는 점
단순히 모델 크기를 키우는 것이 아니라 생성 알고리즘을 재고함으로써 속도 이득을 얻을 수 있다면, 가장 큰 효율성 개선은 "플러밍(plumbing, 기반 시설)" 개선에서 나올 수 있습니다. 또한 이러한 트레이드오프는 개발자가 특정 사용 사례에서 품질이 다소 저하되는 것을 감수해야 함을 의미합니다.
반론: 확산 모델이 실전에 투입될 준비가 되었는가?
확산 방식의 구현은 짧은 프롬프트에서 어려움을 겪으며 불안정한(jittery) 출력을 생성할 수 있습니다.
향후 주목해야 할 사항
- 스케일링 연구: 더 큰 확산 모델이 속도를 유지하면서 성능 격차를 줄일 수 있을 것인가?
- 하드웨어 최적화: GPU가 진화함에 따라 연산 집약적인 확산 단계와 가중치 집약적인 자기회귀 사이의 균형이 다시 이동할 수 있습니다.
- 라우팅 알고리즘: 작업 인식형 모델 라우터의 초기 프로토타입을 통해 동적 선택을 통해 전체 시스템 지연 시간을 얼마나 단축할 수 있는지 확인할 수 있을 것입니다.
요약
DiffusionGemma는 근본적인 생성 루프를 재고함으로써 칩을 더 추가하지 않고도 지연 시간을 대폭 줄일 수 있음을 증명합니다. 이 기술이 자기회귀 모델을 완전히 대체하는 것은 아니지만, 작업별로 속도와 정확성의 균형을 맞추는 하이브리드 AI 스택을 위한 매력적인 도구를 제공합니다. 차세대 AI 인프라는 단순히 모델의 크기가 아니라, 적절한 엔진을 통해 작업을 얼마나 영리하게 라우팅하느냐에 따라 평가받게 될 것입니다.
