Nvidia는 8월 11일 Nemotron 3.5 Lightning을 출시했습니다. 300억 개의 파라미터를 가진 Mixture-of-Experts(MoE) 모델로, 실제 구동 시에는 30억 개의 활성 파라미터만 사용합니다. 또한, 이와 함께 제공되는 NeMo Switchyard 라우팅 라이브러리는 추론 비용과 캐시 효율성에 대한 논쟁을 이미 불러일으켰습니다. Switchyard가 모델 간에 요청을 전달하는 방식은 프롬프트 캐시를 무효화하고, 단일 추론 세션의 비용을 잠재적으로 두 배로 늘릴 수 있습니다.
오픈 웨이트(open-weight) 에이전트를 위해 구축된 모델
Nemotron 3.5 Lightning은 도구를 호출하고, 결과를 검증하며, 추론 과정을 기록하는 AI 에이전트를 대상으로 합니다. 세 가지 기술적 선택이 이 모델을 차별화합니다:
- 하이브리드 아키텍처 – Mamba-2 상태 공간(state-space) 코어와 기존 Transformer를 결합하여, Transformer가 아닌 설계도 이 정도 규모에서 경쟁할 수 있음을 증명했습니다.
- 4비트 부동 소수점 양자화(4-bit floating-point quantization) – 저정밀도로 제공되어 30B 모델이 M5 Max MacBook Pro에서 초당 약 100개의 토큰을 생성할 수 있게 합니다. 이는 풀 프리시전(full-precision) 모델로는 달성하기 어려운 속도입니다.
- 완전한 개방성 – Nvidia는 가중치 파일과 전체 학습 레시피를 공개했습니다. 이는 고성능 추론을 목표로 하는 모델로서는 매우 이례적인 일입니다.
초기 사용자들은 이 모델이 "과하게 생각(over-think)"하여 때때로 오류가 있는 긴 추론 체인을 내뱉을 수 있다고 말합니다. 개발자들은 강력하고 공개적으로 사용 가능한 에이전트 실행기를 얻게 되지만, 불필요한 장황함을 피하기 위해 프롬프트를 주의 깊게 작성해야 합니다.
라우팅 레이어가 중요한 이유
NeMo Switchyard는 후보군 중에서 요청을 "최적의" 모델로 동적으로 라우팅하는 Nvidia의 라이브러리입니다. 이론적으로 라우터는 각 쿼리에 맞는 전문 모델을 선택함으로써 답변 품질을 높일 수 있습니다. 하지만 실제로는 라우팅 결정이 많은 추론 파이프라인이 의존하는 프롬프트 캐싱 메커니즘과 충돌합니다.
- **프롬프트 캐시(Prompt caches)**는 초기 프롬프트의 토큰 임베딩을 저장하여, 이후 생성 단계에서 "프리필(prefill)" 단계를 다시 계산하지 않고 재사용할 수 있게 합니다.
- **라우팅 교체(Routing swaps)**는 처음 몇 개의 토큰이 생성된 후 요청을 모델 A에서 모델 B로 이동시킵니다. 이로 인해 시스템은 캐시된 프롬프트를 폐기하고 새 모델을 위해 처음부터 다시 계산해야 합니다.
AI 비용의 대부분은 새로운 토큰을 생성하기보다 캐시된 프롬프트를 읽는 데 소모되므로, 단 한 번의 라우팅 이동만으로도 요청 비용이 실질적으로 두 배가 될 수 있습니다.
비용의 줄다리기
향후 전망
Nvidia의 오픈 웨이트 전략이 직접적인 경쟁을 맞이하면서 이러한 논쟁이 불거졌습니다. 8월 15일에는 Qwen 3.8-27B가 출시될 예정이며, 초기 벤치마크에 따르면 로컬 개발 환경에서 Nemotron 3.5 Lightning과 대등하게 경쟁할 수 있을 것으로 보입니다.
오픈 웨이트, 오픈 학습 레시피, 오픈 라우팅 레이어로 이어지는 Nvidia의 패턴은 이러한 모델을 로컬에서 실행하는 모든 이들에게 자사의 GPU를 기본 하드웨어로 만들려는 의도로 보입니다. 소프트웨어 스택을 공개함으로써, Nvidia는 라우팅 로직이 숨겨진 비용 페널티를 추가하더라도 개발자들이 자사의 생태계에 종속되기를 기대하고 있습니다.
시사점
Nemotron 3.5 Lightning을 개인 기기에서 실행할 계획이라면, "얼마나 빨리 생성할 수 있는가?"뿐만 아니라 "Switchyard가 얼마나 자주 프롬프트 캐시를 폐기하게 만들 것인가?"도 질문해야 합니다. 그 답변에 따라 이 모델의 오픈 웨이트 약속이 실질적인 비용 절감으로 이어질지, 아니면 값비싼 실험이 될지가 결정될 것입니다. Qwen과 같은 대안이 등장함에 따라, 라우팅의 유연성과 캐시 기반의 비용 효율성 사이의 균형이 어떤 툴킷이, 그리고 궁극적으로 어떤 하드웨어 플랫폼이 승리할지를 결정할 것입니다.
