1,500억 개의 파라미터를 가진 Mixture-of-Experts(MoE) 모델을 일반적인 개발자용 노트북에서 실행할 수 있습니다. 실험 결과, 성능의 실제 제한 요소는 SSD 속도가 아닌 RAM임이 밝혀졌습니다. 이는 클라우드 컴퓨팅 비용을 들이지 않고도 최첨단 규모의 모델을 로컬에서 테스트할 수 있음을 의미합니다.

테스트

REAP 방식으로 가지치기된(REAP-pruned) 1,500억 파라미터 MoE 모델인 DeepSeek V4 Flash를 오픈 소스 Colibrì 추론 엔진을 통해 실행했습니다. 하드웨어는 61GB RAM과 1TB NVMe SSD를 탑재한 AMD Ryzen AI 9 365 노트북입니다. 3분간의 생성 작업을 수행하며 시간을 측정하고 모든 디스크 액세스를 기록했습니다.

수치가 보여주는 것

  • 디스크 활동은 미미했습니다. 3분간의 생성 과정 동안 SSD 읽기 작업은 11초 미만이었습니다. 드라이브가 데이터를 즉시 읽을 수 있다고 하더라도, 전체 처리량(throughput)은 약 6% 정도만 향상될 뿐입니다.
  • RAM 크기가 속도에 직접적인 영향을 미쳤습니다. RAM 캐시를 절반으로 줄였을 때 처리량이 약 15% 감소했습니다. CPU는 디스크를 기다리는 시간만큼이나 캐시 미스(cache miss)를 처리하는 데(역양자화, 데이터 복사 및 관리) 많은 시간을 소비했습니다.

이 수치들은 노트북에서 대규모 모델 추론 시 저장 장치의 대역폭이 주요 병목 지점이라는 일반적인 통념을 뒤집습니다.

RAM이 SSD보다 중요한 이유

모델 파라미터가 RAM에 상주하지 않을 때 시스템은 다음 과정을 거쳐야 합니다:

  1. SSD에서 데이터를 가져옵니다.
  2. 데이터를 디코딩하여 연산을 위해 CPU 레지스터로 이동합니다.

두 단계 모두 사이클을 소모합니다. 첫 번째 단계는 SSD의 대역폭에 의해 제한되지만, 두 번째 단계에서도 데이터가 얼마나 빨리 도착하든 상관없이 CPU가 데이터를 역양자화(de-quantise)해야 하므로 거의 동일한 지연 시간이 발생합니다. 따라서 더 빠른 SSD는 수익 체감의 법칙(diminishing returns)이 적용되는 반면, 더 많은 RAM은 모델의 더 많은 부분을 상주시켜 비용이 많이 드는 왕복 과정을 제거할 수 있습니다.

개발자를 위한 시사점

  • 저장 장치가 아닌 메모리에 투자하십시오.
  • 로컬 테스트가 가능해집니다. 개발자는 기존 장비에서 오픈 웨이트(open-weight) MoE 모델을 실행하여, 클라우드 크레딧을 지불하지 않고도 스타일, 도구 호출(tool-calling) 동작 및 출력 품질을 확인할 수 있습니다.
  • 배치 평가(Batch evaluation)가 현실적이 됩니다. 실시간 채팅은 여전히 느릴 수 있지만, 연구를 위해 수십 개의 프롬프트를 생성하는 것과 같은 대기열 작업(queued jobs)은 노트북에서 원활하게 실행할 수 있습니다.

잠재적 반론

새로운 전문가 가중치(expert weights)를 반복적으로 로드해야 하는 워크로드의 경우 SSD 지연 시간(latency)이 여전히 중요하다고 주장하는 이들도 있을 수 있습니다.

향후 주목할 점

  • 메모리 효율적인 모델 변형(variants).
  • 더 큰 온칩 캐시(on-chip caches)를 갖춘 하드웨어.
  • 소프트웨어 수준의 캐싱 전략.

결론은 명확합니다. 노트북에서 거대한 MoE 모델을 실험하고자 하는 개발자는 RAM을 더 구매해야 합니다. SSD 업그레이드는 불과 몇 퍼센트의 성능 향상만을 가져오지만, 추가 메모리는 추론 시간을 두 자릿수 퍼센트까지 단축할 수 있습니다. 이는 AI 프로토타이핑의 비용 계산 방식을 변화시키며, 이전에는 전용 클라우드 클러스터가 필요하다고 여겨졌던 모델들을 로컬에서 비용 없이 테스트할 수 있는 길을 열어줍니다.