OpenAI가 자체 추론 칩인 Jalapeño를 공개하며, Nvidia의 GB200 및 GB300 가속기보다 킬로와트당 처리량이 최대 1.9배 높다고 밝혔습니다. 이 팀은 단 9개월 만에 개념을 작동 가능한 실리콘 다이로 구현해냈는데, 이는 맞춤형 AI 프로세서의 일반적인 개발 주기인 2~3년보다 훨씬 빠른 속도입니다.
스프린트가 중요한 이유
OpenAI는 이제 Nvidia GPU에만 의존하는 대신 Cerebras, AWS Trainium, AMD 등의 하드웨어에서 모델을 실행합니다. AI의 중심이 학습 중심에서 추론 중심의 워크로드로 이동함에 따라, 전력 사용량과 쿼리당 비용이 결정적인 요소가 되고 있습니다. 1조 파라미터 모델에 필요한 에너지를 절반으로 줄일 수 있는 칩은 매일 수십억 건의 요청을 처리하는 서비스의 운영 비용을 크게 절감할 수 있습니다.
AI가 칩을 설계한 방법
Jalapeño는 대규모 언어 모델(LLM) 실행이라는 단 하나의 목적을 위해 제작된 ASIC입니다. 범용 GPU와 달리, ASIC는 불필요한 로직을 제거하고 LLM 추론 패턴에 맞춰 데이터 경로를 최적화합니다. OpenAI 엔지니어들은 머신러닝 모델이 코드를 생성할 수 있게 해주는 하드웨어 기술 언어인 XLS로 설계를 작성했습니다. OpenAI는 AI가 생성한 로직이 칩 코어의 절반 이상을 차지하며, 이로 인해 설계 파이프라인이 수년에서 수개월로 단축되었다고 밝혔습니다.
성능 주장 vs 현실
OpenAI는 Jalapeño에 대해 세 가지 주요 수치를 제시했습니다:
- 킬로와트당 처리량: Nvidia GB200/GB300보다 1.5 – 1.9배 높음.
- 지연 시간(Latency): 동일한 Nvidia 모델보다 1.7 – 3.6배 낮음.
- 1조 파라미터 모델에서의 전력 소모량: GB300의 1,400W 대비 700W.
이 수치들이 입증된다면, 데이터 센터는 더 빠른 응답을 제공하면서도 동일한 모델을 절반의 전기 비용으로 실행할 수 있습니다. 이러한 주장은 추론에 집중되어 있으며, OpenAI는 현재 채팅형 애플리케이션 서비스에 집중하고 있는 만큼 학습 성능에 대해서는 언급하지 않았습니다.
Nvidia에 미치는 영향
Nvidia의 차세대 Blackwell 및 Vera Rubin 칩은 하이엔드 가속기 시장을 겨냥하고 있습니다. Nvidia의 강점은 성숙한 소프트웨어 스택, 폭넓은 개발자 채택, 그리고 다양한 AI 작업에 대한 유연성에 있습니다. 반면, Jalapeño는 워크로드가 특정 전문 분야와 일치할 때만 승산이 있는 목적 특화형 장치입니다.
Nvidia가 받는 압박은 두 가지 측면이 있습니다. 첫째, 맞춤형 ASIC을 도입할 여력이 있는 고객들이 약속된 비용 절감을 위해 전환할 경우 Nvidia의 추론 시장 점유율이 잠식될 수 있습니다. 둘째, AI가 하드웨어 설계를 도울 수 있다는 사실이 입증됨에 따라 경쟁사들의 개발 주기가 단축될 수 있으며, 이는 Nvidia가 로드맵을 가속화하도록 강제할 수 있습니다.
반론 및 미결 과제
- 소프트웨어 생태계: Nvidia의 CUDA 라이브러리, 프로파일링 도구 및 커뮤니티 지원은 여전히 대부분의 개발자에게 결정적인 우위를 제공합니다. Jalapeño를 통합하려면 새로운 툴체인이 필요하며, 경우에 따라 코드 재작성이 필요할 수도 있습니다.
- 실제 환경에서의 검증: 제시된 수치는 OpenAI의 내부 테스트 결과입니다. 독립적인 벤치마크, 장기적인 신뢰성 데이터, 그리고 멀티 테넌트(mixed-tenant) 부하 환경에서의 확장성 동작은 아직 검증되지 않았습니다.
- 규모의 경제: ASIC의 비용 이점은 생산량이 늘어날수록 커집니다. OpenAI의 내부 사용은 투자를 정당화할 수 있지만, 생산 규모가 확장되지 않는다면 외부 고객은 칩당 더 높은 가격을 지불해야 할 수도 있습니다.
향후 전망
현재로서는 Jalapeño가 9개월간의 스프린트를 통해, 이론상으로는 AI 스택에서 가장 비용에 민감한 부분에서 기존 GPU를 능가하는 칩을 만들어낼 수 있음을 증명했습니다. 진짜 시험대는 이 이점이 실제 워크로드의 가혹한 환경에서도 유지될 수 있느냐가 될 것입니다.
