대규모 AI 모델을 운영하는 것은 이제 과학적 성취라기보다 전기 요금과 데이터 센터 임대료에 관한 잔혹한 수학 문제에 가까워졌습니다. Gemini가 생성하는 모든 토큰은 실리콘 사이클, 메모리 대역폭, 전력 소모량 등 Google에 실질적인 비용을 발생시킵니다. 쿼리량이 증가함에 따라, 1센트 미만의 작은 비용들이 모여 수익 마진을 통째로 삼켜버릴 정도의 거대한 금액이 됩니다. 이러한 조용한 절박함이 Google 내부에서 구체화되고 있는 내부 서버 칩 프로젝트인 Frozen v2의 배경입니다. 범용 Tensor Processing Unit(TPU)을 다음 세대로 개선하는 대신, Google은 훨씬 더 급진적인 시도를 하고 있습니다. 바로 Gemini 모델의 골격을 실리콘 자체에 직접 주조하는 것입니다.

유연한 가속기에서 모델 특화 실리콘으로

Google의 TPU는 거의 10년 동안 인프라의 핵심 동력이었습니다. TPU는 모델을 학습시키고, 검색 순위 알고리즘을 구동하며, Nvidia GPU의 대안을 찾는 Meta를 포함한 클라우드 고객들에게 시간당 대여되기도 합니다. 이러한 다재다능함이 바로 TPU를 TPU답게 만드는 요소입니다. TPU는 소프트웨어로 구현 가능한 거의 모든 신경망에서 사용할 수 있는 행렬 곱셈과 메모리 이동이라는 범용적인 언어를 구사합니다.

Frozen v2는 이러한 유연성을 의도적으로 포기합니다. 이 칩은 회로가 Gemini 아키텍처의 일부를 물리적으로 모방하는 도메인 특화 가속기로 설계되고 있습니다. TPU가 명령어를 가져와 소프트웨어 연산으로 해석하는 반면, Frozen v2는 모델의 구조적 청사진(레이어 배치 및 데이터 경로)을 칩 레이아웃에 직접 새겨 넣습니다. Google은 모델과 하드웨어의 이러한 긴밀한 결합을 통해 AI 응답 서비스 시 현재의 TPU보다 6~10배 더 효율적인 칩이 될 것으로 기대합니다. 쿼리당 연산 단계가 줄어든다는 것은 토큰이 나타날 때까지 기다리는 시간이 단축되고, 생성에 소모되는 에너지가 훨씬 적어진다는 것을 의미합니다.

이것은 단순히 기존 아이디어의 더 빠른 버전이 아닙니다. 범용성을 포기하는 대신 단일 모델 제품군에 헌신하는, 완전히 다른 범주의 칩입니다.

첫 번째 “Frozen”이 녹아내린 이유

이 접근 방식은 Google DeepMind의 수석 과학자인 Jeff Dean이 제안했던 초기 개념에 뿌리를 두고 있습니다. 원래의 “Frozen” 제안은 아키텍처뿐만 아니라 실제 모델 가중치(Gemini의 학습된 동작을 구성하는 수십억 개의 조정된 파라미터)까지 칩에 직접 하드코딩하여 전문화를 더욱 극대화하는 것이었습니다.

논리는 타당했습니다. 모델이 사용할 숫자를 정확히 알고 있다면, 왜 굳이 외부 메모리에서 가져와야 할까요? 트랜지스터에 직접 새겨 넣으면 지연 시간의 범주 자체를 제거할 수 있습니다.

문제는 영속성이었습니다. AI 모델은 정지해 있지 않습니다. Google은 새로운 데이터로 재학습하고, 파라미터를 조정하며, 개선된 버전을 출시하며 Gemini를 지속적으로 업데이트합니다. 가중치가 실리콘에 고정된 칩은 새로운 모델 버전이 출시되는 순간 무용지물이 될 것입니다. 이러한 유연성 부족이 원래의 개념을 무산시켰습니다.

구속되지 않는 아키텍처

Frozen v2는 아키텍처는 하드코딩하되 가중치는 자유롭게 변경할 수 있도록 하여 노후화의 함정을 해결합니다. 자동차를 도로에 용접하는 대신, 맞춤형 경주 트랙을 만드는 것으로 생각하면 됩니다. 회로의 형태는 Gemini의 특정 연산 패턴에 최적화된 상태로 고정되지만, 그 회로를 통해 흐르는 내용은 메모리에서 새로운 가중치를 로드함으로써 갱신할 수 있습니다.

이러한 차이는 실무에서 매우 중요합니다. 엔지니어가 새로운 Gemini 체크포인트를 학습시키면, 새로운 칩을 제조할 필요 없이 Frozen v2 하드웨어에 바로 배포할 수 있습니다. 어느 정도까지 하드코딩할지는 Google 내부에서도 여전히 논의 중인 과제입니다. 어떤 구조적 요소가 실리콘에 영구히 새겨질 가치가 있는지, 어떤 요소가 설정 가능하게 남아야 하는지를 팀별로 결정해야 합니다. 하지만 원칙은 확립되었습니다. 형태는 고정하고 파라미터는 유연하게 교체함으로써, Google은 반복 개선(iteration) 능력을 희생하지 않으면서도 효율성이라는 이점을 유지합니다.

내부용으로 유지하는 경제성

Frozen v2가 Google Cloud의 가격표에 올라오지 않을 또 다른 이유가 있습니다. 이 칩은 Gemini의 내부 구조에 맞춰 매우 밀접하게 설계되었기 때문에, PyTorch나 커스텀 Transformer 변형 모델을 사용하는 외부 개발자들에게는 큰 의미가 없을 것입니다. Google은 이를 범용 제품으로 판매할 계획이 없습니다. 이 칩은 Google 자체 데이터 센터의 엄청난 추론 용량 수요를 정조준하는 내부 도구로 남을 것입니다.

그 선택은 냉혹한 경제적 현실을 반영합니다. 현재 생성형 AI 시장에서 모델의 성능은 빠르게 수렴하고 있습니다. 경쟁사 간의 격차는 종종 누가 가장 큰 모델을 토큰당 가장 낮은 비용으로 실행할 수 있느냐에 따라 결정됩니다. 추론은 더 이상 학습의 부수적인 단계가 아닙니다. Gemini와 같이 널리 사용되는 제품의 경우, 추론은 지배적인 비용 항목입니다. 만약 Frozen v2가 해당 비용을 6배 이상 절감한다면, Google은 경쟁사가 쉽게 따라올 수 없는 여유를 확보하게 됩니다. Google은 절감된 비용을 마진으로 챙기거나, API 소비자 및 제품 통합 고객을 위한 가격 인하로 돌려줌으로써 OpenAI, Anthropic 및 기타 경쟁사들을 압박할 수 있습니다.

이것이 업계에 시사하는 바

Google의 이러한 행보는 더 넓은 하드웨어 전략이 어디로 향하고 있는지도 암시합니다. 수년 동안 표준적인 방식은 가능한 한 가장 유연한 가속기를 구축하고 소프트웨어가 전문화를 담당하도록 하는 것이었습니다. Nvidia의 GPU가 시장을 지배하는 이유는 분자 역학부터 비디오 게임, 대규모 언어 모델에 이르기까지 모든 것을 실행할 수 있기 때문입니다. Google의 TPU 또한 이러한 범용성의 정신에서 고안되었습니다.

Frozen v2는 이러한 전통에서 벗어납니다. 이는 단일 모델 제품군이 충분한 쿼리 볼륨을 창출할 때, 해당 모델에 맞춤화된 커스텀 실리콘이 그 비용을 수차례 상쇄할 수 있음을 인정하는 것입니다. 다른 하이퍼스케일러들도 유사한 논리를 추구해 왔습니다(예: Amazon의 Trainium 및 Inferentia 칩). 하지만 Google의 접근 방식은 일반적인 네트워크 클래스가 아닌 특정 모델 아키텍처를 중심으로 하드웨어를 공동 설계(co-design)함으로써 더 깊이 파고듭니다.

물론 리스크는 경직성입니다. 만약 Gemini의 아키텍처가 하드코딩된 회로가 수용할 수 없는 방향으로 진화한다면, Google은 최신 아이디어를 실행할 수 없는 값비싼 실리콘을 보유하게 될 수도 있습니다. 이것이 바로 '아키텍처 전용(architecture-only)' 타협안이 중요한 이유입니다. 이는 극적인 효율성 이득을 얻을 수 있을 만큼의 전문화와, 회사를 막다른 길로 몰아넣지 않을 만큼의 유연성을 동시에 제공하는 중간 경로를 제시합니다.

핵심 요점

Frozen v2는 단순한 칩 발표가 아니라, AI 경쟁의 미래 형태에 대한 전략적 베팅으로 이해하는 것이 가장 적절합니다. Google은 승자가 단순히 최고의 모델을 만드는 것에 그치지 않고, 모델의 설계도부터 트랜지스터를 통과하는 전자 하나하나에 이르기까지 전체 스택을 소유하게 될 것이라는 데 판을 걸고 있습니다. 이 프로젝트가 성공한다면, 그 결실은 벤치마크 점수로 나타나지 않을 것입니다. 대신 분기별 실적 보고서의 비용 항목에서 나타날 것입니다. 100만 토큰당 단 몇 센트의 절감이 생성형 AI 분야에서 상업적으로 가능한 영역의 경계를 다시 그릴 수 있기 때문입니다.