Executar um grande modelo de IA em escala tornou-se menos um feito científico e mais um problema matemático brutal sobre contas de eletricidade e aluguel de datacenters. Cada token que o Gemini gera custa algo real ao Google — ciclos de silício, largura de banda de memória e watts extraídos da tomada. À medida que o volume de consultas cresce, frações de centavos somam-se a valores que podem engolir margens inteiras. Essa urgência silenciosa está por trás do Frozen v2, um projeto interno de chip de servidor que agora está ganhando forma dentro do Google. Em vez de refinar suas Tensor Processing Units de uso geral por mais uma geração, a empresa está tentando algo muito mais radical: moldar o esqueleto do modelo Gemini diretamente no próprio silício.

De Aceleradores Flexíveis para Silício Específico para Modelos

As TPUs do Google têm sido os cavalos de batalha de sua infraestrutura por quase uma década. Elas treinam modelos, alimentam algoritmos de classificação de busca e até são alugadas por hora para clientes de nuvem, incluindo a Meta e outros que buscam uma alternativa às GPUs da Nvidia. Essa versatilidade é exatamente o que faz de uma TPU uma TPU. Ela fala um vocabulário geral de multiplicação de matrizes e movimentação de memória, utilizável por quase qualquer rede neural que você possa descrever em software.

O Frozen v2 abre mão deliberadamente dessa flexibilidade. O chip está sendo projetado como um acelerador específico para um domínio, cujos circuitos espelham fisicamente partes da própria arquitetura do Gemini. Enquanto uma TPU busca instruções e as interpreta como operações de software, o Frozen v2 gravaria o projeto estrutural do modelo — o arranjo de suas camadas e caminhos de dados — diretamente no layout do chip. O Google espera que esse casamento estreito entre modelo e metal torne o chip de seis a dez vezes mais eficiente que as TPUs atuais ao fornecer respostas de IA. Menos etapas de computação por consulta significam menos tempo de espera para um token aparecer e muito menos energia gasta para gerá-lo.

Isso não é apenas uma versão mais rápida da mesma ideia. É uma categoria diferente de chip, que troca a generalidade pela dedicação a uma única família de modelos.

Por que o Primeiro “Frozen” Derreteu

Essa abordagem tem raízes em um conceito anterior atribuído a Jeff Dean, Cientista-Chefe no Google DeepMind. A proposta original do “Frozen” sugeria levar a especialização ainda mais longe, codificando de forma fixa não apenas a arquitetura, mas os próprios pesos do modelo — os bilhões de parâmetros ajustados que constituem o comportamento aprendido do Gemini — diretamente no chip.

A lógica era sólida. Se você sabe exatamente quais números o modelo usará, por que se dar ao trabalho de buscá-los em uma memória externa? Você poderia gravá-los nos transistores e eliminar categorias inteiras de atraso.

O problema era a permanência. Modelos de IA não ficam parados. O Google atualiza o Gemini continuamente, retreinando com novos dados, ajustando parâmetros e lançando versões aprimoradas. Um chip com pesos congelados no silício se tornaria um peso de papel no momento em que uma nova revisão do modelo fosse lançada. Essa falta de flexibilidade matou o conceito original.

Arquitetura Sem a Âncora

O Frozen v2 resolve a armadilha da obsolescência ao codificar a arquitetura de forma fixa, enquanto deixa os pesos livres para mudar. Pense nisso como construir uma pista de corrida personalizada em vez de soldar o carro à estrada. O formato do circuito permanece fixo, otimizado para os padrões específicos de computação do Gemini, mas o conteúdo que flui através desses circuitos pode ser atualizado carregando novos pesos da memória.

Essa distinção importa na prática. Quando os engenheiros treinam um novo checkpoint do Gemini, eles podem implantá-lo no hardware do Frozen v2 sem fabricar um novo chip. O grau exato de codificação fixa ainda é uma questão em aberto dentro do Google; as equipes devem decidir precisamente quais elementos estruturais merecem a imortalidade do silício e quais devem permanecer configuráveis. Mas o princípio está estabelecido. Ao congelar o formato e trocar os parâmetros de forma fluida, o Google mantém o ganho de eficiência sem sacrificar a capacidade de iterar.

A Economia de Manter a Produção Interna

Há outra razão pela qual você não verá o Frozen v2 listado na tabela de preços do Google Cloud. Como o chip é moldado de forma tão íntima em torno das entranhas do Gemini, faria pouco sentido para desenvolvedores externos que utilizam PyTorch ou variantes customizadas de Transformer. O Google não tem planos de vendê-lo como um produto de uso geral. Ele permanecerá uma ferramenta interna, voltada diretamente para a demanda esmagadora por capacidade de inferência dentro dos próprios datacenters do Google.

Essa escolha reflete uma realidade econômica nua e crua. No atual mercado de IA generativa, as capacidades dos modelos estão convergindo rapidamente. A diferença entre os concorrentes muitas vezes se resume a quem consegue rodar o maior modelo com o menor custo por token. A inferência não é mais um pensamento secundário após o treinamento; para um produto amplamente utilizado como o Gemini, ela é a despesa dominante. Se o Frozen v2 reduzir essa despesa em um fator de seis ou mais, o Google ganha uma margem de manobra que os concorrentes não conseguem igualar facilmente. Ele pode tanto embolsar a economia como margem quanto repassá-la como preços mais baixos para consumidores de API e integrações de produtos, apertando o cerco contra a OpenAI, Anthropic e outros.

O que isso sinaliza para o setor

O movimento do Google também sugere para onde a estratégia de hardware mais ampla está caminhando. Durante anos, o roteiro padrão era construir o acelerador mais flexível possível e deixar que o software cuidasse da especialização. As GPUs da Nvidia dominam porque executam de tudo, desde dinâmica molecular até videogames e grandes modelos de linguagem. As próprias TPUs do Google foram concebidas com esse mesmo espírito de utilidade ampla.

O Frozen v2 rompe com essa tradição. É uma admissão de que, quando uma única família de modelos gera volume de consultas suficiente, o silício personalizado para esse modelo pode se pagar muitas vezes. Outros hyperscalers têm seguido uma lógica semelhante — os chips Trainium e Inferentia da Amazon, por exemplo — mas a abordagem do Google vai mais fundo ao co-projetar o hardware em torno de uma arquitetura de modelo específica, em vez de uma classe geral de redes.

O risco, é claro, é a rigidez. Se a arquitetura do Gemini evoluir em uma direção que os circuitos codificados rigidamente não consigam acomodar, o Google pode se ver com um silício caro que não consegue rodar suas ideias mais recentes. É precisamente por isso que o compromisso focado apenas na arquitetura é importante. Ele oferece um meio-termo: especialização suficiente para capturar ganhos de eficiência dramáticos e flexibilidade suficiente para evitar encurralar a empresa.

A verdadeira conclusão

O Frozen v2 deve ser entendido não como um anúncio de chip, mas como uma aposta estratégica no formato futuro da competição de IA. O Google está apostando que os vencedores não apenas construirão os melhores modelos, mas serão donos de toda a pilha — desde o projeto do modelo até os elétrons que passam pelo transistor. Se o projeto for bem-sucedido, o retorno não aparecerá em pontuações de benchmark. Ele aparecerá na coluna de custos de um relatório de resultados trimestrais, onde alguns centavos economizados por milhão de tokens podem redesenhar os limites do que é comercialmente possível na IA generativa.