Ejecutar un modelo de IA a gran escala se ha convertido menos en una hazaña científica que en un brutal problema matemático sobre facturas de electricidad y alquiler de centros de datos. Cada token que Gemini genera le cuesta algo real a Google: ciclos de silicio, ancho de banda de memoria y vatios consumidos de la red eléctrica. A medida que el volumen de consultas crece, fracciones de un centavo se acumulan en sumas que pueden devorar los márgenes por completo. Esa urgencia silenciosa es la que impulsa a Frozen v2, un proyecto interno de chips para servidores que está tomando forma dentro de Google. En lugar de perfeccionar sus Tensor Processing Units de propósito general para otra generación, la empresa está intentando algo mucho más radical: plasmar el esqueleto del modelo Gemini directamente en el propio silicio.

De aceleradores flexibles a silicio específico para modelos

Las TPU de Google han sido los caballos de batalla de su infraestructura durante casi una década. Entrenan modelos, impulsan algoritmos de clasificación de búsqueda e incluso se alquilan por horas a clientes de la nube, incluidos Meta y otros que buscan una alternativa a las GPUs de Nvidia. Esa versatilidad es precisamente lo que hace que una TPU sea una TPU. Habla un vocabulario general de multiplicación de matrices y movimiento de memoria, utilizable por casi cualquier red neuronal que se pueda describir en software.

Frozen v2 renuncia deliberadamente a esa flexibilidad. El chip se está diseñando como un acelerador específico para un dominio cuyos circuitos reflejan físicamente partes de la propia arquitectura de Gemini. Mientras que una TPU busca instrucciones y las interpreta como operaciones de software, Frozen v2 grabaría el plano estructural del modelo —la disposición de sus capas y rutas de datos— directamente en el diseño del chip. Google espera que esta estrecha unión entre modelo y metal haga que el chip sea entre seis y diez veces más eficiente que las TPU actuales al servir respuestas de IA. Menos pasos de cómputo por consulta significan menos tiempo de espera para que aparezca un token y mucha menos energía gastada en generarlo.

Esto no es simplemente una versión más rápida de la misma idea. Es una categoría de chip diferente, una que cambia la generalidad por la devoción a una única familia de modelos.

Por qué el primer «Frozen» se derritió

Este enfoque tiene sus raíces en un concepto anterior atribuido a Jeff Dean, científico jefe de Google DeepMind. La propuesta original de «Frozen» sugería llevar la especialización aún más lejos, codificando de forma rígida no solo la arquitectura, sino también los pesos reales del modelo —los miles de millones de parámetros ajustados que constituyen el comportamiento aprendido de Gemini— directamente en el propio chip.

La lógica era sólida. Si sabes exactamente qué números utilizará el modelo, ¿por qué molestarse en buscarlos en una memoria externa? Podrías grabarlos en los transistores y eliminar categorías enteras de retraso.

El problema era la permanencia. Los modelos de IA no se quedan estáticos. Google actualiza Gemini continuamente, reentrenándolo con nuevos datos, ajustando parámetros y lanzando versiones mejoradas. Un chip con los pesos congelados en el silicio se convertiría en un pisapapeles en el momento en que se lanzara una nueva revisión del modelo. Esa falta de flexibilidad mató el concepto original.

Arquitectura sin anclaje

Frozen v2 resuelve la trampa de la obsolescencia mediante la codificación rígida de la arquitectura, permitiendo al mismo tiempo que los pesos cambien libremente. Piénselo como construir una pista de carreras personalizada en lugar de soldar el coche a la carretera. La forma del circuito permanece fija, optimizada para los patrones de computación específicos de Gemini, pero el contenido que fluye a través de esos circuitos puede renovarse cargando nuevos pesos desde la memoria.

Esta distinción es importante en la práctica. Cuando los ingenieros entrenan un nuevo checkpoint de Gemini, pueden implementarlo en el hardware de Frozen v2 sin necesidad de fabricar un nuevo chip. El grado exacto de codificación rígida sigue siendo una cuestión abierta dentro de Google; los equipos deben decidir precisamente qué elementos estructurales merecen la inmortalidad del silicio y cuáles deben permanecer configurables. Pero el principio está establecido. Al congelar la forma y cambiar fluidamente los parámetros, Google mantiene la ventaja de la eficiencia sin sacrificar la capacidad de iterar.

La economía de mantenerlo de forma interna

Hay otra razón por la que no verá a Frozen v2 en la lista de precios de Google Cloud. Debido a que el chip está diseñado de forma tan íntima en torno a la estructura interna de Gemini, tendría poco sentido para desarrolladores externos que utilicen PyTorch o variantes personalizadas de Transformer. Google no tiene planes de venderlo como un producto de propósito general. Seguirá siendo una herramienta interna, dirigida directamente a la abrumadora demanda de capacidad de inferencia dentro de los propios centros de datos de Google.

Esa elección refleja una cruda realidad económica. En el mercado actual de la IA generativa, las capacidades de los modelos están convergiendo rápidamente. La brecha entre competidores a menudo se reduce a quién puede permitirse ejecutar el modelo más grande al menor coste por token. La inferencia ya no es algo secundario tras el entrenamiento; para un producto de uso masivo como Gemini, es el gasto dominante. Si Frozen v2 reduce ese gasto en un factor de seis o más, Google obtiene un margen de maniobra que los competidores no pueden igualar fácilmente. Puede quedarse con los ahorros como margen de beneficio o trasladarlos en forma de precios más bajos para los consumidores de API e integraciones de productos, apretando las tuercas a OpenAI, Anthropic y otros.

Lo que esto significa para la industria

El movimiento de Google también insinúa hacia dónde se dirige la estrategia de hardware en general. Durante años, la estrategia estándar consistía en construir el acelerador más flexible posible y dejar que el software se encargara de la especialización. Las GPU de Nvidia dominan porque ejecutan desde dinámica molecular hasta videojuegos y modelos de lenguaje extensos. Las propias TPU de Google fueron concebidas con ese mismo espíritu de utilidad amplia.

Frozen v2 rompe con esa tradición. Es un reconocimiento de que, cuando una sola familia de modelos genera un volumen de consultas suficiente, el silicio personalizado adaptado a ese modelo puede amortizarse con creces. Otros hiperescaladores han seguido una lógica similar —los chips Trainium e Inferentia de Amazon, por ejemplo—, pero el enfoque de Google va más allá al codiseñar el hardware en torno a una arquitectura de modelo específica en lugar de una clase general de redes.

El riesgo, por supuesto, es la rigidez. Si la arquitectura de Gemini evoluciona en una dirección que los circuitos integrados no pueden acomodar, Google podría encontrarse con un silicio costoso que no puede ejecutar sus ideas más recientes. Es precisamente por eso que el compromiso de "solo arquitectura" es importante. Ofrece un punto medio: suficiente especialización para capturar ganancias de eficiencia drásticas y suficiente flexibilidad para evitar que la empresa se vea acorralada.

La verdadera conclusión

Frozen v2 debe entenderse mejor no como el anuncio de un chip, sino como una apuesta estratégica sobre la forma futura de la competencia en IA. Google apuesta a que los ganadores no solo construirán los mejores modelos, sino que serán dueños de todo el stack: desde el diseño del modelo hasta los electrones que atraviesan el transistor. Si el proyecto tiene éxito, la recompensa no se verá en las puntuaciones de los benchmarks. Se verá en la columna de costes de un informe de resultados trimestrales, donde unos pocos céntimos ahorrados por cada millón de tokens pueden redibujar los límites de lo que es comercialmente posible en la IA generativa.