Запуск крупной модели ИИ в масштабе стал не столько научным достижением, сколько жестокой математической задачей, связанной со счетами за электричество и арендой дата-центров. Каждый токен, который генерирует Gemini, обходится Google вполне реально: циклы кремния, пропускная способность памяти и ватты, потребляемые из розетки. По мере роста объема запросов доли цента складываются в суммы, способные полностью поглотить маржу. Эта скрытая необходимость стоит за Frozen v2 — проектом внутреннего серверного чипа, который сейчас обретает форму внутри Google. Вместо того чтобы в очередном поколении совершенствовать свои универсальные Tensor Processing Units, компания пытается сделать нечто гораздо более радикальное: буквально «отлить» скелет модели Gemini в самом кремнии.

От гибких ускорителей к специализированным кремниевым чипам

TPU от Google на протяжении почти десятилетия являются «рабочими лошадками» её инфраструктуры. Они обучают модели, обеспечивают работу алгоритмов ранжирования поиска и даже сдаются в почасовую аренду облачным клиентам, включая Meta и других, кто ищет альтернативу GPU от Nvidia. Именно эта универсальность и делает TPU тем, чем он является. Он оперирует общим набором операций матричного умножения и перемещения данных в памяти, пригодным практически для любой нейросети, которую можно описать программно.

Frozen v2 намеренно отказывается от этой гибкости. Чип проектируется как специализированный ускоритель (domain-specific accelerator), чьи схемы физически повторяют части архитектуры самой Gemini. Там, где TPU считывает инструкции и интерпретирует их как программные операции, Frozen v2 «вжигает» структурный чертеж модели — расположение её слоев и путей передачи данных — непосредственно в топологию чипа. Google ожидает, что этот тесный союз модели и «железа» сделает чип в шесть-десять раз эффективнее текущих TPU при обработке ответов ИИ. Меньшее количество вычислительных шагов на запрос означает меньше времени ожидания появления токена и гораздо меньше энергии, затраченной на его генерацию.

Это не просто ускоренная версия прежней идеи. Это чип другой категории, который меняет универсальность на преданность одному конкретному семейству моделей.

Почему первый «Frozen» растаял

Этот подход уходит корнями в более раннюю концепцию, приписываемую Джеффу Дину, главному ученому Google DeepMind. Первоначальное предложение «Frozen» предполагало еще большую специализацию: жесткое кодирование (hardcoding) не только архитектуры, но и самих весов модели — миллиардов настроенных параметров, составляющих обученное поведение Gemini — непосредственно в чипе.

Логика была здравой. Если вы точно знаете, какие числа будет использовать модель, зачем тратить время на их извлечение из внешней памяти? Их можно было вытравить прямо в транзисторах и устранить целые категории задержек.

Проблема заключалась в неизменности. Модели ИИ не стоят на месте. Google постоянно обновляет Gemini, переобучая её на новых данных, корректируя параметры и выпуская улучшенные версии. Чип с весами, «замороженными» в кремнии, превратился бы в пресс-папье в тот самый момент, когда вышла бы новая ревизия модели. Именно отсутствие гибкости погубило первоначальную концепцию.

Архитектура без якоря

Frozen v2 решает проблему быстрого устаревания, жестко фиксируя архитектуру, но оставляя веса свободными для изменений. Представьте, что вы заливаете бетон под специальную гоночную трассу, а не привариваете автомобиль к дороге. Форма схемы остается неизменной, оптимизированной под специфические паттерны вычислений Gemini, но содержимое, протекающее через эти схемы, можно обновлять, загружая новые веса из памяти.

На практике это различие имеет огромное значение. Когда инженеры обучают новый чекпоинт (checkpoint) Gemini, они могут развернуть его на оборудовании Frozen v2 без необходимости производства нового чипа. Точная степень жесткого кодирования всё еще остается открытым вопросом внутри Google; командам предстоит решить, какие именно структурные элементы заслуживают «кремниевого бессмертия», а какие должны оставаться настраиваемыми. Но принцип определен. Замораживая форму и гибко меняя параметры, Google сохраняет преимущество в эффективности, не жертвуя способностью к итерациям.

Экономика внутреннего использования

Есть еще одна причина, по которой вы не увидите Frozen v2 в прайс-листах Google Cloud. Поскольку чип настолько тесно связан с внутренним устройством Gemini, он не будет иметь особого смысла для сторонних разработчиков, использующих PyTorch или кастомные варианты Transformer. У Google нет планов продавать его как продукт общего назначения. Он останется внутренним инструментом, нацеленным непосредственно на колоссальный спрос на мощности для инференса (inference) в собственных дата-центрах Google.

Этот выбор отражает суровую экономическую реальность. На текущем рынке генеративного ИИ возможности моделей быстро сближаются. Разрыв между конкурентами часто сводится к тому, кто может позволить себе запуск самой крупной модели с наименьшей стоимостью за токен. Инференс перестал быть второстепенной задачей после обучения; для такого широко используемого продукта, как Gemini, он является основной статьей расходов. Если Frozen v2 сократит эти расходы в шесть и более раз, Google получит запас прочности, с которым конкурентам будет трудно соперничать. Компания может либо оставить экономию себе в качестве маржи, либо передать её потребителям API и интеграторам продуктов в виде более низких цен, тем самым усиливая давление на OpenAI, Anthropic и других.

Что это означает для индустрии

Шаг Google также намекает на направление развития более широкой стратегии в области аппаратного обеспечения. На протяжении многих лет стандартным подходом было создание максимально гибкого ускорителя, оставляя специализацию на откуп программному обеспечению. GPU от Nvidia доминируют, потому что они работают со всем: от молекулярной динамики до видеоигр и больших языковых моделей. Собственные TPU от Google создавались в том же духе универсальности.

Frozen v2 отходит от этой традиции. Это признание того, что когда одно семейство моделей генерирует достаточный объем запросов, специализированные чипы, адаптированные под эту модель, могут окупиться многократно. Другие гиперскейлеры придерживаются схожей логики — например, чипы Trainium и Inferentia от Amazon — но подход Google идет глубже, поскольку предполагает совместное проектирование оборудования под конкретную архитектуру модели, а не под общий класс сетей.

Риск, конечно же, заключается в жесткости. Если архитектура Gemini будет развиваться в направлении, которое не смогут поддержать жестко запрограммированные схемы, Google может оказаться с дорогостоящими чипами, которые не способны реализовать его новейшие идеи. Именно поэтому компромисс, основанный только на архитектуре, имеет значение. Он предлагает срединный путь: достаточно специализации для достижения резкого роста эффективности и достаточно гибкости, чтобы не загнать компанию в тупик.

Главный вывод

Frozen v2 лучше понимать не как анонс чипа, а как стратегическую ставку на будущий облик конкуренции в сфере ИИ. Google делает ставку на то, что победителями станут не просто создатели лучших моделей, а те, кто будет владеть всем стеком — от чертежа модели до электронов, проходящих через транзистор. Если проект увенчается успехом, результат проявится не в баллах бенчмарков. Он проявится в графе расходов в квартальном отчете о прибылях, где экономия нескольких центов на миллионе токенов может перечертить границы коммерчески возможного в области генеративного ИИ.