На этой неделе DeepMind представила DiffusionGemma — языковую модель с открытыми весами, которая способна генерировать примерно 1500 токенов в секунду на одном GPU H100, в то время как стандартная модель Gemma 4 достигает максимума лишь в 303 токена в секунду. Такой прирост скорости имеет значение, так как он может устранить проблему задержек (latency bottleneck), замедляющую работу ИИ-агентов в приложениях реального времени.
Как DiffusionGemma избавляется от привычки генерировать токены по одному
Большинство современных языковых моделей генерируют текст авторегрессионно: они предсказывают один токен, подают его обратно в модель, а затем предсказывают следующий. Этот цикл «слева направо» создает тесную связь между вычислениями и памятью, так как веса модели необходимо запрашивать для каждого отдельного токена. DiffusionGemma заменяет этот цикл процессом дискретной диффузии, который рассматривает блок из 256 токенов как единый массив зашумленных данных. Затем модель выполняет денойзинг всего блока параллельно, перенося нагрузку с многократного обращения к весам на больший объем вычислений за один шаг. На оборудовании, которое отлично справляется с параллельными математическими операциями, таком как Nvidia H100, этот компромисс оправдывает себя.
Почему скорость важна для ИИ-агентов
Автономные агенты обычно работают по циклу поиска, суммаризации и тестирования. Каждый шаг может включать несколько вызовов модели, поэтому любая задержка на уровне одного токена быстро накапливается. Когда модель «зависает», весь конвейер агента останавливается, что увеличивает затраты и ухудшает пользовательский опыт.
Компромисс в производительности
Скорость DiffusionGemma достигается за счет ощутимой потери в чистой способности модели. В бенчмарке AIME — наборе тестов, измеряющем рассуждение, фактическую точность и понимание языка — DiffusionGemma набирает 69,1 балла, в то время как Gemma 4 достигает 88,3. Подход с диффузией также демонстрирует недостатки при генерации очень коротких текстов и периодическое «заикание» токенов, когда сгенерированный текст повторяется или прерывается. Когда модель запрашивают более 32 пользователей одновременно, преимущество параллелизма нивелируется, и стандартный авторегрессионный метод догоняет её по общей пропускной способности.
Где применим каждый из подходов
Данные указывают на необходимость гибридной стратегии развертывания:
- Диффузионные модели для задач с низкой конкурентностью запросов и высокой чувствительностью к задержкам, не требующих глубоких рассуждений — например, генерация коротких промптов, заполнение шаблонов или создание черновиков текста.
- Авторегрессионные модели для высоконагруженных систем, сложных рассуждений или генерации длинных текстов, где точность важнее чистой скорости.
Что этот сдвиг означает для ИИ-инфраструктуры
Если прирост скорости можно получить за счет переосмысления алгоритма генерации, а не простого масштабирования размера модели, то наибольшая эффективность может быть достигнута за счет улучшений в базовой инфраструктуре. Этот компромисс также означает, что разработчикам придется мириться с небольшим снижением качества в определенных сценариях использования.
Контраргумент: готова ли диффузия к широкому применению?
Реализация диффузии испытывает трудности с короткими промптами и может выдавать нестабильный результат.
За чем следить дальше
- Исследования масштабирования: смогут ли более крупные диффузионные модели сократить разрыв в возможностях, сохранив при этом скорость?
- Оптимизация оборудования: по мере развития GPU баланс между вычислительно сложными шагами диффузии и зависимыми от весов авторегрессионными методами может снова измениться.
- Алгоритмы маршрутизации: первые прототипы маршрутизаторов моделей, учитывающих тип задачи, покажут, насколько можно сократить общую задержку системы за счет динамического выбора.
Итог
DiffusionGemma доказывает, что переосмысление фундаментального цикла генерации может резко снизить задержку без добавления новых чипов. Эта технология не является полной заменой авторегрессионным моделям, но она предлагает мощный инструмент для гибридного стека ИИ, где скорость и точность балансируются в зависимости от конкретной задачи. Следующее поколение ИИ-инфраструктуры, вероятно, будет оцениваться не только по размеру модели, но и по тому, насколько эффективно она распределяет задачи между подходящими типами «движков».
