DeepMind представила цього тижня DiffusionGemma — мовну модель із відкритими вагами, яка здатна генерувати приблизно 1500 токенів на секунду на одному графічному процесорі H100, тоді як стандартна модель Gemma 4 досягає максимуму близько 303 токенів на секунду. Таке прискорення є важливим, оскільки воно може зменшити вузьке місце у вигляді затримки, що сповільнює ШІ-агентів у застосунках реального часу.

Як DiffusionGemma долає звичку генерації по одному токену

Більшість сучасних мовних моделей генерують текст авторегресивно: вони передбачають один токен, подають його назад у модель, а потім передбачають наступний. Цей цикл «зліва направо» створює тісний зв'язок між обчисленнями та пам'яттю, оскільки для кожного окремого токена необхідно звертатися до ваг моделі. DiffusionGemma замінює цей цикл дискретним дифузійним процесом, який розглядає блок із 256 токенів як єдиний масив зашумлених даних. Потім модель проводить денойзинг усього блоку паралельно, переносячи навантаження зі повторюваних звернень до ваг на більший обсяг обчислень за один крок. На обладнанні, що спеціалізується на паралельних математичних операціях, такому як Nvidia H100, цей компроміс виправдовує себе.

Чому швидкість має значення для ШІ-агентів

Автономні агенти зазвичай виконують цикл пошуку, узагальнення та тестування. Кожен крок може включати кілька викликів моделі, тому будь-яка затримка на рівні окремого токена швидко накопичується. Коли модель гальмує, увесь конвеєр агента зупиняється, що підвищує витрати та погіршує користувацький досвід.

Компроміс у продуктивності

Швидкість DiffusionGemma має відчутну ціну у вигляді чистих можливостей. У бенчмарку AIME — наборі тестів, що вимірює міркування, фактологічну точність та розуміння мови — DiffusionGemma набирає 69,1 балів, тоді як Gemma 4 досягає 88,3. Дифузійний підхід також демонструє слабкість у дуже коротких відповідях та періодичне «заїкання» токенів, коли згенерований текст повторюється або вагається. Коли модель запитують одночасно понад 32 користувачі, перевага паралелізму нівелюється, і стандартний авторегресійний метод наздоганяє її за загальною пропускною здатністю.

Де застосовується кожен підхід

Дані вказують на стратегію гібридного розгортання:

  • Дифузійні моделі для завдань із низькою одночасністю запитів та чутливістю до затримки, які не потребують глибоких міркувань — наприклад, генерація коротких підказок, заповнення шаблонів або створення чернеток тексту.
  • Авторегресійні моделі для навантажень із високою одночасністю запитів, складних міркувань або генерації довгих текстів, де точність важливіша за чисту швидкість.

Що цей перехід означає для ШІ-інфраструктури

Якщо прискорення можна отримати шляхом переосмислення алгоритму генерації, а не просто шляхом масштабування розміру моделі, то найбільші виграші в ефективності можуть прийти від покращення «внутрішніх механізмів». Цей компроміс також означає, що розробники мають погодитися на незначне зниження якості для певних сценаріїв використання.

Контраргумент: чи готова дифузія до широкого використання?

Реалізація дифузії має труднощі з короткими підказками та може створювати нестабільний результат.

На що варто звернути увагу далі

  • Дослідження масштабування: чи зможуть більші дифузійні моделі подолати розрив у можливостях, зберігаючи швидкість?
  • Оптимізація апаратного забезпечення: у міру розвитку GPU баланс між обчислювально важкими дифузійними кроками та вагово-залежною авторегресією може знову зміститися.
  • Алгоритми маршрутизації: перші прототипи розумних маршрутизаторів моделей, що враховують завдання, покажуть, наскільки можна скоротити загальну затримку системи за допомогою динамічного вибору.

Висновок

DiffusionGemma доводить, що переосмислення фундаментального циклу генерації може різко скоротити затримку без додавання нових чипів. Ця технологія не є повною заміною авторегресійним моделям, але вона пропонує потужний інструмент для гібридного ШІ-стека, де швидкість і точність збалансовані залежно від конкретного завдання. Наступна хвиля ШІ-інфраструктури, ймовірно, оцінюватиметься не лише за розміром моделі, а й за тим, наскільки розумно вона спрямовує роботу через відповідний тип механізму.