DiffusionGemma-26B-A4B-it: диффузионный подход к генерации текста и рекордная скорость инференса

~ 2 мин


Что такое DiffusionGemma и почему это важно

Google DeepMind представила DiffusionGemma — экспериментальную открытую языковую модель на 26 миллиардов параметров, в которой впервые в линейке Gemma применяется не авторегрессионный, а диффузионный механизм генерации текста. Вместо того чтобы выдавать по одному токену за шаг, модель формирует целые блоки по 256 токенов за один прямой проход, итеративно «очищая» шум в осмысленный текст.

Практический результат: скорость генерации вырастает в четыре раза по сравнению с классическими аналогами — более 1000 токенов/с на одном NVIDIA H100 и более 700 токенов/с на потребительской GeForce RTX 5090. Веса модели опубликованы на Hugging Face под лицензией Apache 2.0.


Архитектура: MoE и двунаправленное внимание

DiffusionGemma-26B-A4B-it построена по схеме Mixture of Experts (MoE). Суммарное число параметров — 26 млрд, однако при инференсе активируется только 3,8 млрд, что существенно снижает вычислительную нагрузку. После квантования модель требует около 18 ГБ видеопамяти — в рамках возможностей современных топовых потребительских видеокарт и большинства профессиональных ускорителей.

Принцип работы отличается от стандартных трансформеров:

  • Генерация стартует с последовательности случайных токенов.
  • Несколько итераций «очистки»: правильные токены фиксируются и становятся контекстом для корректировки остальных.
  • В финале получается готовый блок из 256 токенов.

Ключевая особенность — двунаправленное внимание: каждый токен одновременно видит все остальные токены в окне. Это открывает возможности там, где линейная авторегрессия неудобна: редактирование кода, математические выражения, аминокислотные последовательности, нелинейные текстовые структуры с перекрёстными зависимостями.


Скорость инференса: данные по ускорителям

Сравнение по основным платформам:

Ускоритель Скорость генерации
NVIDIA H100 > 1000 токенов/с
GeForce RTX 5090 > 700 токенов/с

Прирост обусловлен смещением нагрузки с пропускной способности памяти на вычислительные блоки. Классические авторегрессионные LLM вынуждены каждый раз загружать веса при генерации нового токена, создавая узкое место по памяти. DiffusionGemma обрабатывает целый блок за один проход, максимально задействуя тензорные ядра ускорителя.

Важное уточнение, которое Google указывает в документации: преимущество в скорости наиболее заметно при локальном развёртывании на одном ускорителе с небольшим батчем. В облачных системах с высоким параллелизмом авторегрессионные модели по-прежнему выигрывают за счёт эффективной утилизации нескольких GPU.


Качество и сценарии применения

Google открыто сообщает: по качеству текста DiffusionGemma пока уступает стандартной Gemma 4. Это осознанный компромисс в пользу скорости отклика. Модель ориентирована на задачи, где интерактивность важнее абсолютной точности:

  • Редакторы кода с мгновенным автодополнением и inline-подсказками.
  • Коллаборативная работа в режиме реального времени.
  • Быстрая черновая генерация и итерирование текста.
  • Задачи с нелинейной структурой выходных данных.

Встроенный механизм итеративной самокоррекции частично компенсирует разрыв с авторегрессионными моделями: поскольку вся последовательность видна сразу, ошибки исправляются в пределах одного блока. Файнтюн под узкую предметную область способен дополнительно приблизить качество к уровню специализированных решений.


Инструменты и фреймворки

Для работы с DiffusionGemma-26B-A4B-it поддерживаются следующие инструменты:

  • Hugging Face Transformers — стандартный Python-интерфейс для загрузки и инференса.
  • vLLM — официальная поддержка через Red Hat.
  • MLX — локальный запуск на Apple Silicon.
  • llama.cpp — поддержка анонсирована, релиз ожидается.

Для тонкой настройки Google выпустила руководство по файнтюну с применением Hackable Diffusion — модульного JAX-инструментария с упором на компонуемость. Оптимизация под NVIDIA включает:

  • 4-битное квантование NVFP4 — ускорение без значимых потерь точности.
  • Тестирование на потребительских GeForce RTX 5090 и RTX 4090.
  • Оптимизацию под корпоративные ускорители серий Hopper и Blackwell.
  • Совместимость с системами DGX Spark, DGX Station и RTX PRO.

Требования к оборудованию

Для локального запуска DiffusionGemma-26B-A4B-it с применением NVFP4-квантования минимальные требования следующие:

  • Видеопамять: от 18 ГБ.
  • Архитектура GPU: NVIDIA Ampere и новее (RTX 3090, RTX 4090, RTX 5090; профессиональные A/H-серии).
  • Оперативная память: достаточный объём для загрузки весов.
  • Хранилище: быстрый NVMe для сокращения времени инициализации модели.

В каталоге СервакМастер представлены серверные платформы и рабочие станции с поддержкой NVIDIA H100, A100, RTX 4090 и RTX 5090, подходящие для развёртывания диффузионных и авторегрессионных языковых моделей. Для консультации по подбору конфигурации — обращайтесь к нашим специалистам.


Итоги

DiffusionGemma-26B-A4B-it — первый масштабный перенос диффузионной парадигмы с изображений на текст в линейке Gemma, и эксперимент дал измеримый результат: свыше 1000 токенов/с на H100 и более 700 токенов/с на RTX 5090 при 4-кратном отрыве от классических LLM сопоставимого класса. Модель не вытесняет авторегрессионные решения в задачах с жёсткими требованиями к точности, однако занимает отдельную нишу — мгновенная интерактивность, нелинейные структуры, быстрое прототипирование. Открытая лицензия Apache 2.0 и глубокая интеграция с экосистемой NVIDIA делают её готовым инструментом как для исследований, так и для продакшн-сценариев с акцентом на низкую латентность.