
Google DeepMind показала, что текстовой диффузионной модели не обязательно нужен новый полный цикл предобучения. В техническом отчёте, о котором пишет The Decoder, компания описывает, как она преобразовала существующую Gemma 4-26B-A4B в DiffusionGemma, потратив менее 10% от исходного бюджета обучающих токенов.
Получившаяся система генерирует блоки до 256 токенов параллельно, а не фиксирует по одному токену за раз. На Nvidia H100 Google сообщает о пропускной способности примерно 1 500 токенов в секунду. Компромисс здесь важен: DiffusionGemma по общей качеству бенчмарков всё ещё уступает своему авторегрессионному предшественнику, но этот подход может дать исследователям и продуктовым командам более дешёвый путь к экспериментам с текстовой диффузией.
Традиционные авторегрессионные языковые модели строят ответ последовательно, предсказывая следующий токен по уже сгенерированным токенам. DiffusionGemma идёт другим путём: она многократно уточняет шумный блок текста, пока выход не станет пригодным к использованию. По духу метод ближе к системам диффузии изображений, хотя применяется к языку.
Google DeepMind начала с Gemma 4, а не проектировала и не обучала новую модель специально под диффузию. Первый этап обучения научил модель восстанавливать повреждённые текстовые блоки. Второй этап объединил обучение с подкреплением и дистилляцию сэмплера — процесс, который Google называет SD·RL. Обучение с подкреплением использовалось для улучшения ответов, а дистилляция сэмплера сократила число шагов уточнения, необходимых на этапе инференса.
Это решение по архитектуре — главный новостной вывод отчёта. Оно указывает, что существующая языковая модель может служить основой для иного механизма генерации, потенциально снижая стоимость и время, необходимые для исследования альтернативных архитектур. Однако оно не доказывает, что доработанная модель будет стабильно на уровне модели, обученной для диффузии с самого начала.
В отчёте говорится, что SD·RL в адаптированной системе улучшила результаты по бенчмаркам рассуждений в среднем на 10 пунктов, почти в четыре раза увеличив число токенов, обрабатываемых за один вычислительный шаг. По данным Google, ответы DiffusionGemma также примерно на 50% короче, что дополнительно способствует её скоростным показателям.
Сообщается, что модель может переключаться между генерацией в стиле диффузии и своим исходным режимом «слово за словом». Такая гибкость может позволить приложению использовать итеративное уточнение для структурированных задач и обычное декодирование там, где последовательная генерация надёжнее.
Наиболее сильные показатели производительности по-прежнему исходят от самого вендора. The Decoder пишет, что DiffusionGemma достигает примерно 1 500 токенов в секунду на H100 в условиях одного пользователя. Преимущество уменьшается по мере роста параллельности: при примерно 32 одновременных запросах стандартные языковые модели, как сообщается, догоняют по пропускной способности. Поэтому дизайн развёртывания так же важен, как и броская цифра скорости.
В отчёте Google выделены несколько задач, где параллельное уточнение может быть полезным. В математическом примере диффузионная модель может развить ответ до финализации видимого вывода, что позволяет исправить раннюю ошибку вместо того, чтобы позже добавлять исправление. В отчёте также описывается результат по Sudoku около 85% после минимального дообучения, тогда как базовая модель, как сообщается, задачу проваливает.
Структурированные выходы могут оказаться особенно практичным сценарием использования. Google утверждает, что генерация JSON и исправление кода могут завершаться за два или три шага уточнения, когда большая часть финальной структуры уже задана входом. Эти результаты выглядят многообещающими, но это заявления, специфичные для задач, из технического отчёта модели, а не независимые оценки.
В отчёте также отмечаются важные ограничения. DiffusionGemma может попадать в повторяющиеся циклы, иногда повторяя отдельные слова. Этап обучения модели был относительно коротким, а этап SD·RL отдавал приоритет более низким вычислительным требованиям, а не максимальному качеству. Поскольку архитектура, данные и другие настройки унаследованы от Gemma 4, они могут быть не оптимальны для диффузионной генерации.
The Decoder также сообщает, что модель иногда не завершает секцию рассуждения в мультимодальных задачах, из-за чего измеряемые оценки снижаются по причинам, которые могут не отражать сам ответ. Общая производительность остаётся ниже, чем у базовой авторегрессионной модели, что Google частично объясняет стратегией модернизации и ограниченным последующим обучением.
Для создателей ИИ DiffusionGemma — это конкретная отправная точка для исследований, а не готовая замена обычным языковым моделям. Команды, изучающие ассистентов с низкой задержкой, ограниченную генерацию или интерактивные системы, могут проверить, снижает ли параллельное уточнение время ответа, не создавая неприемлемых проблем с повторением или точностью.
Экономика будет зависеть от характера нагрузки. Приложения для одного пользователя могут получить наибольшую выгоду от заявленной пропускной способности, тогда как сервисы с высокой параллельностью могут увидеть меньший эффект. Командам также придётся измерять общую задержку, число шагов уточнения, загрузку ускорителей и частоту исправлений, а не полагаться только на показатели токенов в секунду.
Структурированные рабочие процессы кажутся более естественно подходящими для этого подхода, чем свободное рассуждение. Генерация JSON, исправление кода и другие задачи с жёсткими ограничениями по входу могут требовать меньше итераций денойзинга. Напротив, приложения, которым постоянно нужны сильные рассуждения или отточенные длинные ответы, могут предпочесть исходную авторегрессионную модель, пока диффузионно-специфическое обучение не повысит качество.
Доступность модели под лицензией Apache 2.0 на Hugging Face снижает барьер для экспериментов. The Decoder сообщает, что Interfaze уже использует её для многоязычного распознавания речи, а другой исследовательский проект изучает интерактивную генерацию радиологических отчётов. Это ранние признаки внедрения, а не доказательство широкого промышленного развёртывания, и доступный источник не даёт независимых деталей о производительности или масштабе.
Следующим важным сигналом станет то, смогут ли модели, обученные специально для текстовой диффузии, сократить разрыв в качестве с модернизированными системами. Исследователям также стоит тестировать DiffusionGemma в реалистичных сценариях с высокой конкуренцией, а не только на бенчмарках одиночных запросов.
Дальнейшая оценка должна охватить сбои повторения, корректность структурированных выходов, точность рассуждений и энергозатраты или стоимость на завершённую задачу. Также будет полезно увидеть, даёт ли специализированное дообучение надёжный прирост в кодинге, распознавании речи и генерации корпоративных документов.
Предыдущая демонстрация Gemini Diffusion от Google показывает, что компания продолжает изучать этот подход, но DiffusionGemma прямо описывается как экспериментальная. Поэтому ценность модели может измеряться не столько немедленной заменой стандартных языковых моделей, сколько тем, как быстро она позволяет проводить независимые исследования и точечные адаптации.
DiffusionGemma важна тем, что переосмысливает текстовую диффузию как задачу адаптации. Старт с уже существующей модели делает эксперименты доступнее, но одновременно выявляет пределы повторного использования архитектуры и схемы обучения, созданных для последовательного декодирования.
Для продуктовых команд практический вопрос не в том, всегда ли параллельная генерация быстрее. Вопрос в том, достаточно ли конкретный рабочий процесс структурирован, чтобы выиграть от меньшего числа шагов уточнения, сохраняя точность и надёжность вывода. DiffusionGemma даёт разработчикам способ проверить это с относительно низким порогом входа, но её отставание по бенчмаркам и ограничения по конкуренции говорят в пользу осторожной оценки на уровне нагрузки, а не широких заявлений о замене авторегрессионных моделей.
Google DeepMind адаптировала Gemma 4 в DiffusionGemma за долю стоимости обучения, пожертвовав качеством в бенчмарках ради более быстрой параллельной генерации текста.