
Google DeepMind ha demostrado que un modelo de difusión de texto no necesariamente requiere una nueva ronda de preentrenamiento a gran escala. En un informe técnico cubierto por The Decoder, la compañía describe cómo convirtió el modelo existente Gemma 4-26B-A4B en DiffusionGemma utilizando menos del 10% del presupuesto original de tokens de entrenamiento.
El sistema resultante genera bloques de hasta 256 tokens en paralelo, en lugar de comprometerse con un token a la vez. En una Nvidia H100, Google informa un rendimiento de aproximadamente 1.500 tokens por segundo. La compensación es importante: DiffusionGemma sigue por detrás de su predecesor autorregresivo en la calidad general de los benchmarks, pero el enfoque podría ofrecer a investigadores y equipos de producto una vía más barata para experimentar con la difusión de texto.
Los modelos de lenguaje autorregresivos tradicionales construyen una respuesta de forma secuencial, prediciendo el siguiente token a partir de los tokens ya producidos. DiffusionGemma toma un camino diferente, refinando repetidamente un bloque de texto ruidoso hasta que la salida es utilizable. El método se parece más, en espíritu, a los sistemas de difusión de imágenes, aunque se aplica al lenguaje.
Google DeepMind partió de Gemma 4 en lugar de diseñar y entrenar un modelo nuevo específicamente para difusión. La primera fase de entrenamiento enseñó al modelo a recuperar bloques de texto corruptos. Una segunda fase combinó aprendizaje por refuerzo con destilación de muestreador, un proceso que Google llama SD·RL. El aprendizaje por refuerzo se utilizó para mejorar las respuestas, mientras que la destilación de muestreador redujo el número de pasos de refinamiento necesarios en tiempo de inferencia.
Esa decisión de diseño es la noticia central del informe. Sugiere que un modelo de lenguaje existente puede servir como base para un mecanismo de generación diferente, lo que potencialmente reduce el coste y el tiempo necesarios para explorar arquitecturas alternativas. No demuestra que una adaptación posterior iguale de forma consistente a un modelo entrenado para difusión desde el principio.
El informe señala que SD·RL mejoró en 10 puntos de media los resultados en benchmarks de razonamiento dentro del sistema adaptado, al tiempo que casi cuadruplicó el número de tokens gestionados por paso de cómputo. Según Google, las respuestas de DiffusionGemma también son aproximadamente un 50% más cortas, lo que contribuye aún más a sus afirmaciones de velocidad.
Según se informa, el modelo puede alternar entre la generación al estilo difusión y su modo original palabra por palabra. Esa flexibilidad podría permitir que una aplicación use refinamiento iterativo para tareas estructuradas y decodificación convencional donde la generación secuencial sea más fiable.
Las cifras de rendimiento más sólidas siguen siendo las proporcionadas por el vendedor. The Decoder dice que DiffusionGemma alcanza aproximadamente 1.500 tokens por segundo en una H100 en condiciones de usuario único. La ventaja se reduce a medida que aumenta la concurrencia: con alrededor de 32 solicitudes simultáneas, los modelos de lenguaje estándar supuestamente igualan el rendimiento. Eso hace que el diseño del despliegue sea tan importante como la cifra de velocidad en titular.
El informe de Google identifica varias tareas en las que el refinamiento paralelo podría ser útil. En un ejemplo matemático, el modelo de difusión puede desarrollar una respuesta antes de finalizar la salida visible, lo que le permite corregir un error temprano en lugar de añadir una corrección después. El informe también describe un rendimiento en Sudoku cercano al 85% tras un ajuste fino mínimo, mientras que el modelo base supuestamente falla en la tarea.
Las salidas estructuradas pueden ser un caso de uso especialmente práctico. Google afirma que la generación de JSON y la reparación de código pueden completarse en dos o tres pasos de refinamiento cuando gran parte de la estructura final ya está condicionada por la entrada. Estos resultados son prometedores, pero son afirmaciones específicas de la tarea extraídas del informe técnico del modelo y no evaluaciones independientes.
El informe también documenta limitaciones importantes. DiffusionGemma puede caer en bucles de repetición, a veces repitiendo palabras individuales. La fase de entrenamiento del modelo fue relativamente corta, y la etapa SD·RL favoreció menores requisitos de cómputo frente a la máxima calidad. Dado que la arquitectura, los datos y otros ajustes se heredaron de Gemma 4, pueden no ser óptimos para la generación por difusión.
The Decoder informa además que el modelo a veces no logra cerrar su sección de razonamiento en tareas multimodales, lo que reduce las puntuaciones medidas por razones que pueden no reflejar la respuesta subyacente. El rendimiento general sigue por debajo del modelo base autorregresivo, algo que Google atribuye en parte a la estrategia de adaptación y al entrenamiento de seguimiento limitado.
Para los creadores de IA, DiffusionGemma ofrece un punto de partida concreto para la investigación, más que un reemplazo acabado de los modelos de lenguaje convencionales. Los equipos que investigan asistentes de baja latencia, generación restringida o sistemas interactivos podrían probar si el refinamiento paralelo reduce el tiempo de respuesta sin crear problemas inaceptables de repetición o precisión.
La economía dependerá de la forma de la carga de trabajo. Las aplicaciones de usuario único pueden beneficiarse más del rendimiento informado, mientras que los servicios de alta concurrencia pueden ver una ventaja menor. Los equipos también tendrán que medir la latencia total, los pasos de refinamiento, la utilización de aceleradores y las tasas de corrección, en lugar de confiar solo en las cifras de tokens por segundo.
Los flujos de trabajo estructurados parecen encajar más de inmediato con el enfoque que el razonamiento abierto. La producción de JSON, la reparación de código y otras tareas con fuertes restricciones de entrada pueden requerir menos iteraciones de eliminación de ruido. Por el contrario, las aplicaciones que dependen de un razonamiento consistentemente fuerte o de respuestas largas y pulidas podrían preferir el modelo autorregresivo original hasta que el entrenamiento específico para difusión mejore la calidad.
La disponibilidad del modelo bajo Apache 2.0 en Hugging Face reduce la barrera para experimentar. The Decoder informa de que Interfaze ya lo está usando para el reconocimiento de voz multilingüe, mientras que otro proyecto de investigación está explorando la generación interactiva de informes radiológicos. Esas son señales tempranas de adopción, no pruebas de una implantación amplia en producción, y la fuente disponible no ofrece detalles independientes sobre su rendimiento o escala.
La próxima señal importante será si los modelos entrenados específicamente para difusión de texto reducen la brecha de calidad con los sistemas adaptados. Los investigadores también deberían probar DiffusionGemma bajo cargas de trabajo concurrentes realistas y no solo con benchmarks de una sola solicitud.
Una evaluación adicional debería examinar los fallos de repetición, la validez de las salidas estructuradas, la precisión del razonamiento y la energía o el coste por tarea completada. También será útil ver si el ajuste fino especializado produce mejoras fiables en programación, reconocimiento de voz y generación de documentos empresariales.
La demostración previa de Gemini Diffusion de Google indica que la compañía sigue investigando el enfoque, pero DiffusionGemma se describe explícitamente como experimental. Por tanto, el valor del modelo puede medirse menos por el reemplazo inmediato de los modelos de lenguaje estándar y más por la rapidez con la que habilita investigación independiente y adaptaciones específicas.
DiffusionGemma es significativo porque replantea la difusión de texto como un problema de adaptación. Empezar con un modelo establecido hace que la experimentación sea más accesible, pero también expone los límites de reutilizar una arquitectura y una receta de entrenamiento diseñadas para la decodificación secuencial.
Para los equipos de producto, la cuestión práctica no es si la generación paralela es universalmente más rápida. Es si un flujo de trabajo concreto tiene suficiente estructura para beneficiarse de menos pasos de refinamiento sin perder precisión ni fiabilidad de salida. DiffusionGemma ofrece a los desarrolladores una forma de probar esa cuestión con un coste de entrada relativamente bajo, pero su distancia en los benchmarks y sus límites de concurrencia abogan por una evaluación cuidadosa a nivel de carga de trabajo, en lugar de afirmaciones amplias sobre reemplazar modelos autorregresivos.
Google DeepMind adaptó Gemma 4 a DiffusionGemma con una fracción del coste de entrenamiento, a cambio de calidad en los benchmarks por una generación de texto paralela más rápida.