Google DiffusionGemma: La Revolución de la Generación de Texto en Paralelo

Última actualización: 30/06/2026
Autor: Isaac
  • Implementa un sistema de difusión discreta que genera bloques de 256 tokens simultáneamente en lugar de hacerlo uno a uno.
  • Soporta entradas multimodales de texto, imagen y vídeo, integrando la arquitectura MoE de Gemma 4 para optimizar el rendimiento.
  • Alcanza velocidades de inferencia masivas, superando los 1000 tokens por segundo en hardware compatible como la NVIDIA H100.
  • Introduce un modo de razonamiento avanzado y la capacidad de autocorregirse gracias a su atención bidireccional.

Modelo de IA DiffusionGemma

Seguro que estás acostumbrado a ver cómo los modelos de lenguaje actuales escriben palabra por palabra, casi como si alguien estuviera tecleando en tiempo real delante de ti. Pues bien, Google DeepMind ha decidido que ya era hora de darle una vuelta a esto y ha lanzado DiffusionGemma, una propuesta que rompe totalmente con el esquema tradicional para apostar por una velocidad que deja temblando a la competencia.

En lugar de seguir la línea secuencial, este modelo se basa en el concepto de difusión discreta. Imagina que, en vez de escribir una frase letra a letra, la IA lanza un borrador completo de un párrafo y lo va puliendo en milisegundos hasta que queda perfecto. Esta arquitectura, construida sobre la base de Gemma 4 y su sistema de Mixture-of-Experts (MoE), permite que la generación de contenido sea fluida y absurdamente rápida.

Un cambio de paradigma: De la máquina de escribir a la imprenta

Arquitectura de generación de texto

Para entender dónde está la magia, hay que comprender el problema de los modelos autoregresivos estándar. Estos suelen sufrir un cuello de botella en el ancho de banda de la memoria, ya que el procesador tiene que cargar los pesos del modelo una y otra vez para cada token. DiffusionGemma soluciona esto trasladando el esfuerzo al cómputo puro, aprovechando al máximo los núcleos tensor de las GPU modernas.

  Hallan un planeta parcialmente habitable a miles de años luz: qué significa y por qué es importante

El proceso se basa en lo que llaman un lienzo de tokens. El modelo no predice el siguiente token, sino que genera un bloque de 256 posiciones simultáneamente. Empieza con un ruido aleatorio y, a través de varias pasadas de denoise o eliminación de ruido, los tokens empiezan a cobrar sentido. Es, literalmente, como si el modelo estampara la información en una imprenta en lugar de usar una máquina de escribir.

Una de las ventajas más bestias de este sistema es la atención bidireccional. Mientras que los modelos normales solo miran hacia atrás, DiffusionGemma analiza todo el bloque a la vez. Esto significa que puede detectar errores y corregirlos sobre la marcha antes de entregar la respuesta final, algo que es oro puro para tareas complejas donde el contexto global es fundamental.

Capacidades multimodales y eficiencia MoE

No nos estamos limitando solo a texto. Este modelo es un auténtico todoterreno multimodal. Puede procesar imágenes con resolución variable, analizar vídeos (hasta 60 segundos a un frame por segundo) y mezclar todo esto con texto en un mismo prompt. Desde leer un PDF complejo o hacer OCR avanzado hasta entender interfaces de usuario, el modelo se adapta a la tarea según el presupuesto de tokens visuales asignado.

Técnicamente, se apoya en una arquitectura Mixture-of-Experts (MoE) de 26 billones de parámetros, aunque solo activa unos 4 billones durante la inferencia. Esto permite que el modelo tenga una capacidad de razonamiento profunda pero con un consumo de memoria muy contenido, permitiendo que se pueda ejecutar localmente en hardware con unos 18 GB de VRAM si se utilizan versiones cuantizadas.

  Nvidia compra Groq por 20 mmdd y dispara la carrera del hardware de IA

Además, incluye un modo de razonamiento (Thinking Mode) muy potente. Mediante tokens específicos, el modelo puede ejecutar un proceso de pensamiento interno paso a paso antes de dar la respuesta definitiva, lo que mejora drásticamente la precisión en problemas de lógica, programación y matemáticas.

Rendimiento bruto y despliegue técnico

Si hablamos de números, DiffusionGemma es una auténtica bestia. En entornos con una NVIDIA H100, es capaz de superar los 1100 tokens por segundo en configuraciones de lotes pequeños, multiplicando por cinco la velocidad de los modelos autoregresivos convencionales. Incluso en hardware más doméstico, como una RTX 6000, se han registrado picos de más de 2000 tokens/s gracias a la optimización de vLLM y llama.cpp.

Para los desarrolladores, el modelo es muy versátil. Soporta una ventana de contexto de hasta 256K tokens y es nativamente multilingüe, habiendo sido entrenado en más de 140 idiomas. Además, cuenta con soporte para el llamado de funciones (function calling), lo que facilita la creación de agentes de IA que puedan interactuar con herramientas externas de forma estructurada.

El flujo de trabajo se divide en dos fases: la fase de prefill, donde el codificador procesa la entrada y crea la caché KV, y la fase de denoise, donde el decodificador refina el lienzo de tokens. Esta alternancia permite que el modelo mantenga la estabilidad de los modelos tradicionales pero con la velocidad de la difusión.

Guía de implementación y buenas prácticas

Para sacar el máximo partido a este modelo, no basta con ajustar la temperatura. Es fundamental utilizar un muestreador de difusión con límite de entropía. El sistema debe detenerse adaptativamente cuando la predicción se vuelve estable y la entropía cae por debajo de un umbral muy bajo (0.005), lo que evita que la IA pierda tiempo en pasos de refinamiento innecesarios.

  Resumir videos de YouTube con IA: guía práctica, funciones y usos

En cuanto a la multimodalidad, la recomendación es colocar las imágenes antes que el texto en el prompt para optimizar el procesamiento. Dependiendo de la tarea, se puede ajustar el presupuesto de tokens visuales: presupuestos bajos para tareas rápidas como el etiquetado de imágenes y presupuestos altos para OCR o análisis de documentos donde el detalle es crítico.

Para quienes quieran entrenarlo, ya existen recetas de SFT (Supervised Fine-Tuning) que permiten especializar al modelo en tareas concretas. Un ejemplo claro es la resolución de Sudokus, donde el modelo base falla, pero tras un ajuste fino, aprende a utilizar su atención bidireccional para resolver el puzzle globalmente, reduciendo los pasos de denoise de 48 a solo 12.

Esta herramienta representa un salto cualitativo en la democratización de la IA de alta velocidad. Al ser un modelo open-weights bajo licencia Apache 2.0, permite que cualquier desarrollador implemente un sistema de generación de texto ultrarrápido, capaz de razonar profundamente y procesar múltiples formatos de entrada sin necesidad de infraestructuras masivas en la nube.