Google DiffusionGemma: A Revolução da Geração Paralela de Texto

Última atualização: 30/06/2026
autor: Isaac
  • Ele implementa um sistema de transmissão discreta que gera blocos de 256 tokens simultaneamente, em vez de um por um.
  • Ele suporta entradas multimodais de texto, imagem e vídeo, integrando a arquitetura MoE do Gemma 4 para otimizar o desempenho.
  • Atinge velocidades de inferência massivas, ultrapassando 1000 tokens por segundo em hardware compatível, como o NVIDIA H100.
  • Ele introduz um modo avançado de raciocínio e a capacidade de autocorreção graças à sua atenção bidirecional.

Modelo de IA DiffusionGemma

Você provavelmente está acostumado a ver os modelos de linguagem atuais escreverem palavra por palavra, quase como se alguém estivesse digitando em tempo real na sua frente. Bem, o Google DeepMind decidiu que era hora de mudar isso e lançou o novo modelo. DifusãoGemmaUma proposta que rompe completamente com o esquema tradicional, optando por uma velocidade que deixa a concorrência tremendo.

Em vez de seguir uma linha sequencial, este modelo baseia-se no conceito de difusão discretaImagine que, em vez de escrever uma frase letra por letra, a IA gerasse um rascunho completo de um parágrafo e o aprimorasse em milissegundos até que ficasse perfeito. Essa arquitetura, construída sobre a base de Gema 4 E seu sistema de Mistura de Especialistas (MoE) permite que a geração de conteúdo seja fluida e absurdamente rápida.

Uma mudança de paradigma: da máquina de escrever à prensa tipográfica.

Arquitetura de geração de texto

Para entender onde reside a mágica, é preciso compreender o problema dos modelos autorregressivos padrão. Estes geralmente sofrem com um gargalo de largura de banda de memória, já que o processador precisa carregar os pesos do modelo repetidamente para cada token. DiffusionGemma resolve isso Mudando o foco para computação pura, aproveitando ao máximo os núcleos tensores das GPUs modernas.

  PwC lança serviço pioneiro para verificar a confiabilidade dos sistemas de IA

O processo é baseado no que eles chamam de tela de tokenO modelo não prevê o próximo token; em vez disso, ele gera um bloco de 256 posições simultaneamente. Ele começa com ruído aleatório e, por meio de várias passagens de remoção de ruído, os tokens começam a fazer sentido. É literalmente como se o modelo... Imprima as informações. em uma impressora em vez de usar uma máquina de escrever.

Uma das vantagens mais incríveis deste sistema é a atenção bidirecionalEnquanto os modelos normais apenas analisam o passado, o DiffusionGemma analisa o bloco inteiro de uma só vez. Isso significa que ele pode detectar erros e corrigi-los Em tempo real, antes de apresentar a resposta final, algo que é ouro puro para tarefas complexas onde o contexto global é fundamental.

Capacidades multimodais e eficiência do Ministério da Educação

Não nos limitamos apenas a texto. Este modelo é verdadeiramente multimodal e completo. Ele pode processar imagens com resolução variávelAnalise vídeos (até 60 segundos a um quadro por segundo) e combine tudo isso com texto em um único comando. Desde a leitura de PDFs complexos até a execução de OCR avançado, Compreendendo interfaces de usuárioO modelo se adapta à tarefa de acordo com o orçamento alocado de tokens visuais.

Tecnicamente, depende de uma arquitetura. Mistura de Especialistas (MoE) de 26 trilhões de parâmetros, embora ative apenas cerca de 4 trilhões durante a inferência. Isso permite que o modelo tenha uma capacidade de raciocínio profunda, mas com uma consumo de memória muito baixopermitindo que ele seja executado localmente em hardware com cerca de 18 GB de VRAM, caso sejam utilizadas versões quantizadas.

  Programa Carlota AI: Tecnologia para economia de água no interior do México

Além disso, inclui um Modo de raciocínio (Modo de pensamento) Muito poderoso. Usando tokens específicos, o modelo consegue executar um processo de raciocínio interno passo a passo antes de fornecer a resposta final, melhorando drasticamente a precisão em problemas de lógica, programação e matemática.

Desempenho bruto e implementação técnica

Em termos de números, o DiffusionGemma é uma verdadeira fera. Em ambientes com uma NVIDIA H100, ele é capaz de superar... 1100 fichas por segundo Em configurações de lotes pequenos, é cinco vezes mais rápido que os modelos autorregressivos convencionais. Mesmo em hardware mais comum, como uma RTX 6000, velocidades de pico acima de [valor ausente] foram registradas. 2000 fichas/s Graças à otimização do vLLM e do llama.cpp.

Para os desenvolvedores, o modelo é muito versátil. Ele suporta uma janela de contexto de até 256 mil tokens e é nativamente multilíngue, tendo recebido treinamento em mais de 140 idiomas. Além disso, possui suporte para o chamada de funçãoIsso facilita a criação de agentes de IA que podem interagir com ferramentas externas de forma estruturada.

O fluxo de trabalho é dividido em duas fases: a fase de pré-enchimentoonde o codificador processa a entrada e cria o cache KV, e o fase de redução de ruídoonde o decodificador refina a tela de tokens. Essa alternância permite que o modelo mantenha a estabilidade dos modelos tradicionais, mas com a velocidade de difusão.

Guia de implementação e melhores práticas

Para obter o máximo desempenho deste modelo, ajustar apenas a temperatura não é suficiente. É essencial usar um amostrador de difusão com limite de entropiaO sistema deve parar de forma adaptativa quando a previsão se tornar estável e a entropia cair abaixo de um limite muito baixo (0.005), evitando que a IA perca tempo em etapas de refinamento desnecessárias.

  A Amazon está preparando seu retorno ao mercado mobile com um novo smartphone focado em Alexa e inteligência artificial.

Em relação à multimodalidade, a recomendação é Coloque as imagens antes do texto. no prompt para otimizar o processamento. Dependendo da tarefa, o orçamento de tokens visuais pode ser ajustado: orçamentos baixos para tarefas rápidas, como marcação de imagens e Altos orçamentos para OCR ou análise documental onde o detalhe é crucial.

Para quem quiser treinar, já existem receitas para SFT (Ajuste Fino Supervisionado) que permitem ao modelo se especializar em tarefas específicas. Um exemplo claro é a resolução de quebra-cabeças Sudoku, onde o modelo base falha, mas após o ajuste fino, ele aprende a usar sua atenção bidirecional para resolver o quebra-cabeça globalmente, reduzindo as etapas de remoção de ruído de 48 para apenas 12.

Esta ferramenta representa um salto qualitativo na democratização da IA ​​de alta velocidade. Como modelo open-weights sob licença Apache 2.0Permite que qualquer desenvolvedor implemente um sistema de geração de texto ultrarrápido, capaz de raciocínio profundo e processamento de múltiplos formatos de entrada sem a necessidade de infraestruturas de nuvem massivas.