Lar
Google e NVIDIA tornam o DiffusionGemma de código aberto, acelerando a inferência com uma única placa em 4 vezes
Em 10 de junho de 2026, o Google lançou o DiffusionGemma, um modelo de linguagem experimental de código aberto que rompe com o paradigma autorregressivo tradicional de geração de texto, palavra por palavra. Ele é pioneiro no uso de mecanismos de difusão da IA de imagens na geração de texto, partindo de ruído aleatório e refinando-se iterativamente para produzir blocos de 256 tokens em paralelo a cada etapa.

Em termos de desempenho de hardware, as otimizações profundas da NVIDIA permitem que o modelo seja executado quase quatro vezes mais rápido do que modelos tradicionais comparáveis no modo de usuário único com uma única GPU. Em uma GPU H100, ele atinge velocidades de saída de até 1.000 tokens por segundo para uma única solicitação e, mesmo em GPUs de consumo de ponta, como a RTX 5090, pode ultrapassar 700 tokens por segundo.
O DiffusionGemma possui 26 bilhões de parâmetros e utiliza uma arquitetura de mistura de especialistas (MoE), ativando apenas 3,8 bilhões de parâmetros por etapa. Embora sua qualidade e precisão na geração de texto fiquem ligeiramente atrás dos modelos tradicionais da série Gemma4 em benchmarks padrão, sua exclusiva “consciência de bloco completo” supera a limitação de processamento apenas retroativo dos modelos autorregressivos. Como todos os tokens podem fazer referência uns aos outros durante a geração, ele se destaca em tarefas que envolvem dados não lineares e estruturados, como preenchimento de texto, preenchimento de código, resolução de Sudoku e processamento de sequências de aminoácidos.

Os pesos do modelo agora estão disponíveis em código aberto no Hugging Face sob a licença Apache 2.0 e funcionam perfeitamente com estruturas de inferência convencionais, como vLLM e MLX. Essa exploração não apenas elimina as restrições de largura de banda de memória no poder de computação da GPU, mas também abre um novo caminho técnico para futuras aplicações de IA em lógica complexa e geração de texto não linear.
Artigo relacionado
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,
Recomendações de tópicos especiais relacionados
Comentários (0)
Em 10 de junho de 2026, o Google lançou o DiffusionGemma, um modelo de linguagem experimental de código aberto que rompe com o paradigma autorregressivo tradicional de geração de texto, palavra por palavra. Ele é pioneiro no uso de mecanismos de difusão da IA de imagens na geração de texto, partindo de ruído aleatório e refinando-se iterativamente para produzir blocos de 256 tokens em paralelo a cada etapa.

Em termos de desempenho de hardware, as otimizações profundas da NVIDIA permitem que o modelo seja executado quase quatro vezes mais rápido do que modelos tradicionais comparáveis no modo de usuário único com uma única GPU. Em uma GPU H100, ele atinge velocidades de saída de até 1.000 tokens por segundo para uma única solicitação e, mesmo em GPUs de consumo de ponta, como a RTX 5090, pode ultrapassar 700 tokens por segundo.
O DiffusionGemma possui 26 bilhões de parâmetros e utiliza uma arquitetura de mistura de especialistas (MoE), ativando apenas 3,8 bilhões de parâmetros por etapa. Embora sua qualidade e precisão na geração de texto fiquem ligeiramente atrás dos modelos tradicionais da série Gemma4 em benchmarks padrão, sua exclusiva “consciência de bloco completo” supera a limitação de processamento apenas retroativo dos modelos autorregressivos. Como todos os tokens podem fazer referência uns aos outros durante a geração, ele se destaca em tarefas que envolvem dados não lineares e estruturados, como preenchimento de texto, preenchimento de código, resolução de Sudoku e processamento de sequências de aminoácidos.

Os pesos do modelo agora estão disponíveis em código aberto no Hugging Face sob a licença Apache 2.0 e funcionam perfeitamente com estruturas de inferência convencionais, como vLLM e MLX. Essa exploração não apenas elimina as restrições de largura de banda de memória no poder de computação da GPU, mas também abre um novo caminho técnico para futuras aplicações de IA em lógica complexa e geração de texto não linear.
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
MiniMax Lança Programa de Equipes 10x para Incentivar Especialistas Globais em IA
A MiniMax (Xiyu Technology), o Laboratório de Inteligência Artificial Geral, lançou oficialmente o "Equipe 10x", uma iniciativa global de colaboração de talentos. Este programa visa recrutar os melhores especialistas de diversos setores para explorar
A Coreia do Sul inicia a construção do Centro Nacional de Computação em IA, investindo 2,5 trilhões de won com meta para 2028
O outlet sul-coreano EtNews relata que a cerimônia de lançamento da pedra fundamental do Centro de Computação em IA da Coreia (KOACC) ocorreu em 3 de agosto no parque de data centers Solar City, em Sunan, Jeollanam-do. Com um investimento total de 2,











