NVIDIA Acelera o DiffusionGemma do Google DeepMind para IA Local

Hoje, o Google DeepMind lançou o DiffusionGemma — um modelo experimental aberto construído para geração de texto excepcionalmente rápida. A NVIDIA otimizou o DiffusionGemma para rodar ainda mais rápido em GPUs NVIDIA GeForce RTX, na plataforma NVIDIA RTX PRO e nos sistemas NVIDIA DGX Spark, de PCs locais à nuvem. Em vez de gerar texto palavra por palavra, o DiffusionGemma gera múltiplas palavras em paralelo para produzir blocos inteiros de texto, abrindo uma nova fronteira de baixa latência para o tipo de cargas de trabalho de usuário único que desenvolvedores, pesquisadores e entusiastas de AI executam todos os dias. Os recursos do novo modelo incluem: Geração paralela: O DiffusionGemma “denoisa” até 256 tokens por etapa em vez de prever um por vez. Construído sobre o Gemma 4: O DiffusionGemma é construído sobre o Gemma 4, um modelo de mistura de especialistas com 26 bilhões de parâmetros que ativa apenas 3,8 bilhões de parâmetros por etapa, combinando uma cabeça de difusão com a arquitetura Gemma 4 do Google. Desempenho até 4x mais rápido: O aumento significa uma geração de texto rápida, onde a geração de usuário único geralmente trava — em hardware local. Aberto e local: O DiffusionGemma é de pesos abertos sob uma licença permissiva Apache 2.0 e roda inteiramente em RTX e DGX Spark — sem nuvem, sem custo por token — com suporte zero day no Hugging Face Transformers, vLLM e Unsloth. Uma Maneira Diferente de Gerar Texto Quase todo Large Language Model (LLM) em uso atualmente é autorregressivo — o que significa que ele gera texto um token por vez, com cada nova palavra dependendo da anterior. Esse processo sequencial é o que faz a AI interativa parecer que está digitando. O DiffusionGemma adota um caminho diferente. Construído sobre a arquitetura de mistura de especialistas Gemma 4 26B, ele gera texto da mesma forma que os modelos de difusão geram imagens: começando do ruído e refinando um bloco inteiro de texto de uma vez. Cada etapa “denoisa” até 256 tokens em paralelo, em vez de emitir um único token e esperar para calcular o próximo. O resultado é um modelo que pensa em blocos em vez de sequencialmente. Para baixa latência,

Fonte: NVIDIA AI Blog

Publicado em 2026-06-10

Notícias relacionadas

Continue explorando