A trajetória atual da IA generativa depende fortemente dos Latent Diffusion Models (LDMs) para gerenciar o custo computacional da síntese de alta resolução. Ao comprimir dados em um espaço latente de menor dimensão, os modelos podem escalar efetivamente. No entanto, persiste um trade-off fundamental: menor densidade de informação torna os latentes mais fáceis de aprender, mas sacrifica a qualidade da reconstrução, enquanto maior densidade permite uma reconstrução quase perfeita, mas exige maior capacidade de modelagem. Pesquisadores do Google DeepMind introduziram os Latentes Unificados (UL), um framework projetado para navegar sistematicamente por esse trade-off. O framework regulariza conjuntamente as representações latentes com um prior de difusão e as decodifica via um modelo de difusão. https://arxiv.org/pdf/2602.17270 A Arquitetura: Três Pilares dos Latentes Unificados O framework Latentes Unificados (UL) baseia-se em três componentes técnicos específicos: Codificação de Ruído Gaussiano Fixo: Diferente dos Variational Autoencoders (VAEs) padrão que aprendem uma distribuição de codificador, o UL usa um codificador determinístico E 𝝷 que prevê um único latente z clean. Este latente é então ruidificado para um log-signal-to-noise ratio (log-SNR) final de λ(0)=5. Alinhamento Prior: O modelo de difusão prior é alinhado com este nível mínimo de ruído. Esse alinhamento permite que o termo Kullback-Leibler (KL) no Evidence Lower Bound (ELBO) se reduza a um simples Mean Squared Error (MSE) ponderado sobre os níveis de ruído. ELBO do Decodificador Re-ponderado: O decodificador utiliza uma perda ponderada por sigmoide, que fornece um limite interpretável na taxa de bits latente, permitindo que o modelo priorize diferentes níveis de ruído. O Processo de Treinamento em Duas Etapas O framework UL é implementado em duas etapas distintas para otimizar tanto o aprendizado latente quanto a qualidade da geração. Etapa 1: Aprendizado Latente Conjunto Na primeira etapa, o codificador, o prior de difusão (P 𝝷 ) e o decodificador de difusão (D 𝝷 ) são treinados conjuntamente. O objetivo é aprender latentes que são simultaneamente codificados, regularizados e modelados. O ruído de saída do codificador está diretamente ligado ao nível mínimo de ruído do prior, fornecendo um limite superior apertado na taxa de bits latente. Etapa 2: Escalonamento do Modelo Base A equipe de pesquisa descobriu que um prior treinado apenas com uma perda ELBO na Etapa 1 não produz amostras ótimas porque pondera o conteúdo de baixa frequência e alta frequência igualmente. Consequentemente, na Etapa 2, o codificador e o decodificador são congelados. Um novo 'modelo base' é então treinado nos latentes usando uma ponderação sigmoide.
Fonte: MarkTechPost
Publicado em 2026-02-28