Alibaba Qwen Lança Qwen-Image-2.1-Turbo, um Modelo de Imagem de 7B com 8 Passos

A equipe Qwen da Alibaba lançou o Qwen-Image-2.1-Turbo, um checkpoint acelerado de seu modelo de código aberto Qwen-Image-2.1. Ele gera e edita imagens em 8 etapas de denoising, em vez das 40 etapas padrão do modelo base. Para desenvolvedores, isso significa 5x menos etapas de denoising na mesma arquitetura de 7B, além de uma opção de API hospedada. TL;DR Tamanho: 7B parâmetros no gerador visual, pareado com um codificador de texto Qwen3-VL 8B. Roda em: GPUs CUDA em BF16 via Diffusers. A Qwen não publica um mínimo de VRAM para a versão Turbo. A Unsloth estima que o modelo base roda com 11 GB de VRAM com GGUF e 24 GB com INT8/FP8. Desempenho: O mesmo resultado de 2K e conjunto de recursos de edição do Qwen-Image-2.1, em 8 etapas em vez de 40. Melhor: O Qwen-Image-2.1 base pontua 60,28 no Qwen-Image-Bench, a maior pontuação de código aberto que a Qwen relata. Ponto principal (melhor): Geração e edição de 2K em 8 etapas em um único checkpoint aberto. Ponto principal (pior): Licença de pesquisa apenas, portanto, a auto-hospedagem comercial requer permissão separada. O que é o Qwen-Image-2.1-Turbo? Qwen-Image-2.1-Turbo é um checkpoint de geração e edição de imagem de 8 etapas da equipe Qwen da Alibaba. Ele é construído sobre o Qwen-Image-2.1. O Turbo mantém a mesma arquitetura de geração visual de 7B. Ele é carregado diretamente com o QwenImage21Pipeline em Diffusers. O checkpoint vem com sua programação de amostragem recomendada de 8 etapas salva internamente. A geração usa CFG=1 por padrão. O cache KV de prefixo reutiliza o contexto de texto e imagem de referência em todas as etapas de denoising. Como funciona o Qwen-Image-2.1-Turbo? A arquitetura subjacente é um DiT de fluxo único com 32 camadas e 7B parâmetros. Ele usa atenção bloco-causal. Tokens de texto recebem uma máscara causal no nível do token, enquanto as imagens usam uma máscara bidirecional no nível do chunk. Codificador de texto: Qwen3-VL 8B codifica instruções e imagens de condição. VAE: um autoencoder RGBA de 64 canais com compactação espacial de 16x, que permite transparência nativa. Agendador: Flow Matching com agendamento discreto de Euler e deslocamento dinâmico. O design da atenção é o que torna o prefix caching

Fonte: MarkTechPost

Publicado em 2026-10-09

Notícias relacionadas

Continue explorando