Equipe Qwen lança FlashQLA: uma biblioteca de kernel de Atenção Linear de Alta Performance que alca…

A corrida para tornar os LLMs mais rápidos e baratos de executar tem sido travada principalmente em dois níveis: a arquitetura do modelo e o hardware. Mas há uma terceira fronteira, muitas vezes subestimada — o kernel da GPU. Um kernel é a rotina computacional de baixo nível que realmente executa uma operação matemática na GPU. Escrever um bom kernel exige entender não apenas a matemática, mas também o layout exato da memória, o agendamento de instruções e as peculiaridades do hardware do chip que você está visando. A maioria dos profissionais de ML nunca escreve kernels diretamente; eles dependem de bibliotecas como FlashAttention ou Triton para fazer isso por eles. Apresentamos o FlashQLA: uma contribuição da QwenLM para esta camada. Lançado sob a Licença MIT e construído com base na estrutura do compilador TileLang, é uma biblioteca de kernel de atenção linear de alta performance especificamente otimizada para o mecanismo de atenção Gated Delta Network (GDN) — a arquitetura de atenção linear que alimenta as famílias de modelos Qwen3.5 e Qwen3.6. O que é Atenção Linear e Por Que É Importante? Para entender o que o FlashQLA resolve, ajuda a entender o custo da atenção softmax padrão. Em um Transformer convencional, o mecanismo de atenção tem complexidade O(n²) — o que significa que duplicar o comprimento da sequência quadruplica a computação. Este é o gargalo fundamental que torna o processamento de documentos longos, arquivos de código longos ou conversas longas caro. A atenção linear substitui o softmax por uma formulação que reduz isso para complexidade O(n), tornando-o muito mais favorável em relação ao comprimento da sequência. O Gated Delta Network (GDN) é um desses mecanismos de atenção linear, e foi integrado à arquitetura de modelo híbrido da Qwen, onde camadas GDN alternam com camadas de atenção completa padrão. Este design híbrido tenta obter o melhor dos dois mundos: a expressividade da atenção completa onde é mais necessária, e a eficiência da atenção linear em todos os outros lugares. O GDN usa o que é chamado de formulação 'gated' — ele aplica um gate de decaimento exponencial para controlar quanto contexto passado é carregado para frente. Este gate é fundamental para como o FlashQLA alcança seus ganhos de desempenho. O Problema com Kernels Existentes Antes do FlashQLA, a implementação padrão para operações GDN vinha da biblioteca Flash Linear Attention (FLA), que usa kernels Triton — Triton sendo a linguagem de programação de GPU baseada em Python da OpenAI. Embora o Triton torne a autoria de kernels mais acessível, ele vem com trade-offs: os kernels que ele produz são

Fonte: MarkTechPost

Publicado em 2026-04-29

Notícias relacionadas

Continue explorando