Moonshot AI Lança 𝑨𝒕𝒕𝒆𝒏𝒕𝒊𝒐𝒏 𝑹𝒆𝒔𝒊𝒅𝒖𝒂𝒍𝒔 para Substituir a Mistura Residual Fixa por…

Conexões residuais são uma das partes menos questionadas do design moderno de Transformers. Em arquiteturas PreNorm, cada camada adiciona sua saída de volta a um estado oculto em execução, o que mantém a otimização estável e permite o treinamento de modelos profundos. Pesquisadores da Moonshot AI argumentam que esse mecanismo padrão também introduz um problema estrutural: todas as saídas de camadas anteriores são acumuladas com pesos unitários fixos, o que faz com que a magnitude do estado oculto cresça com a profundidade e enfraqueça progressivamente a contribuição de qualquer camada individual. A equipe de pesquisa propõe Attention Residuals (AttnRes) como um substituto direto para a acumulação residual padrão. Em vez de forçar cada camada a consumir o mesmo fluxo residual uniformemente misturado, o AttnRes permite que cada camada agregue representações anteriores usando atenção softmax sobre a profundidade. A entrada para a camada (l) é uma soma ponderada do embedding do token e das saídas das camadas anteriores, onde os pesos são calculados sobre posições de profundidade anteriores, em vez de posições de sequência. A ideia central é simples: se a atenção melhorou a modelagem de sequência substituindo a recorrência fixa ao longo do tempo, uma ideia semelhante pode ser aplicada à dimensão de profundidade de uma rede. https://github.com/MoonshotAI/Attention-Residuals/tree/master?tab=readme-ov-file Por Que os Resíduos Padrão Se Tornam um Gargalo A equipe de pesquisa identificou três problemas com a acumulação residual padrão. Primeiro, não há acesso seletivo: todas as camadas recebem o mesmo estado agregado, embora as camadas de atenção e as camadas feed-forward ou MoE possam se beneficiar de diferentes misturas de informações anteriores. Segundo, há perda irreversível: uma vez que a informação é misturada em um único fluxo residual, as camadas posteriores não podem recuperar seletivamente representações anteriores específicas. Terceiro, há crescimento da saída: camadas mais profundas tendem a produzir saídas maiores para permanecerem influentes dentro de um estado acumulado em constante crescimento, o que pode desestabilizar o treinamento. Esta é a principal formulação da equipe de pesquisa: os resíduos padrão se comportam como uma recorrência compactada sobre as camadas. O AttnRes substitui essa recorrência fixa por atenção explícita sobre as saídas das camadas anteriores. Full AttnRes: Atenção Sobre Todas as Camadas Anteriores Em Full AttnRes, cada camada calcula pesos de atenção sobre todas as fontes de profundidade precedentes. O projeto padrão não usa uma consulta condicionada à entrada. Em vez disso, cada camada tem um vetor de pseudo-consulta aprendido específico da camada w l ∈ R d , enquanto as chaves e os valores vêm do embedding do token e das saídas das camadas anteriores após

Fonte: MarkTechPost

Publicado em 2026-03-16

Notícias relacionadas

Continue explorando