RCCLX: Inovando a Comunicação de GPU em Plataformas AMD

Estamos lançando o código-fonte da versão inicial do RCCLX – uma versão aprimorada do RCCL que desenvolvemos e testamos nas cargas de trabalho internas da Meta. O RCCLX está totalmente integrado ao Torchcomms e visa capacitar pesquisadores e desenvolvedores a acelerar a inovação, independentemente do backend escolhido. Os padrões de comunicação para modelos de IA estão em constante evolução, assim como as capacidades de hardware. Queremos iterar rapidamente em coletivos, transportes e novas funcionalidades em plataformas AMD. Anteriormente, desenvolvemos e lançamos o código-fonte do CTran, uma biblioteca de transporte personalizada na plataforma NVIDIA. Com o RCCLX, integramos o CTran às plataformas AMD, habilitando o AllToAllvDynamic – um coletivo residente na GPU. Embora nem todos os recursos do CTran estejam atualmente integrados à biblioteca RCCLX de código aberto, nosso objetivo é disponibilizá-los nos próximos meses. Nesta postagem, destacamos duas novas funcionalidades – Acesso Direto a Dados (DDA) e Coletivos de Baixa Precisão. Essas funcionalidades proporcionam melhorias significativas de desempenho em plataformas AMD e estamos entusiasmados em compartilhá-las com a comunidade. Acesso Direto a Dados (DDA) – Coletivos Intra-nó Leves A inferência de modelos de linguagem grandes opera através de duas etapas computacionais distintas, cada uma com características de desempenho fundamentalmente diferentes: A etapa de pré-preenchimento processa o prompt de entrada, que pode abranger milhares de tokens, para gerar um cache de chave-valor (KV) para cada camada do transformador do modelo. Esta etapa é limitada pela computação porque o mecanismo de atenção escala quadraticamente com o comprimento da sequência, tornando-a altamente exigente em recursos computacionais da GPU. A etapa de decodificação então utiliza e atualiza incrementalmente o cache KV para gerar tokens um por um. Ao contrário do pré-preenchimento, a decodificação é limitada pela memória, pois o tempo de E/S de leitura da memória domina o tempo de atenção, com os pesos do modelo e o cache KV ocupando a maior parte da memória. O paralelismo de tensor permite que os modelos sejam distribuídos por múltiplas GPUs, fragmentando camadas individuais em menores e independentes

Fonte: Meta Engineering - AI Research

Publicado em 2026-02-24

Notícias relacionadas

Continue explorando