Treinamento GEM: Como a Meta Dobrou a Eficiência de Seu Modelo de Base de Anúncios em Escala LLM

O Generative Ads Recommendation Model (GEM) da Meta, o modelo de base por trás das recomendações de anúncios no Instagram e Facebook, agora treina em escala LLM em milhares das GPUs de última geração. Esta publicação detalha como conseguimos: dobrar a eficiência de treinamento de ponta a ponta (E2E) para 20–25% de Utilização de FLOPs do Modelo (MFU) enquanto escalávamos os FLOPs de treinamento em 4x em 12 meses, codesenhando kernels, precisão, paralelismo, redes e memória em conjunto. O treinamento do GEM apresenta desafios de engenharia únicos na interseção de sistemas de recomendação e LLMs, pois o modelo combina uma arquitetura híbrida e propriedades de dados de domínio de recomendação que são diferentes das cargas de trabalho típicas de LLM. A infraestrutura de AI otimizada para treinamento de LLM (kernels, paralelismo, receitas de baixa precisão, etc.) não se transfere diretamente, exigindo inovação significativa e codesign de hardware/software para alcançar treinamento em escala LLM para modelos de recomendação de forma eficiente. Abordamos esses desafios por meio de inovações complementares de eficiência computacional e eficiência de escalonamento: Eficiência computacional: Alcançada por meio de uma biblioteca de kernels de recomendação personalizada — Jagged Flash Attention (JFA), Generalized Dot-Product Attention (GDPA), BlockAttention, etc. — e treinamento misto de precisão ultrabaixa (incluindo atenção MXFP8 e MLP) otimizado para cargas de trabalho de recomendação, construído especificamente para explorar a arquitetura das GPUs de última geração. Eficiência de escalonamento: Paralelismo 5D consciente da topologia com coletivos sem Streaming Multiprocessor (SM) — FSDP 2D + Paralelismo de Especialistas para parâmetros densos, combinado com Paralelismo de Modelo 2D Totalmente Fragmentado para parâmetros esparsos — codesenhado com a hierarquia de rede multinível da Meta para reduzir a sobrecarga de comunicação. Os resultados: dobramos a eficiência de treinamento E2E do GEM para 20-25% MFU enquanto escalamos os FLOPs de treinamento totais em 4x nos últimos 12 meses. A Arquitetura do GEM E Seus Desafios de Treinamento Únicos. O GEM é o modelo de base de recomendações central por trás

Fonte: Meta Engineering - AI Research

Publicado em 2026-08-03

Notícias relacionadas

Continue explorando