Escalando a Inferência de LLMs: Inovações em Paralelismo de Tensorial, Paralelismo de Contexto e Pa…

Na Meta, estamos constantemente expandindo os limites dos sistemas de inferência de LLM para alimentar aplicações como o Meta AI App. Estamos compartilhando como desenvolvemos e implementamos técnicas avançadas de paralelismo para otimizar métricas de desempenho chave relacionadas à eficiência de recursos, throughput e latência. A rápida evolução dos grandes modelos de linguagem (LLMs) inaugurou uma nova era de aplicações impulsionadas por AI, desde agentes conversacionais até a geração avançada de conteúdo. No entanto, implantar esses modelos massivos em escala para inferência em tempo real apresenta desafios significativos, particularmente na obtenção de alto throughput, baixa latência e melhor eficiência de recursos. Nosso objetivo principal é otimizar as principais métricas de desempenho: Eficiência de recursos: Maximizar a utilização da GPU para melhorar a eficiência operacional. Throughput (consultas/s): Atender mais usuários processando um volume maior de requisições. Latência: Minimizar os tempos de resposta para uma experiência de usuário perfeita. Isso inclui: Tempo para o primeiro token (TTFT) para preenchimento (prefill): O tempo que leva para a primeira parte da resposta aparecer, idealmente abaixo de 350ms. Tempo para o token incremental (TTIT) para decodificação: A latência entre palavras subsequentes, visando menos de 25ms. Essas métricas destacam as distintas demandas computacionais da inferência de LLM: O preenchimento (prefill) é intensivo em computação, enquanto a decodificação é intensiva em largura de banda de memória. Para enfrentar esses desafios e possibilitar a implantação de grandes modelos, desenvolvemos e implementamos técnicas avançadas de paralelismo. Os Dois Estágios da Inferência de LLM Uma típica tarefa de inferência generativa de LLM se desenrola em dois estágios: Estágio de preenchimento (Prefill): Este estágio processa o prompt de entrada (que pode ter milhares de tokens) para gerar um cache de chave-valor (KV) para cada camada de transformador do LLM. O preenchimento (Prefill) é limitado pela computação, porque o mecanismo de atenção escala quadraticamente com o comprimento da sequência. Estágio de Decodificação: Este estágio utiliza e atualiza incrementalmente o cache KV para gerar tokens (palavras) um por um. A decodificação é limitada pela memória, pois

Fonte: Meta Engineering - AI Research

Publicado em 2025-10-17

Notícias relacionadas

Continue explorando