As 10 Principais Técnicas de Compressão de KV Cache para Inferência de LLM: Reduzindo a Sobrecarga…

À medida que os grandes modelos de linguagem escalam para janelas de contexto mais longas e atendem a mais usuários simultâneos, o cache chave-valor (KV) emergiu como um gargalo de memória primário em sistemas de inferência de produção. Para um modelo de 30 bilhões de parâmetros com um tamanho de lote de 128 e um comprimento de entrada de 1.024 tokens, o cache KV resultante pode ocupar até 180 GB de memória. Como referência, os parâmetros de um modelo de 7 bilhões de parâmetros consomem 14 GB de memória da GPU, enquanto o cache KV para o mesmo modelo pode exigir cerca de 72 GB. Comprimir o cache KV reduz a pressão da memória, aumenta os tamanhos de lote e melhora diretamente o throughput sem retreinar o modelo base. Nos últimos dois anos, várias estratégias de compressão distintas surgiram da pesquisa. Este artigo detalha as dez mais importantes, com ênfase em como cada uma funciona e onde se encaixa em um pipeline de inferência prático. Evicção de Tokens com H2O (Heavy Hitter Oracle) O H2O, publicado na NeurIPS 2023, é um dos métodos fundamentais de evicção de tokens. Sua observação central é que uma pequena porção de tokens contribui com a maior parte da massa da pontuação de atenção durante a geração e são chamados de Heavy Hitters (H2). O H2O retém dinamicamente um equilíbrio de tokens recentes e tokens H2, mantendo um tamanho fixo de cache KV em todas as camadas do Transformer. O processo de seleção é impulsionado por pontuações de atenção cumulativas, médias em todas as consultas e tokens. A distribuição do peso da atenção segue uma lei de potência, o que significa que a evicção de tokens de baixa pontuação incorre em perda mínima de precisão na prática. O H2O é um método de fase de decodificação e não reduz o cálculo de preenchimento, o que continua sendo uma limitação para prompts de contexto longo. Com 20% de heavy hitters, o H2O melhora o throughput em relação ao Hugging Face Accelerate em até 29× no OPT-6.7B e OPT-30B. StreamingLLM (Retenção de Atenção de Aprofundamento) O StreamingLLM é projetado para cenários onde os LLMs devem lidar com fluxos de entrada muito longos ou infinitos. Sua estratégia é sempre manter os estados KV dos primeiros tokens, que servem como atenção de aprofundamento, e combiná-los com uma janela deslizante dos tokens mais recentes até o orçamento de memória disponível. A percepção é que os tokens iniciais, independentemente de seu conteúdo semântico, funcionam como âncoras estruturais que recebem atenção desproporcionalmente alta durante toda a geração. Descartá-los causa uma degradação significativa da precisão, enquanto preservá-los junto com uma janela de recência estabiliza as saídas. O StreamingLLM é rápido e amigável ao hardware, mas não usa pontuação de importância, o que significa que ele pode se

Fonte: MarkTechPost

Publicado em 2026-04-29

Notícias relacionadas

Continue explorando