A Nova Arquitetura Híbrida LFM2-24B-A2B da Liquid AI Combina Atenção com Convoluções para Soluciona…

A corrida da IA generativa tem sido, por muito tempo, um jogo de 'quanto maior, melhor'. Mas, à medida que a indústria atinge os limites de consumo de energia e gargalos de memória, a conversa está mudando da contagem de parâmetros brutos para a eficiência arquitetônica. A equipe da Liquid AI está liderando essa mudança com o lançamento do LFM2-24B-A2B, um modelo de 24 bilhões de parâmetros que redefine o que devemos esperar de uma IA capaz de operar em edge devices. https://www.liquid.ai/blog/lfm2-24b-a2b A Arquitetura 'A2B': Uma Proporção de 1:3 para Eficiência O 'A2B' no nome do modelo significa Attention-to-Base. Em um Transformer tradicional, cada camada usa Softmax Attention, que escala quadraticamente (O(N^2)) com o comprimento da sequência. Isso leva a caches KV (Key-Value) massivos que devoram a VRAM. A equipe da Liquid AI contorna isso usando uma estrutura híbrida. As camadas 'Base' são blocos de convolução curta e gateada eficientes, enquanto as camadas 'Attention' utilizam Grouped Query Attention (GQA). Na configuração LFM2-24B-A2B, o modelo usa uma proporção de 1:3:

Total de Camadas: 40

Blocos de Convolução: 30

Blocos de Atenção: 10

Ao intercalar um pequeno número de blocos GQA com a maioria das camadas de convolução gateada, o modelo mantém a recuperação e o raciocínio de alta resolução de um Transformer, ao mesmo tempo em que mantém o pré-preenchimento rápido e o baixo consumo de memória de um modelo de complexidade linear. MoE Esparso: 24B de Inteligência com um Orçamento de 2B O mais importante do LFM2-24B-A2B é seu design Mixture of Experts (MoE). Embora o modelo contenha 24 bilhões de parâmetros, ele ativa apenas 2,3 bilhões de parâmetros por token. Isso muda o jogo para a implantação. Como o caminho de parâmetros ativo é tão enxuto, o modelo pode caber em 32GB de RAM. Isso significa que ele pode rodar localmente em laptops de consumo de ponta, desktops com GPUs integradas (iGPUs) e NPUs dedicadas sem a necessidade de um A100 de nível de data center. Ele efetivamente fornece a densidade de conhecimento de um modelo de 24B com a velocidade de inferência e eficiência energética de um modelo de 2B. https://www.liquid.ai/blog/lfm2-24b-a2b Benchmarks: Superação A equipe da Liquid AI relata que a família LFM2 segue um comportamento de escalonamento previsível e log-linear. Apesar de sua contagem de parâmetros ativos menor, o modelo 24B-A2B supera consistentemente seus rivais maiores. Lógica e Raciocínio: Em testes como GSM8K e MATH-500, ele rivaliza com modelos densos com o dobro de seu tamanho. Throughput: Quando testado em uma única NVIDIA H100 usando vLLM, ele atingiu 26,8K tokens totais por segundo em 1.024 requisições concorrentes,

Fonte: MarkTechPost

Publicado em 2026-02-25

Notícias relacionadas

Continue explorando