Em sistemas de recomendação industriais, a mudança para a Recuperação Generativa (GR) está substituindo a tradicional busca de vizinhos mais próximos baseada em embeddings por Large Language Models (LLMs). Esses modelos representam itens como Semantic IDs (SIDs) — sequências de tokens discretos — e tratam a recuperação como uma tarefa de decodificação autorregressiva. No entanto, aplicações industriais geralmente exigem adesão estrita à lógica de negócios, como garantir a atualização do conteúdo ou a disponibilidade do estoque. A decodificação autorregressiva padrão não consegue impor nativamente essas restrições, muitas vezes levando o modelo a "alucinar" identificadores de itens inválidos ou fora de estoque. O Gargalo do Acelerador: Tries vs. TPUs/GPUs Para garantir uma saída válida, os desenvolvedores geralmente usam uma árvore de prefixos (trie) para mascarar tokens inválidos durante cada etapa de decodificação. Embora conceitualmente simples, as implementações tradicionais de tries são fundamentalmente ineficientes em aceleradores de hardware como TPUs e GPUs. A lacuna de eficiência decorre de dois problemas principais: Latência de Memória: Estruturas de perseguição de ponteiros resultam em padrões de acesso à memória não contínuos e aleatórios. Isso impede a coalescência de memória e falha em utilizar as capacidades de burst de High-Bandwidth Memory (HBM) de aceleradores modernos. Incompatibilidade de Compilação: Aceleradores dependem de grafos de computação estáticos para compilação de machine learning (por exemplo, XLA do Google). Tries padrão usam fluxo de controle dependente de dados e ramificação recursiva, que são incompatíveis com este paradigma e muitas vezes forçam viagens de ida e volta custosas entre host e dispositivo. https://arxiv.org/pdf/2602.22647 STATIC: Sparse Transition Matrix-Accelerated Trie Index Pesquisadores do Google DeepMind e YouTube introduziram o STATIC (Sparse Transition Matrix-Accelerated Trie Index for Constrained Decoding) para resolver esses gargalos. Em vez de tratar a trie como um grafo a ser percorrido, o STATIC a achata em uma matriz Compressed Sparse Row (CSR) estática. Essa transformação permite que travessias de árvores irregulares sejam executadas como operações de matriz esparsa totalmente vetorizadas. A Arquitetura de Decodificação Híbrida O STATIC emprega uma estratégia de pesquisa em duas fases para equilibrar o uso da memória e a velocidade: Máscara Densa ( t -1 < d ): Para as primeiras d =2 camadas, onde o fator de ramificação é maior, o STATIC usa um tensor booleano denso empacotado em bits. Isso permite pesquisas O (1) durante as etapas iniciais computacionalmente mais caras. Kernel de Transição de Nó Vetorizado (VNTK): Para camadas mais profundas ( l ≥ 3), o STATIC utiliza um kernel sem ramificações. Este kernel realiza uma 'specul
Fonte: MarkTechPost
Publicado em 2026-03-01