Yandex Apresenta Sona: Um Único Recomendador Generativo Que Substitui Toda a Cascata de Recomendação

A maioria dos sistemas de recomendação em produção são cascatas. Geradores de candidatos alimentam um pré-ranqueador, que por sua vez alimenta um ranqueador "pesado" construído sobre centenas de features projetadas. O Relatório Técnico do Sona da Yandex descreve um design diferente. Sona é um modelo de AI generativa que une a geração de candidatos e o ranqueamento em um único sistema, substituindo as múltiplas etapas tipicamente usadas em pipelines de recomendação. A Yandex testou o modelo em um experimento de produção ao vivo de sete dias em seus smart speakers. Em um teste A/B online, ele substituiu mais de 15 geradores de candidatos, a etapa de pré-ranqueamento e a etapa de ranqueamento por um único transformador em serviço. Que problema o Sona resolve? As cascatas dividem uma decisão entre modelos treinados separadamente. Cada etapa otimiza seu próprio objetivo, e o ranqueador só vê o que as etapas anteriores permitem passar. A pilha anterior da Yandex na superfície do Yandex Music consumia centenas de features, incluindo sinais do Argus, o transformador de recomendação anterior da Yandex. O Sona coloca a geração de candidatos e o ranqueamento em torno de uma representação de usuário compartilhada. O codificador lê o histórico do ouvinte uma vez por solicitação. Um decodificador gera candidatos. Um Módulo de Ranqueamento os pontua em relação aos mesmos estados do codificador. Nenhum componente usa features projetadas manualmente. As entradas são campos de eventos registrados (ID da faixa, ID do artista, duração, curtidas, tempo de reprodução, flags de superfície) e IDs Semânticos aprendidos. Nos smart speakers da Yandex, a reprodução pode começar sem que o usuário selecione previamente um artista, gênero ou humor. A equipe de pesquisa descreve isso como um cenário de pura recomendação. Como a Arquitetura do Sona Funciona: 1. Tokenizador Semântico: Seguindo a formulação de ID Semântico de Rajput et al., cada faixa se torna uma tupla de 3 códigos discretos. Um LLM multimodal "congelado" lê o mel-espectrograma dos primeiros 90 segundos junto com o título, artistas e tags. Ele funciona em modo "prefill-only". Um transformador de refinamento de 4 camadas então alinha essas features com o comportamento de escuta, usando InfoNCE em pares de faixas colaborativas. Res

Fonte: MarkTechPost

Publicado em 2026-10-05

Notícias relacionadas

Continue explorando