A Perplexity lançou o pplx-embed, uma coleção de modelos de embedding multilíngues otimizados para tarefas de recuperação em larga escala. Esses modelos foram projetados para lidar com o ruído e a complexidade de dados em escala web, oferecendo uma alternativa pronta para produção às APIs de embedding proprietárias. Inovações Arquitetônicas: Atenção Bidirecional e Difusão A maioria dos Large Language Models (LLMs) utiliza arquiteturas causais, apenas decodificadoras. No entanto, para tarefas de embedding, entender o contexto completo de uma frase é mais crítico do que prever o próximo token. A equipe de pesquisa da Perplexity abordou isso implementando atenção bidirecional. Isso permite que o modelo processe todos os tokens em uma sequência simultaneamente, resultando em uma representação de estado oculto mais abrangente. Além disso, os modelos utilizam pré-treinamento baseado em difusão. Embora a difusão seja frequentemente usada em mídias generativas, aplicá-la a embeddings de texto ajuda o modelo a aprender a reconstruir sinais semânticos limpos a partir de entradas ruidosas ou fragmentadas. Esta fase de pré-treinamento garante que o modelo seja resiliente ao processar texto não formatado, frequentemente encontrado na web aberta. https://arxiv.org/pdf/2602.11151 Otimizado para RAG: Consulta vs. Contexto Um desafio comum na Geração Aumentada por Recuperação (RAG) é a 'assimetria' entre a consulta curta de pesquisa de um usuário e um longo chunk de documento. A equipe Perplexity aborda isso fornecendo duas versões de modelo especializadas: pplx-embed-v1: Otimizado para embeddings de texto independentes e consultas de pesquisa. pplx-embed-context-v1: Especificamente ajustado para chunks de documentos usados como base de conhecimento em pipelines RAG. Ao separar essas funções, os modelos alinham melhor o espaço vetorial entre o que um usuário pergunta e as informações específicas armazenadas em um banco de dados. Esses modelos foram validados em cenários de pesquisa do mundo real envolvendo dezenas de milhões de documentos. Especificações Técnicas e Eficiência Os modelos estão disponíveis em duas escalas de parâmetros para equilibrar desempenho e custo computacional: Característica Modelo 0.6B Modelo 4B Caso de Uso Principal Tarefas de alta produtividade e baixa latência Raciocínio semântico complexo Quantização Suporte Nativo INT8 Suporte Nativo INT8 Arquitetura Baseado em Qwen3 Baseado em Qwen3 Atenção Bidirecional Bidirecional A inclusão de quantização nativa INT8 permite que os engenheiros implementem esses modelos com uma pegada de memória significativamente menor e velocidades de inferência mais rápidas. Isso torna o modelo 4B viável para ambientes de produção que anteriormente exigiam modelos menores e menos capazes. K
Fonte: MarkTechPost
Publicado em 2026-02-27