A Perplexity lançou o pplx-embed-v2-late, um par de modelos de embedding multimodal estilo ColBERT. Eles vêm em 2 tamanhos: 0.6B para consultas rápidas e baratas e 9B para máxima qualidade. Ambos os modelos recuperam texto, imagens e páginas PDF renderizadas, e compartilham um único espaço de embedding. É implementável? Sim, se você o hospedar. Ambos os modelos estão no Hugging Face sob a licença MIT. Um endpoint de API da Perplexity hospedado está planejado, mas ainda não está ativo. TL;DR O melhor: O modelo de 0.6B usa cerca de 340M de parâmetros ativos para imagens e se mantém próximo aos rivais de 8B. Um índice de 9B pode ser pesquisado com consultas de 0.6B, recuperando cerca de metade da diferença de qualidade de 9B em texto a um custo de consulta de 0.6B. Seus vetores de token de 128 dimensões são 16x a 32x mais estreitos do que os rivais de 2.048 a 4.096 dimensões. Licença MIT, com uso comercial permitido. O pior: Ele armazena 1 vetor por token, então o tamanho do índice cresce com o comprimento do documento. Não é o #1 na recuperação de imagens do ViDoRe v3; o EVIE da Tencent pontua mais alto. Uma única entrada não pode misturar texto e imagens. Todas as pontuações são auto-relatadas, e o relatório técnico ainda não foi divulgado. Tamanho do Modelo e Onde Ele Roda: Métricas pplx-embed-v2-late-0.6b pplx-embed-v2-late-9b Parâmetros totais 594M 9B (Hugging Face lista 8B) Parâmetros ativos ~240M texto, 340M imagem 7.4B Modelo base Qwen3.5-0.8B, podado para 12 camadas de texto Qwen3.5 Saída 128 dims por token 128 dims por token Pesos em memória (bf16, nossa estimativa) ~1.2 GB ~16 a 18 GB Máquina pretendida Laptop, dispositivo de ponta ou GPU pequena Datacenter ou GPU de alta memória Função sugerida pela Perplexity Codificador de consulta ao vivo, 100% local Construção do índice de documentos A Perplexity projetou o modelo de 0.6B como um codificador de consulta leve que também pode rodar em dispositivos de ponta. Ambas as fichas do modelo mostram o uso de GPU CUDA. Eles exigem sentence-transformers >= 6.0.0 e transformers >= 5.4.0. Os números de memória são nossa estimativa de 2 bytes por parâmetro, apenas para os pesos. Os checkpoints publicados são armazenados em F32, o que dobra o tamanho do download. Quão bem ele funciona: Melhores e Piores Pontuações Todos os números abaixo a
Fonte: MarkTechPost
Publicado em 2026-10-08