O Google DeepMind lançou o EmbeddingGemma 2, um modelo aberto que incorpora texto, código, imagens, vídeo e áudio em um espaço de 768 dimensões. Ele possui 740 milhões de parâmetros, uma janela de contexto de 8K tokens e licença Apache 2.0. Ele visa pesquisa em dispositivos, classificação e RAG com foco em privacidade. Este artigo analisa, compara e mostra como o EmbeddingGemma 2 se encaixa no cenário. Pode ser implementado hoje? Sim. Os pesos estão disponíveis no Hugging Face e Kaggle, com compilações Ollama, llama.cpp GGUF e LiteRT já disponíveis. O que um Modelo de Embedding faz: Um modelo de embedding converte conteúdo em um vetor de números que captura o significado. Itens semelhantes ficam próximos, facilitando a busca e comparação. Em um pipeline RAG, esses vetores permitem que um LLM recupere informações novas nas quais não foi treinado. Gerar embeddings localmente mantém os dados no dispositivo, reduz a latência e funciona offline. Um Espaço Vetorial para Cada Modalidade: O EmbeddingGemma 2 é construído na arquitetura Gemma 4. Uma consulta de texto pode recuperar uma foto. Um memorando de voz pode recuperar um clipe de vídeo. Entradas intercaladas, como uma listagem de produtos com texto, imagens e um vídeo de demonstração, produzem um único embedding. O design é modular. Ele tem três partes: Backbone de texto e código: 270M parâmetros (130M transformer mais 140M embedder) Codificador de visão: 170M parâmetros, opcional Codificador de áudio: 300M parâmetros, opcional Os desenvolvedores carregam apenas o que precisam: 270M para texto, 440M para texto e visão, 570M para texto e áudio, ou 740M para tudo. Todas as configurações compartilham um único espaço vetorial. Uma consulta incorporada com a configuração somente de texto pode corresponder a documentos incorporados pelo modelo completo. A janela de contexto é de 8.192 tokens, 4 vezes maior que a versão 1. Isso comporta cerca de 29 imagens, 58 quadros de vídeo ou 5,5 minutos de áudio. Benchmarks: A equipe de pesquisa do Google relata pontuações líderes entre embedders multimodais sub-1B no MTEB Code e MAEB. Resultados de precisão total em 768 dimensões: Benchmark EmbeddingGemma 2 EmbeddingGemma 1 MTEB multilingue v2 61.36 61.15 MTEB Código v1 78.68 68.76 MIEB lite (i
Fonte: MarkTechPost
Publicado em 2026-10-06