Cohere lança Tiny Aya: um Small Language Model de 3B Parâmetros que Suporta 70 Idiomas e Roda Local…

A Cohere AI Labs lançou o Tiny Aya, uma família de small language models (SLMs) que redefine o desempenho multilíngue. Enquanto muitos modelos escalam aumentando os parâmetros, o Tiny Aya usa uma arquitetura de 3.35B parâmetros para oferecer tradução e geração de última geração em 70 idiomas. O lançamento inclui 5 modelos: Tiny Aya Base (pré-treinado), Tiny Aya Global (ajustado por instrução e balanceado), e três variantes específicas de região — Earth (África/Ásia Ocidental), Fire (Sul da Ásia) e Water (Ásia-Pacífico/Europa). https://cohere.com/blog/cohere-labs-tiny-aya A Arquitetura O Tiny Aya é construído sobre uma arquitetura Transformer densa apenas com decodificador. As especificações-chave incluem: Parâmetros: 3.35B no total (2.8B sem embedding) Camadas: 36 Vocabulário: tokenizer de 262k projetado para representação equitativa de idiomas. Atenção: Janela deslizante intercalada e atenção completa (proporção de 3:1) com Grouped Query Attention (GQA). Contexto: 8192 tokens para entrada e saída. O modelo foi pré-treinado em 6T tokens usando um esquema Warmup-Stable-Decay (WSD). Para manter a estabilidade, a equipe usou ativações SwiGLU e removeu todos os vieses das camadas densas. Pós-treinamento Avançado: FUSION e SimMerge Para preencher a lacuna em idiomas de baixo recurso, a Cohere usou um pipeline de dados sintéticos. Fusion-of-N (FUSION): Os prompts são enviados para uma 'equipe de professores' (COMMAND A, GEMMA3-27B-IT, DEEPSEEK-V3). Um LLM juiz, o Fusor, extrai e agrega os componentes mais fortes de suas respostas. Especialização Regional: Os modelos foram finetuned em 5 clusters regionais (por exemplo, Sul da Ásia, África). SimMerge: Para evitar o 'esquecimento catastrófico' da segurança global, os checkpoints regionais foram mesclados com o modelo global usando o SimMerge, que seleciona os melhores operadores de mesclagem com base em sinais de similaridade. Benchmarks de Desempenho O Tiny Aya Global supera consistentemente concorrentes maiores ou de mesma escala em tarefas multilíngues: Tradução: Ele supera o GEMMA3-4B em 46 dos 61 idiomas no WMT24++. Raciocínio: No benchmark GlobalMGSM (matemática) para idiomas africanos, o Tiny Aya alcançou 39,2% de precisão, superando o GEMMA3-4B (17,6%) e o QWEN3-4B (6,25%). Segurança: Possui a maior taxa média de resposta segura (91,1%) no MultiJail. Integridade do Idioma: O modelo atinge 94% de precisão de idioma, o que significa que raramente muda para o inglês quando solicitado a responder em outro idioma. Implantação On-Device O Tiny Aya é otimizado para computação de borda. Usando quantização de 4 bits (Q4_K_M), o modelo se encaixa em uma pegada de memória de 2,14 GB. iPhone 13:

Fonte: MarkTechPost

Publicado em 2026-02-18

Notícias relacionadas

Continue explorando