JetBrains Lança Mellum2.1: Um Modelo Aberto MoE de 12B para Agentes de Codificação

A JetBrains lançou o Mellum2.1, um modelo aberto construído para agentes de codificação e sub-agentes rápidos. O Mellum2.1 é um modelo de raciocínio de mixture-of-experts (MoE) de 12B da JetBrains que ativa 2,5 bilhões de parâmetros por token. Ele é distribuído sob a licença Apache 2.0 no Hugging Face. A arquitetura permanece inalterada em relação ao Mellum2. A atualização provém quase inteiramente do aprendizado por reforço (RL) em ambientes de software reais. O resultado é um modelo pequeno e auto-hospedável que explora um repositório, edita arquivos e verifica suas próprias alterações. TL;DR Tamanho: 12B total, 2,5B ativo (64 experts, 8 ativos), contexto de 131.072 tokens. Executa em: suas próprias GPUs via vLLM ou SGLang (velocidade testada em 1 NVIDIA H200). Compilações GGUF começam em 7.0 GB para llama.cpp, Ollama e LM Studio. Desempenho: supera o Mellum2 em 15 dos 17 benchmarks listados; vence 5 de 17 contra o Qwen3.5-9B. Melhor: 82.0 no LiveCodeBench v6, à frente do Qwen3.5-9B (75.4) e Gemma 4 E4B (69.4). Pior: 17.4 no Terminal-Bench 2.1, abaixo do Qwen3.5-9B (21.7). Resumo (melhor): fortes pontuações em codificação e alto throughput com apenas 2,5 bilhões de parâmetros ativos. Resumo (pior): ainda atrás do Qwen3.5-9B em tarefas de software agenticas e conhecimento difíceis. O que é o Mellum2.1? O Mellum2.1 é a próxima versão do Mellum2 Thinking, que a JetBrains tornou open-source em junho de 2026. O checkpoint lançado é o Mellum2.1-12B-A2.5B-Thinking. É um modelo de raciocínio que emite sua cadeia de pensamento antes de responder. A JetBrains visa 3 usos: trabalhador de agente, assistente de raciocínio geral e implantação privada auto-hospedada. Como funciona a arquitetura do Mellum2.1? O modelo possui 28 camadas e 64 experts. Um roteador ativa 8 experts por token. A atenção utiliza atenção de consulta agrupada com 32 cabeças de consulta e 4 cabeças KV. 3 de cada 4 camadas usam uma janela deslizante de 1.024 tokens. O comprimento do contexto é de 131.072 tokens, e o vocabulário tem 98.304 tokens. Os pesos são enviados em bfloat16. Como o Mellum2.1 foi treinado? Quase todo o novo trabalho foi dedicado ao pós-treinamento. O RL passou de uma curta fase final para a parte principal do treinamento. A JetBrains adicionou

Fonte: MarkTechPost

Publicado em 2026-10-08

Notícias relacionadas

Continue explorando