Mistral AI Lança Mistral Small 4: Um Modelo MoE de 119B de Parâmetros que Unifica Cargas de Trabalh…

A Mistral AI lançou o Mistral Small 4, um novo modelo da família Mistral Small projetado para consolidar diversas capacidades anteriormente separadas em um único alvo de implantação. A equipe da Mistral descreve o Small 4 como seu primeiro modelo a combinar os papéis associados ao Mistral Small para seguir instruções, Magistral para raciocínio, Pixtral para compreensão multimodal e Devstral para codificação agência. O resultado é um único modelo que pode operar como um assistente geral, um modelo de raciocínio e um sistema multimodal sem exigir a troca de modelos entre os fluxos de trabalho. Arquitetura: 128 Experts, Ativação Esparsa Arquitetonicamente, o Mistral Small 4 é um modelo Mixture-of-Experts (MoE) com 128 experts e 4 experts ativos por token. O modelo possui um total de 119B de parâmetros, com 6B de parâmetros ativos por token, ou 8B incluindo as camadas de embedding e saída. Suporte a Contexto Longo e Multimodal O modelo suporta uma janela de contexto de 256k, o que é um salto significativo para casos de uso práticos de engenharia. A capacidade de contexto longo importa menos como um número de marketing e mais como um simplificador operacional: ela reduz a necessidade de segmentação agressiva (chunking), orquestração de recuperação e poda de contexto em tarefas como análise de documentos longos, exploração de bases de código, raciocínio multifile e fluxos de trabalho de agentes. A Mistral posiciona o modelo para chat geral, codificação, tarefas de agência e raciocínio complexo, com entradas de texto e imagem e saída de texto. Isso coloca o Small 4 na categoria cada vez mais importante de modelos de propósito geral que devem lidar com tarefas empresariais pesadas em linguagem e visualmente fundamentadas sob uma única superfície de API. Raciocínio Configurável no Tempo de Inferência Uma decisão de produto mais importante do que a contagem bruta de parâmetros é a introdução do esforço de raciocínio configurável. O Small 4 expõe um parâmetro reasoning_effort por requisição que permite aos desenvolvedores trocar latência por um raciocínio mais profundo no tempo de teste. Na documentação oficial, reasoning_effort="none" é descrito como produzindo respostas rápidas com um estilo de chat equivalente ao Mistral Small 3.2, enquanto reasoning_effort="high" é destinado a um raciocínio mais deliberado e passo a passo com verbosidade comparável aos modelos Magistral anteriores. Isso muda o padrão de implantação. Em vez de rotear entre um modelo rápido e um modelo de raciocínio, as equipes de desenvolvimento podem manter um único modelo em serviço e variar o comportamento de inferência no momento da requisição. Isso é mais limpo de uma perspectiva de sistemas e mais fácil de gerenciar em produtos onde apenas um subconjunto de q

Fonte: MarkTechPost

Publicado em 2026-03-16

Notícias relacionadas

Continue explorando