A Alibaba Cloud acaba de atualizar o cenário open-source. Hoje, a equipe Qwen lançou Qwen3.5, a mais nova geração de sua família de modelos de linguagem grandes (LLM). A versão mais poderosa é a Qwen3.5-397B-A17B. Este modelo é um sistema esparso de Mixture-of-Experts (MoE). Ele combina um poder de raciocínio massivo com alta eficiência. O Qwen3.5 é um modelo nativo de visão-linguagem. Ele é projetado especificamente para agentes de IA. Ele pode ver, codificar e raciocinar em 201 idiomas. https://qwen.ai/blog?id=qwen3.5 A Arquitetura Central: Total de 397B, 17B Ativos As especificações técnicas do Qwen3.5-397B-A17B são impressionantes. O modelo contém 397 bilhões de parâmetros totais. No entanto, ele usa um design MoE esparso. Isso significa que ele ativa apenas 17 bilhões de parâmetros durante qualquer passagem de inferência. Essa contagem de 17 bilhões de parâmetros ativos é o número mais importante para os desenvolvedores. Isso permite que o modelo forneça a inteligência de um modelo de 400 bilhões, mas funcione com a velocidade de um modelo muito menor. A equipe Qwen relata um aumento de 8,6x a 19,0x na taxa de decodificação em comparação com as gerações anteriores. Essa eficiência resolve o alto custo de execução de IA em larga escala. https://qwen.ai/blog?id=qwen3.5 Arquitetura Híbrida Eficiente: Redes Gated Delta O Qwen3.5 não usa um design Transformer padrão. Ele usa uma 'Arquitetura Híbrida Eficiente'. A maioria dos LLMs depende apenas de mecanismos de Atenção. Estes podem se tornar lentos com texto longo. O Qwen3.5 combina Gated Delta Networks (atenção linear) com Mixture-of-Experts (MoE). O modelo consiste em 60 camadas. O tamanho da dimensão oculta é 4.096. Essas camadas seguem um 'Layout Oculto' específico. O layout agrupa as camadas em conjuntos de 4. 3 blocos usam Gated DeltaNet-plus-MoE. 1 bloco usa Gated Attention-plus-MoE. Esse padrão se repete 15 vezes para atingir 60 camadas. Detalhes técnicos incluem: Gated DeltaNet: Ele usa 64 'attention heads' lineares para Valores (V). Ele usa 16 'heads' para Queries e Keys (QK). Estrutura MoE: O modelo tem um total de 512 especialistas. Cada token ativa 10 especialistas roteados e 1 especialista compartilhado. Isso equivale a 11 especialistas ativos por token. Vocabulário: O modelo usa um vocabulário 'padded' de 248.320 tokens. Treinamento Multimodal Nativo: Early Fusion O Qwen3.5 é um modelo nativo de visão-linguagem. Muitos outros modelos adicionam capacidades de visão posteriormente. O Qwen3.5 usou treinamento de 'Early Fusion'. Isso significa que o modelo aprendeu com imagens e texto ao mesmo tempo. O treinamento usou trilhões de tokens multimodais. Isso torna o Qwen3.5 melhor no raciocínio visual do que as versões anteriores do Qwen3-VL.
Fonte: MarkTechPost
Publicado em 2026-02-16