Equipe Qwen do Alibaba Lança Série de Modelos Qwen 3.5 Médio: Uma Potência de Produção Provando que…

O desenvolvimento de large language models (LLMs) tem sido definido pela busca por escala bruta. Embora o aumento do número de parâmetros para trilhões inicialmente impulsionasse ganhos de desempenho, também introduziu custos significativos de infraestrutura e utilidade marginal decrescente. O lançamento da série de modelos Qwen 3.5 Médio sinaliza uma mudança na abordagem Qwen do Alibaba, priorizando a eficiência arquitetônica e dados de alta qualidade em detrimento do escalonamento tradicional. A série apresenta uma linha incluindo Qwen3.5-Flash, Qwen3.5-35B-A3B, Qwen3.5-122B-A10B e Qwen3.5-27B. Esses modelos demonstram que escolhas arquitetônicas estratégicas e o Reinforcement Learning (RL) podem atingir inteligência de nível de fronteira com requisitos de computação significativamente menores. O Avanço da Eficiência: 35B Supera 235B O marco técnico mais notável é o desempenho do Qwen3.5-35B-A3B, que agora supera o antigo Qwen3-235B-A22B-2507 e o Qwen3-VL-235B-A22B com capacidade de visão. O sufixo 'A3B' é a métrica chave. Isso indica os Parâmetros Ativos em uma arquitetura Mixture-of-Experts (MoE). Embora o modelo tenha 35 bilhões de parâmetros totais, ele ativa apenas 3 bilhões durante qualquer passagem de inferência única. O fato de um modelo com 3B de parâmetros ativos poder superar um predecessor com 22B de parâmetros ativos destaca um grande salto na densidade de raciocínio. Essa eficiência é impulsionada por uma arquitetura híbrida que integra Redes Delta Gated (atenção linear) com blocos de Atenção Gated padrão. Esse design permite decodificação de alta taxa de transferência e uma pegada de memória reduzida, tornando a IA de alto desempenho mais acessível em hardware padrão. Qwen3.5-Flash: Otimizado para Produção Qwen3.5-Flash serve como a versão de produção hospedada do modelo 35B-A3B. Ele é especificamente desenvolvido para desenvolvedores de software que exigem desempenho de baixa latência em fluxos de trabalho agentic. Contexto de 1M de Tamanho: Ao fornecer uma janela de contexto de 1 milhão de tokens por padrão, o Flash reduz a necessidade de pipelines complexos de RAG (Retrieval-Augmented Generation) ao lidar com grandes conjuntos de documentos ou bases de código. Ferramentas Integradas Oficiais: O modelo oferece suporte nativo para uso de ferramentas e chamada de função, permitindo que ele se conecte diretamente com APIs e bancos de dados com alta precisão. Cenários Agentic de Alto Racioncínio Os modelos Qwen3.5-122B-A10B e Qwen3.5-27B são projetados para tarefas 'agentic' – cenários em que um modelo deve planejar, raciocinar e executar fluxos de trabalho de várias etapas. Esses modelos estreitam a lacuna entre as alternativas de código aberto.

Fonte: MarkTechPost

Publicado em 2026-02-24

Notícias relacionadas

Continue explorando