Alibaba acaba de lançar os modelos Qwen 3.5 Small: uma família de 0.8B a 9B parâmetros construídos…

A equipe Qwen da Alibaba lançou a Série Qwen3.5 Small Model, uma coleção de Large Language Models (LLMs) que variam de 0.8B a 9B parâmetros. Embora a tendência da indústria tenha historicamente favorecido o aumento da contagem de parâmetros para alcançar o desempenho de 'fronteira', este lançamento foca em 'Mais Inteligência, Menos Custo Computacional'. Esses modelos representam uma mudança em direção à implantação de IA capaz em hardware de consumidor e dispositivos de borda, sem as tradicionais compensações em raciocínio ou multimodalidade. A série está atualmente disponível no Hugging Face e ModelScope, incluindo as versões Instruct e Base. A Hierarquia do Modelo: Otimização por Escala A série Qwen3.5 Small é categorizada em quatro níveis distintos, cada um otimizado para restrições de hardware e requisitos de latência específicos: Qwen3.5-0.8B e Qwen3.5-2B: Esses modelos são projetados para aplicações de alto throughput e baixa latência em dispositivos de borda. Ao otimizar o processo de treinamento de token denso, esses modelos fornecem uma pegada de VRAM reduzida, tornando-os compatíveis com chips móveis e hardware de IoT. Qwen3.5-4B: Este modelo serve como uma base multimodal para agentes leves. Ele preenche a lacuna entre modelos de texto puro e modelos visuais-linguísticos (VLMs) complexos, permitindo fluxos de trabalho de agentes que exigem compreensão visual – como navegação de UI ou análise de documentos – enquanto permanece pequeno o suficiente para implantação local. Qwen3.5-9B: O carro-chefe da série Small, a variante 9B, foca em raciocínio e lógica. Ele é especificamente ajustado para fechar a lacuna de desempenho com modelos significativamente maiores (como variantes de 30B+ parâmetros) através de técnicas avançadas de treinamento. Multimodalidade Nativa vs. Adaptadores Visuais Uma das mudanças técnicas significativas no Qwen3.5-4B e acima é a mudança para capacidades multimodais nativas. Em iterações anteriores de modelos pequenos, a multimodalidade era frequentemente alcançada por meio de 'adaptadores' ou 'pontes' que conectavam um codificador de visão pré-treinado (como o CLIP) a um modelo de linguagem. Em contraste, o Qwen3.5 incorpora a multimodalidade diretamente na arquitetura. Essa abordagem nativa permite que o modelo processe tokens visuais e textuais dentro do mesmo espaço latente desde os estágios iniciais do treinamento. Isso resulta em melhor raciocínio espacial, maior precisão de OCR e respostas visualmente mais coesas em comparação com sistemas baseados em adaptadores. RL Escalado: Aprimorando o Raciocínio em Modelos Compactos O desempenho do Qwen3.5-9B é largamente atribuído à implementação.

Fonte: MarkTechPost

Publicado em 2026-03-03

Notícias relacionadas

Continue explorando