Microsoft lança Phi-4-Reasoning-Vision-15B: Um Modelo Multimodal Compacto para Matemática, Ciências…

A Microsoft lançou o Phi-4-reasoning-vision-15B, um modelo de raciocínio multimodal de código aberto com 15 bilhões de parâmetros, projetado para tarefas de imagem e texto que exigem percepção e raciocínio seletivo. É um modelo compacto construído para equilibrar a qualidade do raciocínio, a eficiência computacional e os requisitos de dados de treinamento, com especial força no raciocínio científico e matemático e na compreensão das interfaces de usuário. https://arxiv.org/pdf/2603.03975 Em que o modelo é baseado? O Phi-4-reasoning-vision-15B combina o backbone de linguagem Phi-4-Reasoning com o codificador de visão SigLIP-2 usando uma arquitetura de fusão intermediária (mid-fusion). Nesta configuração, o codificador de visão primeiro converte as imagens em tokens visuais, então esses tokens são projetados no espaço de incorporação do modelo de linguagem e processados pelo modelo de linguagem pré-treinado. Este design atua como um trade-off prático: ele preserva um forte raciocínio intermodal, mantendo os custos de treinamento e inferência gerenciáveis em comparação com designs de fusão precoce (early-fusion) mais pesados. https://arxiv.org/pdf/2603.03975 Por que a Microsoft escolheu o caminho do modelo menor? Muitos modelos recentes de visão-linguagem cresceram em número de parâmetros e uso de tokens, o que aumenta tanto a latência quanto o custo de implantação. O Phi-4-reasoning-vision-15B foi construído como uma alternativa menor que ainda lida com cargas de trabalho multimodais comuns sem depender de conjuntos de dados de treinamento extremamente grandes ou geração excessiva de tokens no tempo de inferência. O modelo foi treinado em 200 bilhões de tokens multimodais, construindo sobre o Phi-4-Reasoning, que foi treinado em 16 bilhões de tokens, e, por fim, no modelo base Phi-4, que foi treinado em 400 bilhões de tokens únicos. A Microsoft contrasta isso com mais de 1 trilhão de tokens usados para treinar vários modelos multimodais recentes, como Qwen 2.5 VL, Qwen 3 VL, Kimi-VL e Gemma 3. https://arxiv.org/pdf/2603.03975 A percepção de alta resolução foi uma escolha de design fundamental. A equipe da Microsoft explica uma das lições técnicas mais úteis em seu relatório técnico de que o raciocínio multimodal muitas vezes falha porque a percepção falha primeiro. Os modelos podem perder a resposta não porque lhes falta capacidade de raciocínio, mas porque falham em extrair os detalhes visuais relevantes de imagens densas, como capturas de tela, documentos ou interfaces com pequenos elementos interativos. O Phi-4-reasoning-vision-15B usa um codificador de visão de resolução dinâmica com até 3.600 tokens visuais, que se destina a suportar a compreensão de alta resolução para tarefas como o reconhecimento de GUI e análise granular de documentos. O M

Fonte: MarkTechPost

Publicado em 2026-03-06

Notícias relacionadas

Continue explorando