A Microsoft lançou o Microsoft-Decision-1, um modelo de decisão para roteamento, classificação, verificação e controle de agentes. O Microsoft-Decision-1 é um modelo de pontuação de decisão que retorna uma probabilidade calibrada para cada opção de resposta fixa, em vez de texto gerado. Ele é pós-treinado a partir do Qwen3.5-9B da Alibaba e já está disponível no Microsoft Foundry e OpenRouter. . TL;DR Tamanho: Construído sobre o Qwen3.5-9B; a contagem exata de parâmetros não foi divulgada. Janela de contexto de 32.768 tokens. Executa em: Apenas API hospedada (Microsoft Foundry, OpenRouter via Azure). Sem pesos abertos, sem variantes quantizadas, hardware não divulgado. Desempenho: Maior precisão média na comparação de 36 benchmarks da Microsoft, com latência p50 de 85 ms. Melhor: 83,5% de precisão média em 36 benchmarks, à frente do Quyet-1.0-Large com 81,9%. Pior: Calibração de 92,2, em segundo lugar ao Quyet-1.0-Large com 93,1. Apenas texto, sem explicações. Em resumo: Melhor característica: decisões rápidas, baratas e calibradas a US$ 0,042 por milhão de tokens de entrada com saída gratuita. Pior característica: pesos fechados, e todos os benchmarks são executados pelo fornecedor. O que é um modelo de decisão? Um modelo de decisão lê uma entrada e pontua um conjunto fechado de opções. Ele não escreve prosa. A Microsoft enquadra os modelos de decisão como uma nova categoria de AI, construída para outputs nos quais o software pode atuar imediatamente. Como o Microsoft-Decision-1 funciona? A Microsoft pós-treinou o Qwen3.5-9B para pontuação de decisão de passagem única. Dada uma situação, uma pergunta e opções fixas, ele retorna uma probabilidade por opção em uma única chamada. A empresa planeja rebasear futuras versões em modelos MAI e OpenAI. O card do modelo Foundry lista os formatos suportados: sim/não, múltipla escolha, classificação, gradação de perguntas de rubrica, classificação de respostas de AI e ações de agente propostas, verificações de fundamentação contra evidências fornecidas, opções de abstenção explícitas como “não é possível dizer”. O treinamento utilizou conjuntos de dados públicos sob o processo Open Data da Microsoft, além de dados sintéticos. O output é JSON. O OpenRouter observa que os pesos são atualizados continuamente enquanto
Fonte: MarkTechPost
Publicado em 2026-10-10