Microsoft AI Lança MAI-Transcribe-2-Streaming: Modelo de Fala para Texto em Tempo Real #1 na Artifi…

A Microsoft AI lançou o MAI-Transcribe-2-Streaming, seu primeiro modelo de fala para texto (STT) por streaming. Ele foi lançado em 1º de outubro de 2026, juntamente com 2 modelos de texto para fala, MAI-Voice-2.1 e MAI-Voice-2.1-Flash. A Artificial Analysis o classifica como o #1 entre 38 modelos para precisão de transcrição final e parcial inicial. O modelo visa agentes de voz, legendas ao vivo e ditado, onde a latência decide a experiência. O que a Microsoft enviou: MAI-Transcribe-2-Streaming é o irmão em tempo real do MAI-Transcribe-2 em lote, lançado em setembro. Ele transcreve 60 idiomas com detecção automática e contínua de idioma. O áudio é transmitido continuamente, e o texto é retornado enquanto o orador ainda está falando. O modelo emite suas primeiras hipóteses, chamadas parciais, pouco mais de 100ms após receber o áudio. Ele revisa essas parciais à medida que o contexto chega, e então confirma uma transcrição final estável. Um agente pode, portanto, começar a raciocinar ou a chamar ferramentas no meio da frase. A equipe da Microsoft afirma que seus testes internos mostram que as palavras aparecem 2 vezes mais rápido do que seu concorrente mais próximo. O que a Artificial Analysis Mediu: O índice AA-WER Streaming usa cerca de 8 horas de áudio. A mistura é AA-AgentTalk (50%), VoxPopuli (25%) e Earnings22 (25%). A latência é medida a partir do final da fala, conforme detectado pelo SileroVAD. Transcrição final: 2,5% WER em 0,13s após o final da fala, #1 de 38 modelos. Transcrição parcial inicial: 2,5% WER em 0,12s após o final da fala, também #1. Vice-campeões: Grok Voice Transcribe 2.0 com 2,7% e 0,49s. Muse Voice Transcribe com 3,1% e 0,16s. Não o mais rápido: Cartesia Ink-2 (endpoints externos) retorna as finais em 0,07s, mas com 4,0% de WER. A primeira parcial é tão precisa quanto a transcrição final. Isso é importante para agentes que agem antes que o orador termine. A Microsoft também posiciona o modelo na fronteira de Pareto de precisão versus latência. window.addEventListener("message",function(e){if(e.data&&e.data.mtpMaiH){document.getElementById("mtp-mai-frame").style.height=e.data.mtpMaiH+"px";}}); Preços do MAI-Transcribe-2-Streaming

Fonte: MarkTechPost

Publicado em 2026-10-03

Notícias relacionadas

Continue explorando