Compreender o que está acontecendo em um clipe de áudio é um problema enganosamente difícil. Transcrever palavras faladas é a parte fácil. Um sistema verdadeiramente capaz também precisa reconhecer quem está falando, detectar seu estado emocional, interpretar sons de fundo, analisar conteúdo musical e responder a perguntas baseadas em tempo como 'o que o orador disse aos 2 minutos?'. Abordar tudo isso exigia unir vários sistemas especializados. A equipe OpenMOSS, MOSI.AI e o Shanghai Innovation Institute lançaram o MOSS-Audio: um modelo de compreensão de áudio de código aberto projetado para unificar todas essas capacidades dentro de um único modelo de fundação. O Que o MOSS-Audio Realmente Faz O MOSS-Audio oferece suporte à compreensão de fala, compreensão de som ambiental, compreensão de música, legendagem de áudio, QA com reconhecimento temporal e raciocínio complexo sobre áudio do mundo real. Seu conjunto de capacidades se divide em várias áreas distintas. A Compreensão de Fala e Conteúdo reconhece e transcreve com precisão o conteúdo falado, suportando alinhamento de timestamp em nível de palavra e frase. A Análise de Locutor, Emoção e Evento identifica características do locutor, analisa estados emocionais com base no tom, timbre e contexto, e detecta eventos acústicos chave dentro do áudio. A Extração de Cenário e Pistas Sonoras extrai sinais significativos de sons de fundo, ruído ambiental e sinais não verbais para inferir o contexto e a atmosfera do cenário. A Compreensão Musical analisa o estilo musical, a progressão emocional e a instrumentação. A Resposta a Perguntas e o Resumo de Áudio lidam com perguntas e resumos em fala, podcasts, reuniões e entrevistas. Finalmente, o Raciocínio Complexo realiza raciocínio multi-hop sobre conteúdo de áudio, impulsionado tanto pelo treinamento de 'chain-of-thought' quanto por aprendizado por reforço. Em termos práticos, um único modelo MOSS-Audio pode fazer tudo isso sem alternar entre diferentes sistemas especializados. Quatro Variantes de Modelo A equipe lançou quatro variantes no lançamento: MOSS-Audio-4B-Instruct, MOSS-Audio-4B-Thinking, MOSS-Audio-8B-Instruct e MOSS-Audio-8B-Thinking. A convenção de nomenclatura vale a pena entender se você está decidindo qual usar. As variantes Instruct são otimizadas para seguir instruções diretas, tornando-as adequadas para pipelines de produção onde você deseja saídas previsíveis e estruturadas. As variantes Thinking fornecem capacidades de raciocínio de 'chain-of-thought' mais fortes, mais adequadas para tarefas que exigem inferência multi-hop. Os modelos 4B usam Qwen3
Fonte: MarkTechPost
Publicado em 2026-04-27