Google AI Lança WAXAL: Um Dataset Multilíngue de Fala Africana para Treinar Modelos de Reconhecimen…

A tecnologia de fala ainda enfrenta um problema de distribuição de dados. Os sistemas de Reconhecimento Automático de Fala (ASR) e Texto-para-Fala (TTS) melhoraram rapidamente para idiomas com muitos recursos, mas muitos idiomas africanos permanecem mal representados em corpora abertos. Uma equipe de pesquisadores do Google e outros colaboradores apresenta o WAXAL, um dataset multilíngue de fala aberto para idiomas africanos, cobrindo 24 idiomas, com um componente ASR construído a partir de fala natural transcrita e um componente TTS construído a partir de gravações de um único locutor com qualidade de estúdio. O WAXAL é estruturado como dois recursos separados porque ASR e TTS têm requisitos de dados diferentes. O lado ASR é projetado em torno de diversos locutores, ambientes naturais e produção de linguagem espontânea. O lado TTS é projetado em torno de condições de gravação controladas, scripts foneticamente equilibrados e áudio de um único locutor mais limpo, adequado para síntese. Essa separação é tecnicamente importante: um dataset que é útil para um reconhecimento robusto em configurações ruidosas do mundo real geralmente não é o mesmo dataset que produz modelos TTS de um único locutor fortes. https://arxiv.org/pdf/2602.02734 Como os dados ASR foram coletados A parte ASR do WAXAL foi coletada usando fala estimulada por imagens. Os locutores recebiam imagens e eram solicitados a descrever o que viam em seu idioma nativo, o que é uma configuração mais natural do que a simples leitura estimulada. As gravações foram feitas nos ambientes naturais dos locutores, cada uma com uma duração mínima de 15 segundos. O processo de coleta também rastreou metadados como idade do locutor, sexo, idioma e ambiente de gravação. Apenas um subconjunto do áudio completo coletado foi transcrito: a equipe de pesquisa afirma que o lançamento atual do ASR inclui transcrições para cerca de 10% do áudio total gravado. Essas transcrições foram produzidas por especialistas linguísticos locais pagos, usando scripts locais quando disponíveis e transliteração do alfabeto inglês caso contrário. Isso é importante para qualquer pessoa que esteja construindo sistemas ASR multilíngues. A fala estimulada por imagens tende a capturar mais variações lexicais e sintáticas naturais do que a leitura fortemente roteirizada, mas também torna a transcrição mais difícil e aumenta a variação entre locutores, domínios e condições acústicas. O WAXAL se apoia nessa compensação em vez de evitá-la. O resultado não é um dataset de benchmark perfeitamente limpo; está mais próximo de um dado ASR multilíngue coletado em campo com variabilidade real incorporada. Como os dados TTS foram coletados O lado TTS do WAXAL foi construído de forma muito diferente. O

Fonte: MarkTechPost

Publicado em 2026-03-17

Notícias relacionadas

Continue explorando