A IBM lançou dois novos modelos abertos de reconhecimento de fala — Granite Speech 4.1 2B e Granite Speech 4.1 2B-NAR — e eles apresentam um argumento convincente sobre o que um modelo de fala com ~2 bilhões de parâmetros pode fazer. Ambos estão disponíveis no Hugging Face sob a licença Apache 2.0. A dupla visa um problema específico que as equipes de IA corporativas conhecem bem: a maioria dos sistemas de reconhecimento automático de fala (ASR) de nível de produção exigem uma capacidade computacional massiva ou sacrificam a precisão para se manterem dentro do orçamento. A aposta da IBM é que decisões arquitetônicas cuidadosas podem permitir que você tenha as duas coisas. O Que Esses Modelos Realmente Fazem O Granite Speech 4.1 2B é um modelo de linguagem de fala compacto e eficiente projetado para reconhecimento automático de fala (ASR) multilíngue e tradução automática de fala (AST) bidirecional, abrangendo inglês, francês, alemão, espanhol, português e japonês. Sua contraparte não autoregressiva, o Granite Speech 4.1 2B-NAR, foca exclusivamente no ASR — visando especificamente implantações sensíveis à latência — e suporta inglês, francês, alemão, espanhol e português, mas não japonês. Essa é uma distinção significativa: equipes que precisam de transcrição em japonês ou qualquer capacidade de tradução de fala devem optar pelo modelo autoregressivo padrão. A IBM também lançou discretamente uma terceira variante junto com essas duas. O Granite Speech 4.1 2B-Plus adiciona ASR com atribuição de locutor e timestamps em nível de palavra para aplicações onde saber quem disse o quê — e exatamente quando — é um requisito. A Word Error Rate (WER) é a métrica principal para medir a qualidade da transcrição. Quanto menor, melhor. Uma WER de 5% significa que aproximadamente 5 em cada 100 palavras estão erradas. No Open ASR Leaderboard (em abril de 2026), o Granite Speech 4.1 2B obteve uma WER média de 5,33. Detalhando o benchmark — no LibriSpeech clean, o modelo atinge uma WER de 1,33, e 2,5 no LibriSpeech other. A Arquitetura, Explicada Ambos os modelos compartilham o mesmo design de três componentes em alto nível — um codificador de fala, um adaptador de modalidade e um modelo de linguagem — embora o mecanismo de decodificação divirja significativamente. O primeiro componente é o codificador de fala. A arquitetura usa 16 blocos conformer treinados com Connectionist Temporal Classification (CTC) com duas cabeças de classificação — uma para saídas grafêmicas (nível de caractere) e outra para unidades BPE — usando amostragem de importância de quadro para focar em partes informativas do áudio. Um Conformer é uma camada de rede neural que combina camadas convolucionais (boas em capturar padrões acústicos locais) com mecanismos de atenção.
Fonte: MarkTechPost
Publicado em 2026-04-30