NVIDIA e Pesquisadores da Universidade de Maryland Lançaram o Audio Flamingo Next (AF-Next): Um Mod…

Compreender o áudio sempre foi a fronteira multimodal que fica atrás da visão. Embora os modelos de imagem-linguagem tenham escalado rapidamente para implantação no mundo real, construir modelos abertos que raciocinem robustamente sobre fala, sons ambientais e música — especialmente em longas durações — permaneceu bastante difícil. NVIDIA e pesquisadores da Universidade de Maryland estão agora atacando diretamente essa lacuna. A equipe de pesquisa lançou o Audio Flamingo Next (AF-Next), o modelo mais capaz da série Audio Flamingo e um Large Audio-Language Model (LALM) totalmente aberto treinado em dados de áudio em escala de internet. O Audio Flamingo Next (AF-Next) vem em três variantes especializadas para diferentes casos de uso. O lançamento inclui o AF-Next-Instruct para resposta a perguntas gerais, o AF-Next-Think para raciocínio avançado em várias etapas e o AF-Next-Captioner para legendagem de áudio detalhada. O que é um Large Audio-Language Model (LALM)? Um Large Audio-Language Model (LALM) combina um codificador de áudio com um modelo de linguagem somente decodificador para permitir a resposta a perguntas, legendagem, transcrição e raciocínio diretamente sobre entradas de áudio. Pense nele como o equivalente em áudio de um modelo de visão-linguagem como LLaVA ou GPT-4V, mas projetado para lidar com fala, sons ambientais e música simultaneamente — dentro de um único modelo unificado. https://arxiv.org/pdf/2404.10905 A Arquitetura: Quatro Componentes Trabalhando em um Pipeline O AF-Next é construído em torno de quatro componentes principais: Primeiro, o codificador de áudio AF-Whisper, um codificador baseado em Whisper personalizado e pré-treinado em um corpus maior e mais diversificado, incluindo fala multilíngue e dados de ASR com vários interlocutores. Dada uma entrada de áudio, o modelo a reamostra para 16 kHz mono e converte a forma de onda em um log mel-espectrograma de 128 canais usando uma janela de 25 ms e um tamanho de salto de 10 ms. O espectrograma é processado em blocos de 30 segundos não sobrepostos através do AF-Whisper, que gera recursos a 50 Hz, após o que uma camada de pooling com stride-2 é aplicada. A dimensão oculta é de 1280. Segundo, o adaptador de áudio, um MLP de 2 camadas que mapeia as representações de áudio do AF-Whisper para o espaço de embedding do modelo de linguagem. Terceiro, o backbone do LLM: Qwen-2.5-7B, um modelo causal somente decodificador com 7B parâmetros, 36 camadas de transformadores e 16 cabeças de atenção, com comprimento de contexto estendido de 32k para 128k tokens através de treinamento adicional de longo contexto. Um detalhe arquitetônico sutil, mas importante, são os Embeddings Rotacionais de Tempo (RoTE). As codificações posicionais padrão em transformadores indexam um token por seu

Fonte: MarkTechPost

Publicado em 2026-04-14

Notícias relacionadas

Continue explorando