Fish Audio Lança Fish Audio S2: Uma Nova Geração de Text-to-Speech (TTS) Expressivo com Emoção Absu…

O cenário do Text-to-Speech (TTS) está migrando de pipelines modulares para Large Audio Models (LAMs) integrados. O lançamento do S2-Pro da Fish Audio, o modelo principal dentro do ecossistema Fish Speech, representa uma mudança em direção a arquiteturas abertas capazes de síntese de alta fidelidade e multi-falante com latência inferior a 150ms. O lançamento fornece uma estrutura para clonagem de voz zero-shot e controle emocional granular usando uma abordagem Dual-Auto-Regressiva (AR). Arquitetura: O Framework Dual-AR e RVQ A distinção técnica fundamental no Fish Audio S2-Pro é sua arquitetura hierárquica Dual-AR. Modelos TTS tradicionais geralmente enfrentam o dilema entre o comprimento da sequência e o detalhe acústico. O S2-Pro aborda isso bifurcando o processo de geração em dois estágios especializados: um modelo 'AR Lento' e um modelo 'AR Rápido'. O Modelo AR Lento (4B Parâmetros): Este componente opera no eixo do tempo. Ele é responsável por processar a entrada linguística e gerar tokens semânticos. Ao utilizar uma contagem maior de parâmetros (aproximadamente 4 bilhões), o modelo AR Lento captura dependências de longo alcance, prosódia e as nuances estruturais da fala. O Modelo AR Rápido (400M Parâmetros): Este componente processa a dimensão acústica. Ele prevê os codebooks residuais para cada token semântico. Este modelo menor e mais rápido garante que os detalhes de alta frequência do áudio — timbre, soprosidade e textura — sejam gerados com alta eficiência. Este sistema depende da Quantização Vetorial Residual (RVQ). Nesta configuração, o áudio bruto é compactado em tokens discretos em várias camadas (codebooks). A primeira camada captura as características acústicas primárias, enquanto as camadas subsequentes capturam os 'resíduos' ou os erros restantes da camada anterior. Isso permite que o modelo reconstrua áudio de alta fidelidade de 44,1 kHz, mantendo uma contagem gerenciável de tokens para a arquitetura Transformer. Controle Emocional via Aprendizagem In-Contexto e Tags Inline O Fish Audio S2-Pro alcança o que os desenvolvedores descrevem como 'emoção absurdamente controlável' através de dois mecanismos primários: aprendizagem in-contexto zero-shot e controle inline de linguagem natural. Aprendizagem In-Contexto (ICL): Ao contrário das gerações mais antigas de TTS que exigiam ajuste fino explícito para imitar uma voz específica, o S2-Pro utiliza a capacidade do Transformer de realizar aprendizagem in-contexto. Ao fornecer um clipe de áudio de referência — idealmente entre 10 e 30 segundos — o modelo extrai o spea

Fonte: MarkTechPost

Publicado em 2026-03-11

Notícias relacionadas

Continue explorando