YuanLab AI Lança Yuan 3.0 Ultra: Um Modelo Fundamental Multimodal MoE Emblemático, Construído para…

Como um Large Language Model trilhardário em parâmetros pode alcançar desempenho empresarial de ponta, ao mesmo tempo em que reduz seu número total de parâmetros em 33,3% e aumenta a eficiência do pré-treinamento em 49%? A Yuan Lab AI lança o Yuan3.0 Ultra, um modelo de linguagem grande (LLM) Mixture-of-Experts (MoE) de código aberto que apresenta 1T de parâmetros totais e 68,8B de parâmetros ativados. A arquitetura do modelo é projetada para otimizar o desempenho em tarefas específicas da empresa, mantendo capacidades competitivas de uso geral. Diferente dos modelos densos tradicionais, o Yuan3.0 Ultra utiliza esparsidade para escalar a capacidade sem um aumento linear no custo computacional. Poda de Especialistas Adaptativa por Camada (LAEP) A inovação primária no treinamento do Yuan3.0 Ultra é o algoritmo Layer-Adaptive Expert Pruning (LAEP). Embora a poda de especialistas seja tipicamente aplicada pós-treinamento, o LAEP identifica e remove especialistas subutilizados diretamente durante o estágio de pré-treinamento. Pesquisas sobre a distribuição de carga de especialistas revelaram duas fases distintas durante o pré-treinamento: Fase de Transição Inicial: Caracterizada por alta volatilidade nas cargas de especialistas herdadas da inicialização aleatória. Fase Estável: As cargas de especialistas convergem, e o ranqueamento relativo de especialistas com base na atribuição de token permanece amplamente fixo. Uma vez atingida a fase estável, o LAEP aplica a poda com base em duas restrições: Restrição de Carga Individual (⍺): Visa especialistas cuja carga de token é significativamente menor do que a média da camada. Restrição de Carga Cumulativa (β): Identifica o subconjunto de especialistas que menos contribuem para o processamento total de tokens. Ao aplicar o LAEP com β=0.1 e variar ⍺, o modelo foi podado de um inicial de 1.5T parâmetros para 1T parâmetros. Essa redução de 33.3% no total de parâmetros preservou o desempenho multidomínio do modelo, enquanto reduziu significativamente os requisitos de memória para implantação. Na configuração de 1T, o número de especialistas por camada foi reduzido de 64 para um máximo de 48 especialistas preservados. https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra/blob/main/Docs/Yuan3.0_Ultra%20Paper.pdf Eficiência de Hardware e Rearranjo de Especialistas MoE As MoE frequentemente sofrem de desequilíbrio de carga em nível de dispositivo quando os especialistas são distribuídos por um cluster de computação. Para resolver isso, o Yuan3.0 Ultra implementa um algoritmo de Rearranjo de Especialistas. Este algoritmo classifica os especialistas por carga de token e usa uma estratégia gulosa para distribuí-los entre as GPUs, de modo que a variância cumulativa de tokens seja minimizada. Método TFLOPS por GPU Modelo Base (1515B) 62.14 Profundo

Fonte: MarkTechPost

Publicado em 2026-03-05

Notícias relacionadas

Continue explorando