Como um Large Language Model trilhardário em parâmetros pode alcançar desempenho empresarial de ponta, ao mesmo tempo em que reduz seu número total de parâmetros em 33,3% e aumenta a eficiência do pré-treinamento em 49%? A Yuan Lab AI lança o Yuan3.0 Ultra, um modelo de linguagem grande (LLM) Mixture-of-Experts (MoE) de código aberto que apresenta 1T de parâmetros totais e 68,8B de parâmetros ativados. A arquitetura do modelo é projetada para otimizar o desempenho em tarefas específicas da empresa, mantendo capacidades competitivas de uso geral. Diferente dos modelos densos tradicionais, o Yuan3.0 Ultra utiliza esparsidade para escalar a capacidade sem um aumento linear no custo computacional. Poda de Especialistas Adaptativa por Camada (LAEP) A inovação primária no treinamento do Yuan3.0 Ultra é o algoritmo Layer-Adaptive Expert Pruning (LAEP). Embora a poda de especialistas seja tipicamente aplicada pós-treinamento, o LAEP identifica e remove especialistas subutilizados diretamente durante o estágio de pré-treinamento. Pesquisas sobre a distribuição de carga de especialistas revelaram duas fases distintas durante o pré-treinamento: Fase de Transição Inicial: Caracterizada por alta volatilidade nas cargas de especialistas herdadas da inicialização aleatória. Fase Estável: As cargas de especialistas convergem, e o ranqueamento relativo de especialistas com base na atribuição de token permanece amplamente fixo. Uma vez atingida a fase estável, o LAEP aplica a poda com base em duas restrições: Restrição de Carga Individual (⍺): Visa especialistas cuja carga de token é significativamente menor do que a média da camada. Restrição de Carga Cumulativa (β): Identifica o subconjunto de especialistas que menos contribuem para o processamento total de tokens. Ao aplicar o LAEP com β=0.1 e variar ⍺, o modelo foi podado de um inicial de 1.5T parâmetros para 1T parâmetros. Essa redução de 33.3% no total de parâmetros preservou o desempenho multidomínio do modelo, enquanto reduziu significativamente os requisitos de memória para implantação. Na configuração de 1T, o número de especialistas por camada foi reduzido de 64 para um máximo de 48 especialistas preservados. https://github.com/Yuan-lab-LLM/Yuan3.0-Ultra/blob/main/Docs/Yuan3.0_Ultra%20Paper.pdf Eficiência de Hardware e Rearranjo de Especialistas MoE As MoE frequentemente sofrem de desequilíbrio de carga em nível de dispositivo quando os especialistas são distribuídos por um cluster de computação. Para resolver isso, o Yuan3.0 Ultra implementa um algoritmo de Rearranjo de Especialistas. Este algoritmo classifica os especialistas por carga de token e usa uma estratégia gulosa para distribuí-los entre as GPUs, de modo que a variância cumulativa de tokens seja minimizada. Método TFLOPS por GPU Modelo Base (1515B) 62.14 Profundo
Fonte: MarkTechPost
Publicado em 2026-03-05