Todo modelo de IA inovador começa da mesma forma: com uma rodada de treinamento. A infraestrutura que executa esses trabalhos de treinamento molda tudo: a velocidade com que as equipes podem iterar, a escala do modelo que podem construir e se esses trabalhos são concluídos de forma confiável. À medida que os modelos crescem em tamanho, complexidade e inteligência, as demandas sobre a infraestrutura de treinamento também aumentam. No MLPerf Training 6.0 — a mais recente de uma série de benchmarks rigorosos e revisados por pares para avaliar o desempenho do treinamento de IA — a plataforma NVIDIA Blackwell liderou em todas as categorias, demonstrando: O tempo mais rápido para treinar em cada benchmark. O treinamento de maior escala em 8.192 GPUs usando sistemas NVIDIA Blackwell NVL72. A única plataforma com submissões em todos os sete benchmarks do conjunto. A NVIDIA reúne desempenho, escala e confiabilidade em uma única plataforma, projetada por meio de codesign extremo para permitir que os construtores de modelos de IA lancem modelos de ponta mais rapidamente, minimizem os custos de treinamento e comecem a gerar receita mais cedo. Desempenho: Tempo Mais Rápido para Treinar em Cada Benchmark. O MLPerf Training 6.0 adicionou duas novas cargas de trabalho de pré-treinamento de Mixture-of-Experts (MoE) ao conjunto: DeepSeek-V3 671B e GPT-OSS-20B, refletindo a crescente centralidade das arquiteturas MoE. A plataforma NVIDIA foi a única a ser submetida em todos os benchmarks e entregou o tempo de treinamento mais rápido em todos os sete. Nesta rodada, a NVIDIA apresentou resultados tanto nos sistemas NVIDIA GB200 NVL72 quanto nos sistemas GB300 NVL72 em escala de rack. Dentro de cada sistema em escala de rack, switches NVIDIA NVLink de quinta geração conectam todas as 72 GPUs com alta largura de banda, em um pool unificado de computação e memória, permitindo que elas atuem como uma única GPU gigante. O treinamento MoE em larga escala enfrenta o mesmo desafio de comunicação all-to-all que a inferência MoE — os tokens devem ser roteados entre as GPUs para alcançar a sub-rede de especialistas correta — e a vantagem de largura de banda do NVLink é o que torna isso rápido e eficiente em escala. A NVIDIA também demonstrou métodos de treinamento NVFP4 que aumentam o desempenho enquanto atendem à precisão estrita.
Fonte: NVIDIA AI Blog
Publicado em 2026-06-16