O desempenho do sistema, a escalabilidade eficiente da infraestrutura e a otimização contínua de software são alavancas essenciais que determinam a economia da inferência de IA. Um desempenho de sistema superior significa mais tokens gerados, resultando em maior receita. A escalabilidade eficiente significa que o throughput cresce proporcionalmente à medida que o hardware é adicionado, exigindo menos recursos para atender usuários em escala. A otimização contínua significa gerar mais valor a partir dos investimentos em infraestrutura. Subjacente a todos os três está a fungibilidade da plataforma: a mesma infraestrutura executa qualquer modelo, qualquer workload, de treinamento a inferência, de recomendador a raciocínio, de linguagem a vídeo, mantendo a utilização alta. A plataforma NVIDIA é projetada especificamente para otimizar todos esses aspectos, conforme destacado pelos resultados do MLPerf Inference v6.1 lançados hoje:
* **O sistema NVIDIA Vera Rubin NVL72 estreia com desempenho líder**: Em sua primeira submissão de pré-visualização no MLPerf Inference, o NVIDIA Vera Rubin NVL72 entrega um throughput até 3,7x melhor que o GB300 NVL72.
* **O NVIDIA GB300 NVL72 escala com eficiência líder**: Uma submissão de 288 GPUs em quatro racks GB300 NVL72 alcançou 99% de eficiência de escalabilidade, com o throughput crescendo quase linearmente a partir de uma linha de base de rack único.
* **Otimizações contínuas de software impulsionam ganhos de desempenho**: As otimizações de software nas submissões do MLPerf Inference v6.1 da NVIDIA proporcionaram um desempenho até 1,6x maior em relação à v6.0. As otimizações continuaram após a submissão v6.1, entregando ganhos adicionais de desempenho.
Para organizações que tomam decisões de infraestrutura de IA, desempenho, eficiência de escalabilidade e velocidade de software são considerações importantes que determinam a economia de inferência a longo prazo. O Vera Rubin NVL72 faz sua estreia no MLPerf Inference com desempenho líder. A NVIDIA submeteu os resultados de pré-visualização do Vera Rubin NVL72 em dois dos benchmarks mais exigentes do conjunto MLPerf Inference v6.1: DeepSeek-R1 e Qwen3-VL. O Vera Rubin NVL72 entrega um throughput até 3,7x maior que o GB300 NVL72 no Qwen3-VL em cenários offline, de servidor e interativos, usando vLLM com o NV
Fonte: NVIDIA AI Blog
Publicado em 2026-09-16