A energia é a restrição inescapável da infraestrutura de IA. Quantos tokens uma fábrica de IA pode gerar dentro de um orçamento de energia fixo determina sua receita e lucratividade. Por causa disso, o desempenho por watt — uma métrica que não pode ser manipulada, apenas obtida por meio de resultados do mundo real — é a base para as fábricas de IA. À medida que a IA agêntica impulsiona a demanda por tokens, as decisões de infraestrutura que as organizações tomam hoje determinarão quem escala e quem não escala em um mundo com restrições de energia. Praticamente todos os modelos de IA de ponta hoje funcionam em uma arquitetura de mistura de especialistas (MoE). Servir esses modelos em larga escala de forma eficiente significa que o tamanho do domínio da GPU — o número de GPUs conectadas por meio de uma interconexão ultrarrápida e escalável — é importante, e quanto maior, melhor. Embora a geração NVIDIA Hopper tenha estabelecido o padrão com um domínio de oito GPUs, a escala da IA de ponta hoje superou isso. Servir MoE com um domínio de 72 GPUs exige codesign full-stack e a profundidade operacional obtida ao executar esses modelos sob carga de produção real. Com a plataforma NVIDIA Blackwell NVL72, essa base já está construída e comprovada, oferecendo o maior desempenho por watt para maximizar as receitas e o menor custo por token para maximizar as margens de lucro. É sobre essa base que a plataforma NVIDIA Vera Rubin se desenvolve para elevar ainda mais a eficiência energética em escala de rack. Maximizando o Desempenho por Watt para IA de Ponta Cada nova geração de modelos de ponta traz mudanças arquitetônicas que desbloqueiam maior inteligência, ao mesmo tempo em que exigem novas otimizações para serem executadas eficientemente em escala. Entre a mais recente geração de modelos abertos líderes, o NVIDIA GB300 NVL72 oferece até 25x mais desempenho por watt em comparação com a geração NVIDIA Hopper — mostrando que o desempenho de MoE melhora ao passar de um domínio de 8 GPUs para 72 GPUs. Esses números refletem onde a Blackwell se encontra hoje, um ponto de partida que continua a melhorar. Qualquer número único conta apenas parte da história. Diferentes cargas de trabalho exigem diferentes pontos de operação.
Fonte: NVIDIA AI Blog
Publicado em 2026-07-14