A plataforma NVIDIA Blackwell tem sido amplamente adotada pelos principais provedores de inferência, como Baseten, DeepInfra, Fireworks AI e Together AI, para reduzir o custo por token em até 10 vezes. Agora, a plataforma NVIDIA Blackwell Ultra está levando esse impulso ainda mais longe para a AI agentic. Agentes de AI e assistentes de codificação estão impulsionando um crescimento explosivo em consultas de AI relacionadas à programação de software: de 11% para cerca de 50% no ano passado, de acordo com o relatório State of Inference do OpenRouter. Essas aplicações exigem baixa latência para manter a capacidade de resposta em tempo real em fluxos de trabalho de várias etapas e um longo contexto ao raciocinar em bases de código inteiras. Novos dados de desempenho do SemiAnalysis InferenceX mostram que a combinação das otimizações de software da NVIDIA e da plataforma de próxima geração NVIDIA Blackwell Ultra proporcionou avanços revolucionários em ambas as frentes. Os sistemas NVIDIA GB300 NVL72 agora entregam até 50 vezes mais throughput por megawatt, resultando em um custo 35 vezes menor por token em comparação com a plataforma NVIDIA Hopper. Ao inovar em chips, arquitetura de sistema e software, o codesign extremo da NVIDIA acelera o desempenho em diversas cargas de trabalho de AI — desde codificação agentic até assistentes de codificação interativos — enquanto reduz os custos em escala. O GB300 NVL72 Oferece até 50x Melhor Desempenho para Cargas de Trabalho de Baixa Latência Uma análise recente da Signal65 mostra que o NVIDIA GB200 NVL72, com codesign extremo de hardware e software, oferece mais de 10 vezes mais tokens por watt, resultando em um décimo do custo por token em comparação com a plataforma NVIDIA Hopper. Esses ganhos massivos de desempenho continuam a se expandir à medida que a pilha subjacente melhora. As otimizações contínuas das equipes NVIDIA TensorRT-LLM, NVIDIA Dynamo, Mooncake e SGLang continuam a aumentar significativamente o throughput do Blackwell NVL72 para inferência de mixture-of-experts (MoE) em todos os alvos de latência. Por exemplo, as melhorias na biblioteca NVIDIA TensorRT-LLM entregaram até 5 vezes melhor desempenho no GB200 para cargas de trabalho de baixa latência em comparação com apenas quatro meses atrás. Kernels de GPU de alto desempenho otimizados para eficiência e baixa latência ajudam a aproveitar ao máximo as imensas capacidades de computação do Blackwell e aumentam o throughput. O NVIDIA NVLink Symmetric Memory permite acesso direto à memória de GPU para GPU para uma comunicação mais eficiente. O lançamento programático dependente minimiza o tempo ocioso ao iniciar a fase de configuração do próximo kernel antes que o anterior seja concluído. Com base nesses avanços de software, o GB300 NVL72 — que apresenta a GPU Blackwell Ultra — impulsiona o
Fonte: NVIDIA AI Blog
Publicado em 2026-02-16