Até 30x Mais Trabalho Por Watt: NVIDIA Vera Rubin NVL72 Estabelece um Novo Padrão de Eficiência par…

De acordo com dados da OpenRouter, as cargas de trabalho de IA "agentic" consomem 15x mais tokens do que uma simples solicitação de chat. Por quê? Considere o que acontece quando um agente de IA pesquisa uma empresa para uma decisão de investimento. O agente consulta bancos de dados financeiros, pesquisa notícias e documentos, invoca um sub-agente para realizar comparações entre pares e modelar avaliações, e então sintetiza tudo em uma recomendação. Agentes e sub-agentes continuam raciocinando até que a tarefa seja concluída, impulsionando o aumento da demanda por tokens. A cada passo, os tokens acumulados tornam-se a entrada para o próximo, tornando o manuseio de longo contexto central para o desempenho da IA "agentic". O mesmo padrão se repete em todos os casos de uso "agentic", desde o desenvolvimento de software até o atendimento ao cliente e pesquisa aprofundada. À medida que a IA "agentic" avança para a produção em todas as indústrias, a infraestrutura que a executa precisa atender a essa demanda de tokens de forma eficiente. Novos dados de desempenho medidos mostram que os sistemas NVIDIA Vera Rubin NVL72 entregam até 30x mais throughput por megawatt do que o NVIDIA GB300 NVL72 em cargas de trabalho "agentic". A NVIDIA mediu esses dados de throughput de inferência usando a carga de trabalho SemiAnalysis AgentX, que consiste em sessões de codificação "agentic" reais gravadas, com crescimento real de contexto, chamadas de ferramentas e "spawning" de sub-agentes preservados. Para fábricas de IA com restrição de energia, isso se traduz diretamente em 30x mais trabalho "agentic" para a mesma pegada de energia. Esses resultados iniciais para o Vera Rubin NVL72 demonstram o ritmo acelerado de inovação da NVIDIA. Com otimizações contínuas de software, o desempenho tanto do Vera Rubin NVL72 quanto do GB300 NVL72 continuará a melhorar. Vera Rubin NVL72: 30x Mais Throughput por Megawatt e 35x Menor Custo por Token. As cargas de trabalho "agentic" são fundamentalmente diferentes do chat ou da sumarização de documentos, onde as sequências de entrada e saída geralmente variam de 1K a 8K tokens. Em sessões "agentic", o contexto se acumula ao longo das etapas e pode atingir centenas de milhares de tokens de entrada, com ampla variabilidade nos comprimentos de entrada e saída entre as solicitações. Desempenho

Fonte: NVIDIA AI Blog

Publicado em 2026-08-24

Notícias relacionadas

Continue explorando