Até 30x Mais Trabalho Por Watt: NVIDIA Vera Rubin NVL72 Estabelece um Novo Padrão de Eficiência par…

De acordo com dados da OpenRouter, as cargas de trabalho de IA "agentic" consomem 15x mais tokens do que uma simples solicitação de chat. Por quê? Considere o que acontece quando um agente de IA pesquisa uma empresa para uma decisão de investimento. O agente consulta bancos de dados financeiros, pesquisa notícias e documentos, invoca um sub-agente para realizar comparações entre pares e modelar avaliações, e então sintetiza tudo em uma recomendação. Agentes e sub-agentes continuam raciocinando até que a tarefa seja concluída, impulsionando o aumento da demanda por tokens. A cada passo, os tokens acumulados tornam-se a entrada para o próximo, tornando o manuseio de longo contexto central para o desempenho da IA "agentic". O mesmo padrão se repete em todos os casos de uso "agentic", desde o desenvolvimento de software até o atendimento ao cliente e pesquisa aprofundada. À medida que a IA "agentic" avança para a produção em todas as indústrias, a infraestrutura que a executa precisa atender a essa demanda de tokens de forma eficiente. Novos dados de desempenho medidos mostram que os sistemas NVIDIA Vera Rubin NVL72 entregam até 30x mais throughput por megawatt do que o NVIDIA GB300 NVL72 em cargas de trabalho "agentic". A NVIDIA mediu esses dados de throughput de inferência usando a carga de trabalho SemiAnalysis AgentX, que consiste em sessões de codificação "agentic" reais gravadas, com crescimento real de contexto, chamadas de ferramentas e "spawning" de sub-agentes preserva…

Fonte: NVIDIA AI Blog

Publicado em 2026-08-24

Ver todas as notícias de IA