De acordo com dados da OpenRouter, as cargas de trabalho de IA "agentic" consomem 15x mais tokens do que uma simples solicitação de chat. Por quê? Considere o que acontece quando um agente de IA pesquisa uma empresa para uma decisão de investimento. O agente consulta bancos de dados financeiros, pesquisa notícias e documentos, invoca um sub-agente para realizar comparações entre pares e modelar avaliações, e então sintetiza tudo em uma recomendação. Agentes e sub-agentes continuam raciocinando até que a tarefa seja concluída, impulsionando o aumento da demanda por tokens. A cada passo, os tokens acumulados tornam-se a entrada para o próximo, tornando o manuseio de longo contexto central para o desempenho da IA "agentic". O mesmo padrão se repete em todos os casos de uso "agentic", desde o desenvolvimento de software até o atendimento ao cliente e pesquisa aprofundada. À medida que a IA "agentic" avança para a produção em todas as indústrias, a infraestrutura que a executa precisa atender a essa demanda de tokens de forma eficiente. Novos dados de desempenho medidos mostram que os sistemas NVIDIA Vera Rubin NVL72 entregam até 30x mais throughput por megawatt do que o NVIDIA GB300 NVL72 em cargas de trabalho "agentic". A NVIDIA mediu esses dados de throughput de inferência usando a carga de trabalho SemiAnalysis AgentX, que consiste em sessões de codificação "agentic" reais gravadas, com crescimento real de contexto, chamadas de ferramentas e "spawning" de sub-agentes preserva…
Fonte: NVIDIA AI Blog
Publicado em 2026-08-24