O AgentPerf da Artificial Analysis, o primeiro benchmark de IA agente da indústria, oferece a desenvolvedores, empresas e provedores de infraestrutura uma maneira clara de comparar sistemas para IA agente. Na primeira rodada de resultados publicados, a plataforma NVIDIA Blackwell Ultra NVL72 oferece desempenho líder em todas as cargas de trabalho de IA agente testadas, rodando 20x mais agentes por megawatt do que a NVIDIA Hopper. A IA agente é uma carga de trabalho fundamentalmente diferente da IA conversacional. Uma única conclusão de chat é um sprint: uma chamada de grande modelo de linguagem (LLM), uma resposta. Um agente funciona mais como um revezamento: ele divide uma meta em muitas etapas e continua até que a tarefa seja concluída. Os agentes encadeiam múltiplas chamadas de LLM e chamadas de ferramentas para coletar contexto, observar, raciocinar e agir. Isso resulta em dezenas a centenas de chamadas de LLM encadeadas, cada uma passando contexto crescente para a próxima, com chamadas de ferramentas como compilação e execução de código, pesquisa de banco de dados e navegação na web a cada transição. A complexidade não é aditiva; é multiplicativa. A distinção é extremamente importante para a medição de desempenho. Os benchmarks de inferência de IA existentes medem uma chamada de LLM: quão rápido um LLM responde a uma única solicitação e quantas solicitações simultâmicas um sistema pode lidar. Eles não foram projetados para cargas de trabalho de agentes, onde chamadas de LLM encadeadas, atrasos nas chamadas de ferramentas e contexto crescente sobrecarregam os sistemas de computação acelerada de maneiras fundamentalmente diferentes do que uma única chamada de LLM jamais poderia. Para empresas que constroem e implementam agentes em escala, é importante entender quão responsivos os agentes são, quantos podem ser implantados simultaneamente e quanto trabalho útil a infraestrutura de IA pode entregar por cada dólar e watt investidos. NVIDIA GB300 NVL72 Roda 20x Mais Agentes por Megawatt Nesta primeira rodada, o AgentPerf mede o desempenho de agentes com o DeepSeek V4 Pro, um grande modelo de mistura de especialistas (MoE) que representa a classe de modelos de ponta que impulsionam os agentes mais capazes de hoje. Nesta carga de trabalho, o NVIDIA GB300 NVL72 entregou
Fonte: NVIDIA AI Blog
Publicado em 2026-06-12