CPUs com desempenho monothread máximo em escala são uma nova categoria de CPUs construídas para a era da IA agêntica. Na criação e implantação de um sistema agêntico, a CPU está no caminho crítico para raciocínio, tempo de resposta e aprendizado. As CPUs são o processador que executa o trabalho que o modelo de IA comanda: a chamada de ferramentas, execução de código, processamento de dados, cache KV e análise de resultados. Para agentes em fábricas de IA, a velocidade é crucial. Quanto mais rápido a CPU puder executar a ferramenta, mais rápido o agente poderá realizar a tarefa em questão. Para a fábrica de IA, a utilização da GPU é o recurso mais valioso no data center, então qualquer tempo de espera para a conclusão de uma tarefa restringe a receita de uma fábrica de IA — ou pior, afeta a utilização da GPU enquanto se espera que a CPU termine sua tarefa. As fábricas de IA precisam de uma CPU com desempenho monothread máximo para maximizar a receita da fábrica de IA e o desempenho do agente. As CPUs de data center atuais não são projetadas para velocidade em escala. Embora o mundo tenha CPUs rápidas para PCs e estações de trabalho, as CPUs de data center têm evoluído em direções opostas ao desempenho monothread. O advento da nuvem impulsionou os fabricantes de CPU a construir CPUs com maior número de núcleos, minimizando custos em detrimento do desempenho. A construção de CPUs que otimizam os custos por núcleo alugável aumentou o número de núcleos por chip, enquanto removeu a área de silício do que faz esses núcleos rodarem rápido — como malhas de memória de alto desempenho e processamento de instruções mais rápido por núcleo. A mudança para arquiteturas chiplet reduziu ainda mais o custo, mas criou um 'imposto chiplet' onde os núcleos de cada CPU não podem mais ter acesso ao desempenho total da memória do chip. Os agentes de IA precisam de uma CPU projetada para desempenho monothread máximo em escala. Uma CPU com desempenho monothread máximo em escala mantém cada etapa do agente rápida enquanto o sistema está totalmente carregado. Cada núcleo completa a tarefa do agente com desempenho total, sem que outros núcleos o desacelerem. CPUs com desempenho monothread máximo em escala são projetadas de forma diferente para entregar: Forte desempenho por núcleo u
Fonte: NVIDIA AI Blog
Publicado em 2026-07-07