A próxima era da inferência de IA não será definida por um único chip, rede ou sistema revolucionário. Ela será definida por como cada camada da fábrica de IA funciona em conjunto. É por isso que a NVIDIA está expandindo o Vera Rubin NVL72 com geração rápida de tokens para sistemas agentic. Anunciado hoje, o sistema em escala de rack NVIDIA Vera Rubin NVIDIA Groq 3 LPX está em produção total. Em um benchmark da Artificial Analysis rodando Gemma 4 31B, um modelo agentic de código aberto, ele entregou 3.400 tokens de saída por segundo para casos de uso de contexto longo de 100.000 tokens, críticos para sistemas agentic, 4x mais rápido que a plataforma alternativa mais próxima. Parceiros da indústria em todo o mundo estão adotando as soluções da plataforma Vera Rubin. A SpaceXAI anunciou que as CPUs NVIDIA Vera irão alimentar sua próxima geração de IA agentic. A CoreWeave implementou em produção o Spectrum-X Multiplane, que conecta racks NVIDIA Vera Rubin usando múltiplos switches paralelos para fornecer redes de IA de alta largura de banda, planas e sem perdas. A Nebius é a primeira nuvem de IA a adotar o NVIDIA Groq 3 LPX. À medida que a IA passa do treinamento para o raciocínio e sistemas agentic, a inferência se tornou a nova fronteira. Os sistemas de IA agentic estão gerando mais tokens, processando janelas de contexto dramaticamente maiores e colaborando cada vez mais com outros sistemas de IA para resolver problemas complexos. Essas cargas de trabalho exigem uma nova cla…
Fonte: NVIDIA AI Blog
Publicado em 2026-08-24