Com Groq 3 LPX em Produção Total, NVIDIA Expande a Inferência Vera Rubin para Agentes

A próxima era da inferência de IA não será definida por um único chip, rede ou sistema revolucionário. Ela será definida por como cada camada da fábrica de IA funciona em conjunto. É por isso que a NVIDIA está expandindo o Vera Rubin NVL72 com geração rápida de tokens para sistemas agentic. Anunciado hoje, o sistema em escala de rack NVIDIA Vera Rubin NVIDIA Groq 3 LPX está em produção total. Em um benchmark da Artificial Analysis rodando Gemma 4 31B, um modelo agentic de código aberto, ele entregou 3.400 tokens de saída por segundo para casos de uso de contexto longo de 100.000 tokens, críticos para sistemas agentic, 4x mais rápido que a plataforma alternativa mais próxima. Parceiros da indústria em todo o mundo estão adotando as soluções da plataforma Vera Rubin. A SpaceXAI anunciou que as CPUs NVIDIA Vera irão alimentar sua próxima geração de IA agentic. A CoreWeave implementou em produção o Spectrum-X Multiplane, que conecta racks NVIDIA Vera Rubin usando múltiplos switches paralelos para fornecer redes de IA de alta largura de banda, planas e sem perdas. A Nebius é a primeira nuvem de IA a adotar o NVIDIA Groq 3 LPX. À medida que a IA passa do treinamento para o raciocínio e sistemas agentic, a inferência se tornou a nova fronteira. Os sistemas de IA agentic estão gerando mais tokens, processando janelas de contexto dramaticamente maiores e colaborando cada vez mais com outros sistemas de IA para resolver problemas complexos. Essas cargas de trabalho exigem uma nova classe de infraestrutura otimizada não apenas para desempenho, mas para throughput, capacidade de resposta e economia em uma escala sem precedentes. Na conferência Hot Chips esta semana em Palo Alto, Califórnia, a NVIDIA está mostrando como o codesign extremo está remodelando a fábrica de IA de ponta a ponta. Ao arquitetar computação, redes e aceleração de inferência como um sistema unificado, a NVIDIA está ajudando os clientes a construir infraestruturas projetadas especificamente para as demandas emergentes de inferência de contexto longo e sistemas multiagentes. Codesign Extremo Otimiza para Desempenho. O codesign extremo é o princípio norteador por trás das plataformas NVIDIA. O Vera Rubin é projetado para acelerar a inferência enquanto os agentes raciocinam sobre

Fonte: NVIDIA AI Blog

Publicado em 2026-08-24

Notícias relacionadas

Continue explorando