Como a pilha de software de inferência da NVIDIA impulsiona o menor custo por token

À medida que as organizações avançam de pilotos de IA para fábricas de IA em produção, as decisões de infraestrutura mudaram das especificações máximas de chips para o custo por token: quantos tokens úteis elas podem entregar por dólar, por watt e dentro das metas de latência exigidas. Codesejado com GPUs, CPUs, rede e sistemas NVIDIA, e fortalecido por um amplo ecossistema de código aberto, o software de inferência full-stack da NVIDIA melhora continuamente o desempenho do hardware. Na plataforma NVIDIA Blackwell, a pilha de software já reduziu os custos por token em até 5x no modelo DeepSeek V4 em apenas um mês. Os resultados do SemiAnalysis InferenceX comparam o custo por token e a interatividade para sistemas NVIDIA GB300 NVL72 com SGLang e o framework de inferência NVIDIA Dynamo. Empresas líderes e provedores de inferência já estão vendo o valor composto da pilha de software de inferência da NVIDIA em Blackwell: a Baseten usou a biblioteca de código aberto NVIDIA TensorRT-LLM para servir DeepSeek V4 Pro em GPUs Blackwell para raciocínio, codificação e cargas de trabalho de contexto longo, aplicando otimizações de tempo de execução proprietárias para entregar até 50% mais tokens por segundo. A Cognition está usando o framework de inferência NVIDIA Dynamo para gerenciar GPUs de inferência, proporcionando à sua equipe um caminho pronto para escalar cargas de trabalho de reinforcement learning sem a necessidade de construir essa infraestrutura do zero. A Deep Infra usa a pilha de software de inferência da NVIDIA para servir modelos de código aberto de ponta de forma performática em Blackwell desde o primeiro dia, incluindo o DeepSeek V4. A DigitalOcean ajudou a Hippocratic AI a usar o software de inferência da NVIDIA em GPUs Blackwell para servir IA de saúde de forma mais rápida e eficiente, aumentando o throughput de inferência em 30%, mantendo um tempo de primeira resposta inferior a meio segundo em 10 milhões de chamadas de pacientes. A Together AI usou o NVIDIA TensorRT-LLM em Blackwell para ajudar a Cursor a acelerar o caminho de otimizações de modelo para endpoints de produção para sua experiência de codificação em tempo real. Por que o software é importante para a economia da inferência Web tradicional, pesquisa e softw

Fonte: NVIDIA AI Blog

Publicado em 2026-06-30

Notícias relacionadas

Continue explorando