NVIDIA lança Dynamo v0.9.0: Uma enorme revisão de infraestrutura com FlashIndexer, suporte Multi-Mo…

A NVIDIA acaba de lançar o Dynamo v0.9.0. Esta é a atualização de infraestrutura mais significativa para a estrutura de inferência distribuída até o momento. Esta atualização simplifica como modelos em larga escala são implantados e gerenciados. O lançamento foca na remoção de dependências pesadas e na melhoria de como as GPUs lidam com dados multi-modais. A Grande Simplificação: Removendo NATS e etcd A maior mudança no v0.9.0 é a remoção de NATS e ETCD. Em versões anteriores, essas ferramentas lidavam com descoberta de serviço e mensageria. No entanto, elas adicionavam um 'custo operacional' ao exigir que os desenvolvedores gerenciassem clusters extras. A NVIDIA os substituiu por um novo Event Plane e um Discovery Plane. O sistema agora usa ZMQ (ZeroMQ) para transporte de alto desempenho e MessagePack para serialização de dados. Para equipes que usam Kubernetes, o Dynamo agora oferece suporte à descoberta de serviço nativa do Kubernetes. Essa mudança torna a infraestrutura mais enxuta e fácil de manter em ambientes de produção. Suporte Multi-Modal e a Divisão E/P/D O Dynamo v0.9.0 expande o suporte multi-modal em 3 backends principais: vLLM, SGLang e TensorRT-LLM. Isso permite que os modelos processem texto, imagens e vídeo de forma mais eficiente. Um recurso chave nesta atualização é a divisão E/P/D (Encode/Prefill/Decode). Em configurações padrão, uma única GPU geralmente lida com todos os 3 estágios. Isso pode causar gargalos durante o processamento pesado de vídeo ou imagem. O v0.9.0 introduz a Desagregação do Codificador (Encoder Disaggregation). Agora você pode executar o Codificador em um conjunto separado de GPUs dos workers de Prefill e Decode. Isso permite escalar seu hardware com base nas necessidades específicas do seu modelo. Prévia Exclusiva: FlashIndexer Este lançamento inclui uma prévia exclusiva do FlashIndexer. Este componente foi projetado para resolver problemas de latência no gerenciamento de cache KV distribuído. Ao trabalhar com grandes janelas de contexto, mover dados Key-Value (KV) entre GPUs é um processo lento. O FlashIndexer melhora como o sistema indexa e recupera esses tokens em cache. Isso resulta em um Tempo para o Primeiro Token (TTFT) menor. Embora ainda seja uma prévia, representa um grande passo para fazer a inferência distribuída parecer tão rápida quanto a inferência local. Roteamento Inteligente e Estimativa de Carga Gerenciar o tráfego em centenas de GPUs é difícil. O Dynamo v0.9.0 introduz um Planner mais inteligente que usa estimativa de carga preditiva. O sistema usa um filtro de Kalman para prever a carga futura de uma solicitação com base no desempenho passado. Ele também suporta dicas de roteamento da Extensão de Inferência da API Gateway do Kubernetes (GAIE). Isso permite que a camada de rede c

Fonte: MarkTechPost

Publicado em 2026-02-20

Notícias relacionadas

Continue explorando