Construir simuladores para robôs tem sido um desafio de longa data. Motores tradicionais exigem codificação manual de física e modelos 3D perfeitos. A NVIDIA está mudando isso com o DreamDojo, um modelo de mundo robótico totalmente open-source e generalizável. Em vez de usar um motor de física, o DreamDojo 'sonha' os resultados das ações do robô diretamente em pixels. https://arxiv.org/pdf/2602.06949 Escalando a Robótica com Mais de 44 mil Horas de Experiência Humana O maior obstáculo para a IA na robótica é o dado. Coletar dados específicos de robôs é caro e lento. O DreamDojo resolve isso aprendendo com mais de 44 mil horas de vídeos humanos egocêntricos. Este conjunto de dados, chamado DreamDojo-HV, é o maior de seu tipo para pré-treinamento de modelos de mundo. Ele apresenta 6.015 tarefas únicas em mais de 1 milhão de trajetórias. Os dados cobrem 9.869 cenas únicas e 43.237 objetos únicos. O pré-treinamento utilizou 100.000 horas de GPU NVIDIA H100 para construir variantes de modelos de 2B e 14B. Os humanos já dominaram físicas complexas, como derramar líquidos ou dobrar roupas. O DreamDojo usa esses dados humanos para dar aos robôs uma compreensão de 'senso comum' de como o mundo funciona. https://arxiv.org/pdf/2602.06949 Preenchendo a Lacuna com Ações Latentes Vídeos humanos não contêm comandos motores de robôs. Para tornar esses vídeos 'legíveis por robôs', a equipe de pesquisa da NVIDIA introduziu ações latentes contínuas. Este sistema usa um Transformer VAE espaço-temporal para extrair ações diretamente dos pixels. O codificador VAE pega 2 quadros consecutivos e produz um vetor latente de 32 dimensões. Este vetor representa o movimento mais crítico entre os quadros. O design cria um gargalo de informação que desvincula a ação do contexto visual. Isso permite que o modelo aprenda física de humanos e a aplique a diferentes corpos de robôs. https://arxiv.org/pdf/2602.06949 Melhor Física Através da Arquitetura O DreamDojo é baseado no modelo de difusão de vídeo latente Cosmos-Predict2.5. Ele usa o tokenizador WAN2.2, que possui uma taxa de compressão temporal de 4. A equipe aprimorou a arquitetura com 3 características principais: Ações Relativas: O modelo usa variações de junta (joint deltas) em vez de poses absolutas. Isso facilita a generalização do modelo em diferentes trajetórias. Injeção de Ação em Blocos: Injeta 4 ações consecutivas em cada quadro latente. Isso alinha as ações com a taxa de compressão do tokenizador e corrige a confusão de causalidade. Perda de Consistência Temporal: Uma nova função de perda que corresponde as velocidades de quadro previstas às transições de verdade absoluta. Isso
Fonte: MarkTechPost
Publicado em 2026-02-20