Linhas de produção, armazéns e fábricas raramente permanecem estáticas — tarefas mudam, layouts são alterados e novos produtos chegam, e a maioria dos robôs não consegue acompanhar sem uma reprogramação significativa. O novo modelo de fundação para robôs S1 da Skild AI ajuda a resolver isso, projetado para aprender tarefas não vistas anteriormente, de longo horizonte, a partir de uma única demonstração em vídeo. O modelo, lançado na semana passada, utiliza vídeo como entrada para entender e executar a tarefa sem atualizar seus pesos ou passar por pós-treinamento específico para a tarefa — uma técnica chamada aprendizado em contexto (in-context learning). A Skild construiu o S1 e conduziu a pesquisa na infraestrutura de AI da NVIDIA, parte de uma colaboração mais ampla que abrange geração de dados sintéticos, treinamento de modelos, simulação e implementação de AI física no mundo real. As empresas estão trabalhando juntas para levar a inteligência robótica adaptável do laboratório para fábricas e outros ambientes operacionais dinâmicos. “Aprender por experiência, e não por pré-programação, é a mudança fundamental que ocorreu na robótica”, disse Deepak Pathak, cofundador e CEO da Skild AI. “As tecnologias NVIDIA Isaac Lab e NVIDIA Cosmos ajudam a Skild a criar a experiência escalável e diversificada que seus robôs precisam para aprender em muitos cenários e encarnações.” O lançamento ocorre no momento em que a empresa atingiu uma taxa de receita anual de US$ 100 milhões, 10 meses após sua primeira implantação comercial. Nesse período, a Skild construiu mais de 60 parcerias de implantação com trabalhos em manufatura, logística, inspeção, segurança, preparação de alimentos e outras aplicações. Aprendendo Novas Tarefas a Partir de Um Vídeo A maioria dos robôs industriais é construída para trabalhos fixos, então cada novo produto, processo ou layout exige mais dados, retreinamento e validação. O S1 adota uma abordagem diferente: Um operador grava um vídeo da tarefa desejada e o fornece ao modelo como um prompt. Ele interpreta a intenção, os objetos e a sequência demonstrados, e então os mapeia em ações para o robô à sua frente — sem retreinamento — e muitas vezes para uma tarefa não coberta por seu conjunto de dados de pré-treinamento.
Fonte: NVIDIA AI Blog
Publicado em 2026-09-10