Pesquisadores do MIT desenvolveram uma abordagem impulsionada por inteligência artificial generativa para planejar tarefas visuais de longo prazo, como navegação robótica, que é cerca de duas vezes mais eficaz do que algumas técnicas existentes.
O método deles usa um modelo especializado de visão-linguagem para perceber o cenário em uma imagem e simular as ações necessárias para alcançar um objetivo. Em seguida, um segundo modelo traduz essas simulações para uma linguagem de programação padrão para problemas de planejamento e refina a solução.
No final, o sistema gera automaticamente um conjunto de arquivos que podem ser alimentados em software de planejamento clássico, que calcula um plano para atingir o objetivo. Este sistema de dois passos gerou planos com uma taxa média de sucesso de cerca de 70%, superando os melhores métodos de linha de base que alcançavam apenas cerca de 30%.
Importante, o sistema pode resolver novos problemas que nunca encontrou antes, tornando-o adequado para ambientes reais onde as condições podem mudar a qualquer momento.
“Nosso framework combina as vantagens de modelos de visão-linguagem, como sua capacidade de entender imagens, com as fortes capacidades de planejamento de um resolvedor formal”, diz Yilun Hao, estudante de pós-graduação em aeronáutica e astronáutica (AeroAstro) no MIT e autor principal de um artigo de acesso aberto sobre esta técnica. “Ele pode pegar uma única imagem e movê-la através de simulação e, em seguida, para um plano confiável de longo horizonte que pode ser útil em muitas aplicações da vida real.”
Ela é acompanhada no artigo por Yongchao Chen, estudante de pós-graduação no Laboratório de Sistemas de Informação e Decisão (LIDS) do MIT; Chuchu Fan, professora associada em AeroAstro e pesquisadora principal no LIDS; e Yang Zhang, cientista de pesquisa no MIT-IBM Watson AI Lab. O artigo será apresentado na Conferência Internacional sobre Representações de Aprendizado.
Abordando tarefas visuais
Nos últimos anos, Fan e seus colegas estudaram o uso de modelos de IA generativa para realizar raciocínio e planejamento complexos, frequentemente empregando Large Language Models (LLMs) para processar entradas de texto.
Muitos problemas de planejamento do mundo real, como montagem robótica e direção autônoma, têm entradas visuais que um LLM não consegue lidar bem por si só. Os pesquisadores buscaram expandir para o domínio visual utilizando
Fonte: MIT News AI
Publicado em 2026-03-11