NVIDIA PivotOPD Ensina Agentes de IA de Múltiplas Etapas a se Recuperarem de Erros Cruciais

Pesquisadores da NVIDIA, em colaboração com a Universidade de Princeton e a Universidade de Maryland, introduziram o PivotOPD, um método de destilação on-policy para agentes LLM de múltiplas etapas. A destilação on-policy do PivotOPD treina um agente para evitar seu erro inicial mais prejudicial e para se recuperar quando ele ocorre. Contra 13 baselines, ele obteve a melhor média em ALFWorld, WebShop e Search-based QA para alunos Qwen3-1.7B e Qwen3-8B. A conclusão: a recuperação é algo que pode ser aprendido, e o OPD padrão raramente a ensina. TL;DR Tamanho: Um método de treinamento, não um modelo. Testado em alunos Qwen3-1.7B e Qwen3-8B, além de um aluno Nemotron-3.5-SFT em SWE-Bench Verified. Executado em: Treinado em nós NVIDIA H100. Adiciona 0 custo de inferência, então o agente treinado é executado onde seu modelo base é executado. Desempenho: Primeiro em todas as 8 médias por benchmark contra 13 baselines, em 3 seeds. Melhor: Recupera-se de 72,7% dos erros cruciais replicados, contra 20,3% para o OPD padrão. Pior: 55,9% nas tarefas “Look” do ALFWorld com o aluno 1.7B, contra 83,9% para o SOD. Resumo: Melhor: ensina a recuperação que a RL baseada apenas em resultados não consegue alcançar. Pior: depende de ambientes replicáveis e de um professor cujos pontos cruciais correspondem ao oráculo em 77,8% das execuções falhas. O que é um erro crucial em um agente de múltiplas etapas? Um erro crucial é uma ação que alonga o menor caminho restante para concluir uma tarefa ou a torna insolúvel. O oráculo simbólico do ALFWorld mede isso a cada turno. Entre Qwen3-8B, Qwen3-30B-A3B e Qwen3-235B-A22B, 59% das execuções falhas (155 de 262) continham um. O primeiro turno crucial chegou cedo, com uma mediana de 8 a 12 de 30 turnos. Os agentes então desperdiçaram mais 18 a 21 turnos sem se recuperar. Em replays de falhas do Qwen3-8B, a correção do turno crucial aumentou o sucesso de 8% para 59%. Deixar o erro e forçar a ação correta nos próximos 2 turnos ainda atingiu 58%. Por que a destilação on-policy padrão não consegue identificar isso? O OPD padrão reduziu a taxa de falha retida de 79% para 56%. Falhas após um erro crucial

Fonte: MarkTechPost

Publicado em 2026-10-08

Notícias relacionadas

Continue explorando