Pesquisadores da NVIDIA, em colaboração com a Princeton University e a University of Maryland, apresentaram o PivotOPD — um método de distilação on-policy que treina agentes de IA multi-turno a evitar os erros iniciais mais prejudiciais e a se recuperar quando ocorrem.
O problema
Em interações multi-turno, um erro em um turno precoce muda os estados que o agente encontra nos turnos seguintes. Erros se acumulam: um rollout que falha no turno 2 provavelmente falha nos turnos 3, 4, 5 e assim por diante.
Os pesquisadores descobriram que mais da metade dos rollouts falidos contêm um "pivotal mistake" — uma ação que desvia o agente de uma trajetória recuperável.
O PivotOPD
O PivotOPD é um método de distilação on-policy que treina o aluno em duas frentes:
- Evitar a ação que derruba o rollout
- Recuperar-se quando o erro já aconteceu
Diferente da distilação off-policy tradicional (que treina com trajetórias de um tutor), o PivotOPD treina o aluno em sua própria trajetção — com feedback focado nos pontos de pivô.
Resultados
- Taxa de recuperação: 72.7% com PivotOPD vs 20.3% com OPD padrão
- Modelos de aluno: Qwen3-1.7B e Qwen3-8B
- Benchmarks: ALFWorld, WebShop, Search-QA
- Baselines: 13 métodos comparados
O PivotOPD foi o melhor em todos os três benchmarks, superando todos os 13 baselines.
Por que importa
Agentes multi-turno são o futuro da automação com IA — mas a fragilidade a erros iniciais é um dos principais obstáculos para produção. O PivotOPD oferece uma solução treinável e mensurável: em vez de apenas evitar erros, o agente aprende a se recuperar deles.
A taxa de recuperação de 72.7% (vs 20.3% da OPD padrão) é uma melhora de 3.6x, o que pode ser a diferença entre um agente que falha em produção e um que se mantém operacional.
O trabalho é aberto (arXiv 2609.40285) e os modelos de aluno são baseados em Qwen3 — o que permite reprodução e extensão pela comunidade.
Fontes e referências
Encontrou uma informação que precisa de correção? Fale com a redação.
