Pesquisadores da NVIDIA, em colaboração com a Princeton University e a University of Maryland, apresentaram o PivotOPD — um método de distilação on-policy que treina agentes de IA multi-turno a evitar os erros iniciais mais prejudiciais e a se recuperar quando ocorrem.

O problema

Em interações multi-turno, um erro em um turno precoce muda os estados que o agente encontra nos turnos seguintes. Erros se acumulam: um rollout que falha no turno 2 provavelmente falha nos turnos 3, 4, 5 e assim por diante.

Os pesquisadores descobriram que mais da metade dos rollouts falidos contêm um "pivotal mistake" — uma ação que desvia o agente de uma trajetória recuperável.

O PivotOPD

O PivotOPD é um método de distilação on-policy que treina o aluno em duas frentes:

  1. Evitar a ação que derruba o rollout
  2. Recuperar-se quando o erro já aconteceu

Diferente da distilação off-policy tradicional (que treina com trajetórias de um tutor), o PivotOPD treina o aluno em sua própria trajetção — com feedback focado nos pontos de pivô.

Resultados

  • Taxa de recuperação: 72.7% com PivotOPD vs 20.3% com OPD padrão
  • Modelos de aluno: Qwen3-1.7B e Qwen3-8B
  • Benchmarks: ALFWorld, WebShop, Search-QA
  • Baselines: 13 métodos comparados

O PivotOPD foi o melhor em todos os três benchmarks, superando todos os 13 baselines.

Por que importa

Agentes multi-turno são o futuro da automação com IA — mas a fragilidade a erros iniciais é um dos principais obstáculos para produção. O PivotOPD oferece uma solução treinável e mensurável: em vez de apenas evitar erros, o agente aprende a se recuperar deles.

A taxa de recuperação de 72.7% (vs 20.3% da OPD padrão) é uma melhora de 3.6x, o que pode ser a diferença entre um agente que falha em produção e um que se mantém operacional.

O trabalho é aberto (arXiv 2609.40285) e os modelos de aluno são baseados em Qwen3 — o que permite reprodução e extensão pela comunidade.

Fontes e referências

Eric
Eric

Editor responsável pela Gbyte News.

Mais deste colunista ↗

Encontrou uma informação que precisa de correção? Fale com a redação.