论文导读
NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这些数字来自特定交互基准,不能替代真实系统安全评测。
正确轨迹教不会错误后的世界
普通在线策略蒸馏让学生沿自己的轨迹行动,再由教师给正确动作。但当学生已经拿错物体、错过页面或改坏文件,原先的最佳路线可能不再可行。继续模仿“如果没犯错该怎么做”会给出不适用的监督。PivotOPD先识别关键错误步,再区分错误发生前的预防动作和错误发生后的恢复动作。
图:方法先定位关键错误,再由特权教师分别提供预防动作和恢复动作作为训练信号。
同一个拿错番茄,结局可以完全不同
论文案例要求把凉鸡蛋放进微波炉。基础模型发现冰箱没有鸡蛋后拿了番茄,随后一路把错误物体送进微波炉;PivotOPD模型在相同错误后先把番茄放下,再找到桌上的鸡蛋完成任务。这个对照展示的不是“永不犯错”,而是让策略理解环境已经改变,必须从当前状态重新规划。
图:左右轨迹从同一关键错误出发,一侧固守错误物体,另一侧通过放下番茄完成恢复。
小模型的提升覆盖家务、购物和问答
作者在ALFWorld、WebShop、问答及软件工程任务上比较方法。1.7B学生在ALFWorld平均成功率73.7%,WebShop成功率76.6%;SWE-Bench Verified上也报告较普通OPD更明显的提升。不同基准的评分定义并不相同,不能把这些百分比直接横向相加,但跨任务一致增益支持“恢复监督”具有通用价值。
图:主结果按任务类型展示成功率、准确率和软件修复成绩,便于分基准核对提升。
真正的应用是给Agent加恢复预算
生产Agent会遇到网页变化、工具超时和不可逆写入。落地时可先定义哪些状态允许继续补救,哪些状态必须停止并请求人工确认,再为可恢复错误分配有限步数。后续还应测试教师判断错误转折点的可靠性,避免模型把危险动作误认成可补救探索。
恢复训练也需要成本边界。一个Agent若为了修正小错反复调用工具,最终虽然成功,却可能比人工处理更慢。实际评测应同时记录首次正确率、恢复成功率、额外步数、API费用和不可逆损失,并按错误类型拆分。对于付款、删库和发布等高风险动作,策略不能依赖事后恢复,而应在关键转折点之前强制确认。PivotOPD更适合网页导航、家务模拟和可回滚编辑等场景,其价值是让允许试错的任务不因一次偏差立即结束。
上线前还应预先定义恢复次数上限和人工接管入口,避免模型把“可以补救”误解为“可以无限试错”。