智能体完成一段几十轮任务后只得到成功或失败总分,训练算法往往把同一奖励广播给每一步,难以区分真正扭转结果的动作。清华大学、浙江大学和美团提出AgentOPSD,把信用重新分配到每一轮。
在Qwen2.5-7B与ALFWorld组合上,AgentOPSD成功率达到89.1%,高于GRPO和多种自蒸馏基线。实验还覆盖WebShop与Search-QA,但都属于可重复基准环境,未验证开放网页长期运行。
从词元差异汇总到完整动作
方法先计算教师与学生在每个词元上的对数概率差,再把同一轮动作内的差异聚合为轮级证据。环境反馈通常对应一次完整操作,例如“打开冰箱”或“把物体放上架”,轮级信号比把信用切碎到单个词元更贴近任务结构。
论文图2:词元差异先聚合成轮级证据,再通过递归信念更新改写每轮优势。
证据随后进入贝叶斯信念状态,并以对数几率递归更新。连续两轮之间的信念变化用来判断当前动作对结果贡献多大,再与原有轨迹级优势结合。方法不需要额外评论家模型,也不要求增加采样轨迹。
长轨迹里的收益更明显
训练曲线显示,AgentOPSD在ALFWorld上达到更高验证成功率,并对任务轮数增长更耐受。长任务包含更多决策,把一个总分平均分给所有步骤时,关键信号被稀释得更严重。
论文图1:曲线比较训练成功率、任务轮数增加带来的掉点和策略熵。
消融中,把轮级聚合换回词元累计,成功率从89.1%降至85.9%;去掉递归状态修正后为82.8%;只看修正幅度、不保留成败方向时为80.5%。这些结果支持各组件在该设置中的作用。
超参数稳定不等于跨环境稳定
团队对重塑权重、历史证据衰减和截断阈值做扫描。部分参数变化只带来几个百分点波动,重塑权重影响更明显。
论文图3:三组模型与任务组合下,重塑权重、证据衰减和阈值的敏感性曲线。
ALFWorld、WebShop和Search-QA都有明确奖励或评估器,现实智能体常面对含糊目标、网页变化和错误工具反馈。若最终成败标签本身不可靠,精细分配也会传播错误信用。方法证明轮级递归信号在这些基准上有效,距离生产环境还需在线安全与稳定性测试。