arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

百度&浙大用高斯分布给智能体提示,ALFWorld成功率最高98.4%

作者:arXivDaily编辑部 arXiv 2608.23318 cs · cs.AI · cs.CL

长程智能体在强化学习早期很难碰到成功轨迹,一种办法是先替它执行专家轨迹的前半段,再让策略从更接近目标的位置探索。浙江大学、百度、山东大学提出Agent-G2,不再为所有任务固定同一段提示长度,而是按任务从动态高斯分布中采样。Qwen2.5-7B在ALFWorld达到98.4%平均成功率。

这套方法在ALFWorld和WebShop两个可控基准上验证。它减少的是选择提示深度所需的额外rollout,不代表智能体在开放网页和真实家庭环境中也能保持98.4%。

固定提示长度会同时伤害简单和困难任务

提示太短,智能体仍停在奖励稀疏的早期区域;提示太长,策略只需完成最后几步,学不到完整任务。调度方法按训练进度给所有样本共享一个深度,忽略任务难度差异。逐样本二分探测更精细,却要为每个任务额外运行多次轨迹。

论文Figure 1:共享调度、逐样本探测与Agent-G2高斯采样的差别。

作者发现,有效提示通常落在一段区间,而不是唯一最优点。区间中部信息更强,两侧逐渐减弱,经验形状接近高斯分布。这让系统可以用一个中心和一个方差表达任务当前适合的提示范围。

难度分簇和训练回报共同更新分布

Agent-G2先按专家轨迹长度把任务分簇,作为简单的难度信号。高斯中心由全局训练基线与簇级成功情况共同决定,方差跟踪同一簇内的差异。每批训练为各任务采样一个比例,执行对应专家前缀后再让策略继续。

论文方法图:任务分簇、高斯深度采样、策略rollout与下一批调度更新形成闭环。

更新分布使用的正是GRPO已经收集的终局回报,不需要另训深度预测器,也不需要单独探测rollout。论文报告,相比逐样本探测,提示选择成本不到三分之一。

两种模型规模都在ALFWorld和WebShop测试

Qwen2.5-1.5B在ALFWorld达到95.3%,7B达到98.4%。WebShop上,两种规模的奖励分数均为92.3,最终购买成功率分别为78.9%和84.4%。不同指标不能混用:92.3是奖励得分,不是购买成功率。

ALFWorld包含拾取、清洁、加热、冷却和组合放置等任务,WebShop要求从商品页面逐步筛选属性并完成购买。前者状态和工具更规整,后者的中间奖励更细,两套环境对“成功”的定义并不相同。

论文训练分析:成功率曲线与不同训练阶段的高斯提示分布。

ALFWorld按任务类型拆分后,7B模型多项达到100%,但部分困难类别仍为91.7%。WebShop涉及属性匹配和最终购买,结果低于环境中的中间奖励,说明策略拿到较高过程分并不总能完成最后一步。

消融说明收益不只来自模仿前缀

团队拆分了专家前缀监督、GRPO更新和动态调度。只做前缀SFT或移除关键回报项,成功率都会明显下降。最强消融中,去掉LGRPO后总体成功率从95.3%降至26.6%,表明高斯采样必须与后续策略学习配合。

分簇数量也会影响结果。任务混在一个簇里时,中心难以同时适配简单和困难样本;切得过细,簇内回报统计又会变得噪声更大。论文报告多个簇数设置,说明方法并非只靠一个偶然超参数得到成绩。

论文消融结果:不同前缀学习方式与Agent-G2完整设置的成功率比较。

下一步是用真实任务难度替代轨迹长度

专家轨迹长度容易计算,却不一定准确代表困难度。真实网页中的登录、页面变化和工具故障,也不会稳定映射到步数。后续可以用历史失败类型、环境状态和不确定性构建更可靠的任务簇。

代码和项目页已经公开,便于复现两个基准。要进入实际智能体训练,还需验证专家轨迹质量不均、任务持续变化以及错误提示对策略的长期影响。

真实系统还要计算专家轨迹本身的成本。如果每个新任务都必须人工写出完整路径,节省rollout未必等于降低总标注成本。更可行的方向是复用历史成功轨迹,并对过时步骤进行自动检测。

参考资料

https://arxiv.org/abs/2608.23318

https://arxiv.org/html/2608.23318

https://zju-real.github.io/Agent-G2/

https://github.com/ZJU-REAL/Agent-G2