Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
大厂专区
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
TMRL: 差分时间步调节预训练实现高效策略微调的探索
机构 * University of Washington(华盛顿大学) ; Amazon FAR(亚马逊FAR)
AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。
ReCodeAgent:一种多智能体工作流用于语言无关的大规模仓库翻译与验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
AI总结 ReCodeAgent通过多智能体方法实现大规模仓库代码翻译与验证的语言无关性,提升翻译正确率并降低成本,验证其效率和设计影响。
Comments Published in ASE 2026