Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
大厂专区
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。