arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Salesforce

2026-08-25 至 2026-08-25 共收录 2
2608.22631 2026-08-25 cs.LG 新提交

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22167 2026-08-25 cs.AI cs.LG 新提交

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning

MCP-Universe RL:一种通过强化学习训练MCP工具使用智能体的框架

Ziyang Luo, Yan Yang, Xiangru Jian, Ziji Shi, Xiaoqiang Lin, Jun Hao Liew, Silvio Savarese, Junnan Li

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 该研究提出MCP-U RL开源框架,依托MCP协议解决RL训练中环境搭建与GPU利用率问题,在gpt-oss-20b上训练三类工具使用智能体并提升了任务奖励。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏