arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-08-10 至 2026-08-10 共收录 3
2608.07371 2026-08-10 cs.LG cs.CL 新提交

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

面向智能体强化学习的轨迹相对事后蒸馏

Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯)

AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06802 2026-08-10 cs.CL 新提交

Simple-OPD: Demystifying Warm-up for On-policy Distillation

Simple-OPD:揭开策略内蒸馏的预热阶段之谜

Tao Liu, Taiqiang Wu, Mao Zheng, Xuan Luo, Runming Yang, Xuewei Yang, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Tencent(腾讯)

AI总结 本文通过数据与训练视角研究OPD的预热阶段,发现预热依赖教师兼容CoT监督、LoRA近饱和训练优于全参数SFT,提出Simple-OPD方法并验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06410 2026-08-10 cs.AI cs.CL cs.MA 新提交

ADIAS: Automated Design of Interactive Agentic Systems

ADIAS:交互式智能体系统的自动化设计

Lekang Jiang, Bohan Tang, Stephan Goetz, Yiwen Guo

机构 * University of Cambridge(剑桥大学) Tencent(腾讯)

AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。

Comments 23 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏