HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning
HISR: 基于 hindsight 信息的分段过程奖励用于多轮代理强化学习
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯文脉) ; School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
AI总结 本文提出HISR方法,通过hindsight信息调节分段过程奖励,提升多轮代理强化学习中的信用分配可靠性,实验验证了方法的有效性。
Comments Submitted to ACL 2026 on Jan 5, 2026