Group-Reflective Self-Distillation for Agentic Reinforcement Learning
面向智能体强化学习的组内自蒸馏方法
机构 * Baidu(百度)
AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。
大厂专区
面向智能体强化学习的组内自蒸馏方法
机构 * Baidu(百度)
AI总结 该研究针对智能体强化学习中终端奖励监督粗粒度的问题,提出组内自蒸馏方法,利用策略自身已验证轨迹生成指导,细化回合级信用分配,在多环境多模型上性能优于基线且泛化性更好。
解构离策略比率:用于异步强化学习的熵缩放信任区域
机构 * Baidu(百度)
AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。
ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Baidu Inc.(百度公司) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。
C-MIG:基于多视角信息增益的检索增强生成用于临床诊断推理
机构 * Baidu Inc(百度公司)
AI总结 提出C-MIG框架,通过多视角信息增益和多重子查询检索增强策略,解决检索增强生成中奖励信号丢失和异构推理监督问题,在临床诊断任务上取得最优性能。