arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-08-11 至 2026-08-11 共收录 3
2608.00536 2026-08-11 cs.CV 版本更新

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

DocPO:通过定制化的步骤感知奖励推进文档策略优化

Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang

机构 * Tencent Hunyuan(腾讯混元)

AI总结 本研究针对文档解析强化学习中奖励区分度不足的问题,提出 Step-Aware Annealing 机制,构建 DocPO 框架并在 OmniDocBench 等数据集上验证了其对 GRPO 式 RL 的性能提升效果。

Comments 14 pages. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026). Yunhao Wang and Binghong Wu contributed equally. Updated to the final camera-ready version with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04713 2026-08-11 cs.LG cs.AI 版本更新

RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents

RSPO:用于多轮语言模型智能体的奖励交换策略优化

Qiang Liu, Taian Guo, Ruizhi Qiao, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室)

AI总结 研究多轮语言模型智能体训练问题,针对稀疏结果奖励训练收敛慢等问题,提出奖励交换策略优化方法,利用密集过程奖励信息,确保轨迹多样性和目标与真实奖励一致性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏