arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Baidu(百度)

2026-04-15 至 2026-04-15 共收录 4
2604.12736 2026-04-15 cs.CL

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来

Xingyu Lin, Yilin Wen, Du Su, Jinchang Hou, En Wang, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)

AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12627 2026-04-15 cs.AI

KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance

KnowRL: 通过最小充分知识引导的强化学习提升大语言模型推理

Linhao Yu, Tianmeng Yang, Siyu Ding, Renren Jin, Naibin Gu, Xiangzhao Hao, Shuaiyi Nie, Deyi Xiong, Weichong Yin, Yu Sun, Hua Wu

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 KnowRL通过最小充分知识引导的强化学习框架提升大语言模型推理能力,通过分解知识点并优化子集选择,在八个基准测试中超越现有基线,达到70.08的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05643 2026-04-15 cs.CL

Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs

基于图的链式推理剪枝:减少推理LLM中冗余反射

Hongyuan Yuan, Xinran He, Run Shao, Bolei He, Xianwei Xue, Mengke Chen, Qiutong Pan, Haiwei Wang, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) Baidu Inc.(百度公司)

AI总结 本文提出基于图的链式推理优化框架,通过剪枝策略减少推理过程中冗余反射,提升效率与准确性。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14264 2026-04-15 cs.LG cs.CL

AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin

AAPO: 通过优势边际增强大语言模型的推理能力

Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Frontier Research Department, Baidu Inc.(百度公司前沿研究部)

AI总结 AAPO通过引入基于边际的估计方案优化交叉熵损失,有效解决传统分组相对优势估计方法的训练效率问题,在数学推理基准上表现出色。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏