arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-02-17 至 2026-02-17 共收录 3
2602.14386 2026-02-17 cs.CL

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

超越令牌级策略梯度:用于大语言模型复杂推理的多令牌策略梯度优化

Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) Baidu Inc.(百度公司)

AI总结 本文提出MPO框架,通过多令牌级优化提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14060 2026-02-17 cs.CL

LM-Lexicon: Improving Definition Modeling via Harmonizing Semantic Experts

LM-Lexicon:通过和谐语义专家提升定义建模

Yang Liu, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Lingyong Yan

机构 * BIGAI Baidu Inc.(百度公司) Peking University(北京大学)

AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制

Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13234 2026-02-17 cs.AI

Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents

保持角色,保持安全:双循环对抗自进化用于安全角色扮演代理

Mingyang Liao, Yichen Wan, shuchen wu, Chenxi Miao, Xin Shen, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Peking University(北京大学)

AI总结 本文提出双循环对抗自进化框架,通过角色扮演防御机制提升安全性和角色忠实度,实验表明在多个大语言模型上有效提升角色扮演的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏