arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2504.03622 2026-02-04 cs.CL cs.AI cs.LG 90%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02383 2026-02-04 cs.LG 87%

SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization

SLIME:偏好优化中的稳定性似然隐边界的隐式约束

Maksim Afanasyev, Illarion Iov

机构 * Floating Point Sigma Lab(浮点数Sigma实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SLIME通过引入稳定性似然隐边界的隐式约束,解决偏好优化中的目标不匹配问题,提升模型生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03806 2026-02-04 cs.LG cs.AI cs.CL cs.SE 80%

Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation

弥合在线与离线强化学习:多轮代码生成的上下文老虎机学习

Ziru Chen, Dongdong Chen, Ruinan Jin, Yingbin Liang, Yujia Xie, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Cobalt通过结合在线和离线强化学习,提出一种新的上下文老虎机学习方法,用于多轮代码生成任务,显著提升了模型性能并缓解了奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20534 2026-02-04 cs.LG cs.AI cs.CL 80%

Kimi K2: Open Agentic Intelligence

Kimi K2:开放代理智能

Kimi Team, Yifan Bai, Yiping Bao, Y. Charles, Cheng Chen, Guanduo Chen, Haiting Chen, Huarong Chen, Jiahao Chen, Ningxin Chen, Ruijue Chen, Yanru Chen, Yuankun Chen, Yutian Chen, Zhuofu Chen, Jialei Cui, Hao Ding, Mengnan Dong, Angang Du, Chenzhuang Du, Dikang Du, Yulun Du, Yu Fan, Yichen Feng, Kelin Fu, Bofei Gao, Chenxiao Gao, Hongcheng Gao, Peizhong Gao, Tong Gao, Yuyao Ge, Shangyi Geng, Qizheng Gu, Xinran Gu, Longyu Guan, Haiqing Guo, Jianhang Guo, Xiaoru Hao, Tianhong He, Weiran He, Wenyang He, Yunjia He, Chao Hong, Hao Hu, Yangyang Hu, Zhenxing Hu, Weixiao Huang, Zhiqi Huang, Zihao Huang, Tao Jiang, Zhejun Jiang, Xinyi Jin, Yongsheng Kang, Guokun Lai, Cheng Li, Fang Li, Haoyang Li, Ming Li, Wentao Li, Yang Li, Yanhao Li, Yiwei Li, Zhaowei Li, Zheming Li, Hongzhan Lin, Xiaohan Lin, Zongyu Lin, Chengyin Liu, Chenyu Liu, Hongzhang Liu, Jingyuan Liu, Junqi Liu, Liang Liu, Shaowei Liu, T. Y. Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yibo Liu, Yiping Liu, Yue Liu, Zhengying Liu, Enzhe Lu, Haoyu Lu, Lijun Lu, Yashuo Luo, Shengling Ma, Xinyu Ma, Yingwei Ma, Shaoguang Mao, Jie Mei, Xin Men, Yibo Miao, Siyuan Pan, Yebo Peng, Ruoyu Qin, Zeyu Qin, Bowen Qu, Zeyu Shang, Lidong Shi, Shengyuan Shi, Feifan Song, Jianlin Su, Zhengyuan Su, Lin Sui, Xinjie Sun, Flood Sung, Yunpeng Tai, Heyi Tang, Jiawen Tao, Qifeng Teng, Chaoran Tian, Chensi Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Jianzhou Wang, Jiaxing Wang, Jinhong Wang, Shengjie Wang, Shuyi Wang, Si Wang, Xinyuan Wang, Yao Wang, Yejie Wang, Yiqin Wang, Yuxin Wang, Yuzhi Wang, Zhaoji Wang, Zhengtao Wang, Zhengtao Wang, Zhexu Wang, Chu Wei, Qianqian Wei, Haoning Wu, Wenhao Wu, Xingzhe Wu, Yuxin Wu, Chenjun Xiao, Jin Xie, Xiaotong Xie, Weimin Xiong, Boyu Xu, Jinjing Xu, L. H. Xu, Lin Xu, Suting Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ziyao Xu, Jing Xu, Jing Xu, Junjie Yan, Yuzi Yan, Hao Yang, Xiaofei Yang, Yi Yang, Ying Yang, Zhen Yang, Zhilin Yang, Zonghan Yang, Haotian Yao, Xingcheng Yao, Wenjie Ye, Zhuorui Ye, Bohong Yin, Longhui Yu, Enming Yuan, Hongbang Yuan, Mengjie Yuan, Siyu Yuan, Haobing Zhan, Dehao Zhang, Hao Zhang, Wanlu Zhang, Xiaobin Zhang, Yadong Zhang, Yangkun Zhang, Yichi Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Haotian Zhao, Yikai Zhao, Zijia Zhao, Huabin Zheng, Shaojie Zheng, Longguang Zhong, Jianren Zhou, Xinyu Zhou, Zaida Zhou, Jinguo Zhu, Zhen Zhu, Weiyu Zhuang, Xinxing Zu

机构 * Kimi Team(Kimi 团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Kimi K2是一款开源大语言模型,通过混合专家架构和MuonClip优化器实现先进代理能力,表现优于现有非思考模型。

Comments tech report of Kimi K2, with minor updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03025 2026-02-04 cs.AI cs.CL 79%

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

RC-GRPO:基于奖励的组相对策略优化用于多轮工具调用智能体

Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所,中国科学院) School of Mathematics and Statistics(数学与统计学学院) Statistics, Lanzhou University(统计学,兰州大学) Shanghai Innovation Institute(上海创新研究院) Microsoft Research(微软研究院) Nanjing University(南京大学) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 RC-GRPO通过奖励条件化策略优化提升多轮工具调用性能,有效解决组内奖励稀疏导致的更新问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 77%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07326 2026-02-04 cs.CL cs.AI cs.CY cs.LG 75%

Reward Model Interpretability via Optimal and Pessimal Tokens

通过最优和最劣 tokens 实现奖励模型可解释性

Brian Christian, Hannah Rose Kirk, Jessica A. F. Thompson, Christopher Summerfield, Tsvetomira Dumbalska

机构 * University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析奖励模型对不同token的评分,揭示了模型间的异质性、评分不对称性及潜在偏见,挑战了奖励模型的可互换性及代理人类价值观的假设。

Comments Accepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 73%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 70%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02488 2026-02-04 cs.LG cs.AI cs.CL cs.CV 67%

RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System

RLAnything: 在完全动态的RL系统中动态生成环境、策略和奖励模型

Yinjie Wang, Tianbao Xie, Ke Shen, Mengdi Wang, Ling Yang

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLAnything通过动态生成环境、策略和奖励模型,在完全动态的RL系统中提升学习效果,显著提升多个任务的性能。

Comments Code: https://github.com/Gen-Verse/Open-AgentRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22950 2026-02-04 eess.AS 67%

DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching

DiffRhythm 2: 通过块流匹配实现高效高保真的歌曲生成

Yuepeng Jiang, Huakang Chen, Ziqian Ning, Jixun Yao, Zerui Han, Di Wu, Meng Meng, Jian Luan, Zhonghua Fu, Lei Xie

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract)

AI总结 DiffRhythm 2 通过块流匹配实现高效高保真的歌曲生成,解决歌词与 vocals 对齐及多偏好优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03304 2026-02-04 cs.IR 50%

To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention

是进行搜索还是不进行搜索:通过因果干预对深度搜索代理的决策边界进行对齐

Wenlin Zhang, Kuicai Dong, Junyi Li, Yingyi Zhang, Xiaopeng Li, Pengyue Jia, Yi Wen, Derong Xu, Maolin Wang, Yichao Wang, Yong Liu, Xiangyu Zhao

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出DAS方法,通过因果干预和偏好优化对深度搜索代理的决策边界进行对齐,以解决过度搜索和不足搜索问题,提升搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏