arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-09 至 2026-02-09 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2602.06453 2026-02-09 cs.LG 89%

On the Plasticity and Stability for Post-Training Large Language Models

关于后训练大语言模型的可塑性与稳定性

Wenwen Qiang, Ziyin Gu, Jiahuan Zhou, Jie Hu, Jingyao Wang, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科技大学(香港特别行政区)计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(title);分类 cs.LG

AI总结 本文提出PCR框架,通过概率方法解决GRPO中可塑性与稳定性之间的几何冲突,提升训练稳定性与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06669 2026-02-09 cs.CL cs.AI 88%

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

compar:IA:法国政府的LLM竞技场,用于收集法语人类提示和偏好数据

Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

机构 * The French Government(法国政府)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 compar:IA由法国政府开发,旨在通过收集法语人类提示和偏好数据,提升非英语语言中LLM的性能和文化契合度,同时推动多语言模型训练和评估的国际发展。

Comments 18 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06836 2026-02-09 cs.AI 87%

LLM Active Alignment: A Nash Equilibrium Perspective

LLM主动对齐:从纳什均衡视角出发

Tonghan Wang, Yuqi Pan, Xinyi Yang, Yanchen Jiang, Milind Tambe, David C. Parkes

机构 * College of AI, Tsinghua University, Beijing, China(人工智能学院,清华大学,北京,中国) Harvard University, Cambridge, MA, USA(哈佛大学,马萨诸塞州剑桥,美国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出了一种基于纳什均衡的LLM主动对齐方法,通过建模代理行为以避免文本空间计算难题,并展示其在社交媒体中防止政治排斥的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06665 2026-02-09 cs.CL cs.AI 82%

Not All Layers Need Tuning: Selective Layer Restoration Recovers Diversity

并非所有层都需要调节:选择性层恢复恢复多样性

Bowen Zhang, Meiyi Wang, Harold Soh

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Smart Systems Institute, National University of Singapore, Singapore, Singapore(新加坡国立大学智能系统研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 选择性层恢复通过恢复特定层到预训练权重,提升LLM输出多样性并保持高质量。

Comments 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 82%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06049 2026-02-09 cs.CL cs.AI 79%

Recontextualizing Famous Quotes for Brand Slogan Generation

重新上下文化著名引语以生成品牌标语

Ziao Yang, Zizhang Chen, Lei Zhang, Hongfu Liu

机构 * Brandeis University(布兰迪斯大学) Adobe(Adobe公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过重新上下文化著名引语生成新颖且具人设的标语,采用模块化框架提升标语的多样性与情感影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06763 2026-02-09 cs.CL 77%

R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging

R-Align: 通过以推理为中心的元判断增强生成奖励模型

Yanlin Lai, Mitt Huang, Hangyu Guo, Xiangfeng Wang, Haodong Li, Shaoxiong Zhan, Liang Zhao, Chengyuan Yao, Yinmin Zhang, Qi Han, Chun Yuan, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 R-Align通过引入黄金判断和明确监督推理对齐,提高生成奖励模型的推理一致性,从而增强RLHF的性能。

Comments Github: https://github.com/lyn22333/R-Align Huggingface: https://huggingface.co/collections/lyn22333/r-align

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06554 2026-02-09 cs.AI 77%

SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees

SeeUPO:具有收敛保证的序列级代理强化学习

Tianyi Hu, Qingxu Fu, Yanxi Chen, Zhaoyang Liu, Bolin Ding

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SeeUPO通过逆向归纳实现多轮交互的单调改进和收敛,显著提升训练稳定性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03048 2026-02-09 cs.LG cs.AI 73%

CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs

CoBA-RL:面向大语言模型强化学习的基于能力的预算分配

Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen, Yueqing Sun, Zishan Xu, Yu Yang, Tianhao Hu, Qi Gu, Hui Su, Xunliang Cai

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 CoBA-RL通过基于能力的价值函数和堆贪心策略,优化大语言模型强化学习中的预算分配,提升训练效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06788 2026-02-09 cs.LG 70%

Displacement-Resistant Extensions of DPO with Nonconvex $f$-Divergences

对抗位移的DPO扩展:非凸f-散度

Idan Pipano, Shoham Sabach, Kavosh Asadi, Mohammad Ghavamzadeh

机构 * Faculty of Data and Decision Sciences(数据与决策科学学院) Technion - Israel Institute of Technology(技术ion-以色列理工学院) Meta Qualcomm AI Research(高通人工智能研究)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种对抗位移的DPO扩展方法,通过非凸f-散度改进了传统DPO,提供了更强的理论保证和实际表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 67%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06825 2026-02-09 cs.LG cs.AI cs.CV 62%

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

AEGPO:适应性熵引导策略优化用于扩散模型

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-02-09 cs.LG cs.CL cs.RO 62%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏