arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-17 至 2026-02-17 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2502.14560 2026-02-17 cs.LG cs.AI cs.CL 87%

Less is More: Improving LLM Alignment via Preference Data Selection

少即是多:通过偏好数据选择改进大语言模型对齐

Xun Deng, Han Zhong, Rui Ai, Fuli Feng, Zheng Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Massachusetts Institute of Technology(麻省理工学院) Alibaba Cloud Computing(阿里云计算) MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学MoE关键实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 通过改进偏好数据选择策略,提升大语言模型对齐效果,实验显示在较少数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 85%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 85%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20150 2026-02-17 cs.IR 85%

Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning

Rank-GRPO: 基于强化学习训练基于大语言模型的对话推荐系统

Yaochen Zhu, Harald Steck, Dawen Liang, Yinhan He, Vito Ostuni, Jundong Li, Nathan Kallus

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Rank-GRPO通过两阶段框架提升LLM对话推荐系统的训练效果,解决排名质量下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19457 2026-02-17 cs.CL cs.AI cs.LG cs.SE 80%

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

GEPA:反思式提示进化可以超越强化学习

Lakshya A Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J Ryan, Meng Jiang, Christopher Potts, Koushik Sen, Alexandros G. Dimakis, Ion Stoica, Dan Klein, Matei Zaharia, Omar Khattab

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEPA通过自然语言反思优化提示,以更少的回放次数在多个任务中超越强化学习方法GRPO和MIPROv2。

Comments Accepted to ICLR 2026 (Oral). Code: https://github.com/gepa-ai/gepa

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16652 2026-02-17 cs.LG cs.AI 79%

Evolution Strategies at the Hyperscale

超大规模进化策略

Bidipta Sarkar, Mattie Fellows, Juan Agustin Duque, Alistair Letcher, Antonio León Villares, Anya Sims, Clarisse Wibault, Dmitry Samsonov, Dylan Cope, Jarek Liesen, Kang Li, Lukas Seier, Theo Wolf, Uljad Berdica, Valentin Mohl, Alexander David Goldie, Aaron Courville, Karin Sevegnani, Shimon Whiteson, Jakob Nicolaus Foerster

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 EGGROLL通过低秩学习提升算术强度,实现大规模参数模型的高效训练,稳定预训练非线性循环语言模型并提升推理任务性能。

Comments 76 pages, 15 figures, Website at https://eshyperscale.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00499 2026-02-17 cs.LG cs.AI stat.ML 79%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 79%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04552 2026-02-17 cs.SD cs.AI eess.AS 74%

RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS

RRPO: 为基于LLM的情感TTS的鲁棒奖励策略优化

Cong Wang, Changfeng Gao, Yang Xiang, Zhihao Du, Keyu An, Han Zhao, Qian Chen, Xiangang Li, Yingming Gao, Ya Li

机构 * Speech Team, Tongyi Lab, Alibaba Group(通义实验室,阿里集团)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI

AI总结 RRPO通过鲁棒奖励模型和混合正则化方案,提升LLM情感TTS的鲁棒性和自然度,有效对抗奖励黑客攻击。

Comments Accepted by ICASSP 2026. Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16117 2026-02-17 cs.LG cs.AI cs.CV 73%

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14028 2026-02-17 cs.CL 70%

GRRM: Group Relative Reward Modeling for Machine Translation

GRRM:用于机器翻译的组相对奖励建模

Sen Yang, Shanbo Cheng, Lu Xu, Jianbing Zhang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出GRRM,通过组相对奖励模型提升机器翻译的排名准确性和推理能力。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09713 2026-02-17 cs.CV 50%

Stroke3D: Lifting 2D strokes into rigged 3D model via latent diffusion models

Stroke3D: 通过潜在扩散模型将2D笔触提升为拟合的3D模型

Ruisi Zhao, Haoren Zheng, Zongxin Yang, Hehe Fan, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAAI、浙江大学) DBMI, HMS, Harvard University(DBMI、HMS、哈佛大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 Stroke3D通过潜在扩散模型,将用户绘制的2D笔触和文本提示转化为拟合的3D模型,实现可控的骨骼生成和纹理网格合成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏