arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-28 至 2025-10-28 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 18 篇

2504.19599 2025-10-28 cs.AI cs.LG 92%

GVPO: Group Variance Policy Optimization for Large Language Model Post-Training

Kaichen Zhang, Yuzhong Hong, Junwei Bao, Hongfei Jiang, Yang Song, Dingqian Hong, Hui Xiong

机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Zuoyebang Education Technology(佐业邦教育科技) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21847 2025-10-28 cs.LG 87%

SynCast: Synergizing Contradictions in Precipitation Nowcasting via Diffusion Sequential Preference Optimization

Kaiyi Xu, Junchao Gong, Wenlong Zhang, Ben Fei, Lei Bai, Wanli Ouyang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19601 2025-10-28 cs.LG cs.AI cs.CL 87%

Preference Optimization by Estimating the Ratio of the Data Distribution

Yeongmin Kim, Heesun Bae, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19178 2025-10-28 cs.LG cs.AI 86%

Imbalanced Gradients in RL Post-Training of Multi-Task LLMs

Runzhe Wu, Ankur Samanta, Ayush Jain, Scott Fujimoto, Jeongyeol Kwon, Ben Kretzu, Youliang Yu, Kaveh Hassani, Boris Vidolov, Yonathan Efroni

机构 * Meta AI Meta Superintelligence Labs(Meta 超智能实验室) Columbia University(哥伦比亚大学) Tel Aviv University(特拉维夫大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13177 2025-10-28 cs.LG cs.AI 86%

KL Penalty Control via Perturbation for Direct Preference Optimization

Sangkyu Lee, Janghoon Han, Hosung Song, Stanley Jungkyu Choi, Honglak Lee, Youngjae Yu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Published as a main conference track paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23590 2025-10-28 cs.LG 85%

Lightweight Robust Direct Preference Optimization

Cheol Woo Kim, Shresth Verma, Mauricio Tec, Milind Tambe

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2509.02709

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07193 2025-10-28 cs.LG stat.ML 85%

Provably Efficient Online RLHF with One-Pass Reward Modeling

Long-Fei Li, Yu-Yang Qian, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments NeurIPS 2025; The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10637 2025-10-28 cs.CL cs.AI cs.LG 85%

Better Estimation of the Kullback--Leibler Divergence Between Language Models

Afra Amini, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07426 2025-10-28 cs.LG cs.AI 82%

RePO: Understanding Preference Learning Through ReLU-Based Optimization

Junkang Wu, Kexin Huang, Xue Wang, Jinyang Gao, Bolin Ding, Jiancan Wu, Xiangnan He, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心) MoE Key Lab of BIPC, University of Science and Technology of China(BIPC联合实验室,中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03069 2025-10-28 cs.CL cs.AI 81%

ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization

YuXuan Zhang

机构 * South China Normal University(华南师范大学) University of Aberdeen(阿伯丁大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments This version fixes some minor typographical errors and adds more explanations to ensure clarity in presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23167 2025-10-28 cs.AI 79%

Guiding Skill Discovery with Foundation Models

Zhao Yang, Thomas M. Moerland, Mike Preuss, Aske Plaat, Vincent François-Lavet, Edward S. Hu

机构 * Department of Computer Science(计算机科学系) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Leiden University(莱顿大学) The Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) University of Pennsylvania(宾夕法尼亚大学) GRASP Lab(GRASP实验室)

专题命中 后训练与偏好优化 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22954 2025-10-28 cs.CL 79%

Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)

Liwei Jiang, Yuanjun Chai, Margaret Li, Mickel Liu, Raymond Fok, Nouha Dziri, Yulia Tsvetkov, Maarten Sap, Alon Albalak, Yejin Choi

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

Comments NeurIPS 2025 D&B Paper (Oral); Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19158 2025-10-28 cs.CL cs.AI 79%

When Personalization Meets Reality: A Multi-Faceted Analysis of Personalized Preference Learning

Yijiang River Dong, Tiancheng Hu, Yinhong Liu, Ahmet Üstün, Nigel Collier

机构 * University of Cambridge(剑桥大学) Cohere For AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21161 2025-10-28 q-bio.BM 78%

RiboPO: Preference Optimization for Structure- and Stability-Aware RNA Design

Minghao Sun, Hanqun Cao, Zhou Zhang, Chen Wei, Liang Wang, Tianrui Jia, Zhiyuan Liu, Tianfan Fu, Xiangru Tang, Yejin Choi, Pheng-Ann Heng, Fang Wu, Yang Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Comments 9 pages, 2 figures. Equal contribution: Minghao Sun, Hanqun Cao, Zhou Zhang. Corresponding author: Fang Wu, Yang Zhang

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05465 2025-10-28 cs.CL cs.AI cs.LG 75%

ComPO: Preference Alignment via Comparison Oracles

Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) Stern School of Business(斯特恩商学院) New York University(纽约大学) DAMO Academy, Alibaba Group US(阿里云达摩院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13934 2025-10-28 cs.LG cs.AI 73%

RLVR-World: Training World Models with Reinforcement Learning

Jialong Wu, Shaofeng Yin, Ningya Feng, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,北研所,清华大学) Zhili College, Tsinghua University(知礼学院,清华大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. Code is available at project website: https://thuml.github.io/RLVR-World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23217 2025-10-28 cs.CL cs.AI 62%

Process Reward Models for Sentence-Level Verification of LVLM Radiology Reports

Alois Thomas, Maya Varma, Jean-Benoit Delbrouck, Curtis P. Langlotz

机构 * AIMI Center Stanford University(AIMI中心 斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13918 2025-10-28 cs.CV cs.AI cs.GR cs.LG 62%

Improving Video Generation with Human Feedback

Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Menghan Xia, Xintao Wang, Xiaohong Liu, Fei Yang, Pengfei Wan, Di Zhang, Kun Gai, Yujiu Yang, Wanli Ouyang

机构 * MMLab, CUHK(CUHK媒体实验室) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

Comments https://github.com/KwaiVGI/VideoAlign

详情

展开后加载摘要…

URL PDF HTML 收藏