arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-21 至 2025-10-21 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 14 篇

2510.17776 2025-10-21 cs.LG cs.AI cs.CL 92%

Mapping Post-Training Forgetting in Language Models at Scale

Jackson Harmon, Andreas Hochlehnert, Matthias Bethge, Ameya Prabhu

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);instruction tuning(abstract);pretraining(abstract)

Comments 43 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07163 2025-10-21 cs.CL cs.AI cs.LG 91%

Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning

Chongyu Fan, Jiancheng Liu, Licong Lin, Jinghan Jia, Ruiqi Zhang, Song Mei, Sijia Liu

机构 * Michigan State University(密歇根州立大学) University of California, Berkeley(加州大学伯克利分校) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20548 2025-10-21 cs.LG cs.AI cs.CL 89%

$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training

Jin Peng Zhou, Kaiwen Wang, Jonathan Chang, Zhaolin Gao, Nathan Kallus, Kilian Q. Weinberger, Kianté Brantley, Wen Sun

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01203 2025-10-21 cs.LG stat.ML 87%

KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity

Gholamali Aminian, Amir R. Asadi, Idan Shenfeld, Youssef Mroueh

机构 * The Alan Turing Institute(艾伦·图灵研究所) Statistical Laboratory(统计实验室) University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) IBM Research USA(IBM美国研究)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Extra experiments are added in new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15065 2025-10-21 cs.LG 87%

Direct Preference Optimization With Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences

Keertana Chidambaram, Karthik Vinay Seetharaman, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06023 2025-10-21 cs.CV 87%

Dual Caption Preference Optimization for Diffusion Models

Amir Saeidi, Yiran Luo, Agneet Chatterjee, Shamanthak Hegde, Bimsara Pathiraja, Yezhou Yang, Chitta Baral

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12081 2025-10-21 cs.CV cs.AI cs.CL 84%

VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models

Haidong Xu, Guangwei Xu, Zhedong Zheng, Xiatian Zhu, Wei Ji, Xiangtai Li, Ruijie Guo, Meishan Zhang, Min zhang, Hao Fei

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Macau(澳门大学) University of Surrey(Surrey大学) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025; Project Page: https://walkermitty.github.io/VimoRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11430 2025-10-21 cs.CV 82%

Auto-Connect: Connectivity-Preserving RigFormer with Direct Preference Optimization

Jingfeng Guo, Jian Liu, Jinnan Chen, Shiwei Mao, Changrong Hu, Puhua Jiang, Junlin Yu, Jing Xu, Qi Liu, Lixin Xu, Zhuo Chen, Chunchao Guo

机构 * South China University of Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(国立新加坡大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) University of Science and Technology of China(中国科学技术大学) Beijing Normal University(北京师范大学) Tencent Hunyuan(腾讯文盈)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16167 2025-10-21 cs.LG cs.CL 79%

Alignment is Localized: A Causal Probe into Preference Layers

Archie Chaudhury

机构 * Independent(独立研究者)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05095 2025-10-21 cs.CV 78%

SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization

Xiaofeng Tan, Hongsong Wang, Xin Geng, Pan Zhou

机构 * Department of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程系) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, Nanjing, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学))

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Journal ref Advances in Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16582 2025-10-21 cs.AI 70%

Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?

Junchi Yu, Yujie Liu, Jindong Gu, Philip Torr, Dongzhan Zhou

机构 * Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20673 2025-10-21 cs.CL 70%

Geometric-Mean Policy Optimization

Yuzhong Zhao, Yue Liu, Junpeng Liu, Jingye Chen, Xun Wu, Yaru Hao, Tengchao Lv, Shaohan Huang, Lei Cui, Qixiang Ye, Fang Wan, Furu Wei

机构 * UCAS(中国科学院大学) CUHK(香港中文大学) HKUST(香港科技大学) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Code is available at https://github.com/callsys/GMPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 62%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16500 2025-10-21 cs.HC cs.RO 50%

The Impact of VR and 2D Interfaces on Human Feedback in Preference-Based Robot Learning

Jorge de Heuvel, Daniel Marta, Simon Holk, Iolanda Leite, Maren Bennewitz

机构 * Humanoid Robots Lab, University of Bonn, Germany(波恩大学人形机器人实验室) Division of Robotics, Perception and Learning, KTH Royal Institute of Technology, Sweden(皇家理工学院机器人、感知与学习部门) Robotics Institute Germany(德国机器人研究所) The Lamarr Institute, Bonn, Germany(德国波恩拉玛尔研究所) Center for Robotics, University of Bonn, Germany(德国波恩机器人中心)

专题命中 后训练与偏好优化 :RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏