arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-13 至 2025-10-13 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2506.18369 2025-10-13 cs.CV 90%

RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models

Yeongtak Oh, Dohyun Chung, Juhyeon Shin, Sangha Park, Johan Barthelemy, Jisoo Mok, Sungroh Yoon

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);large language model(abstract);SFT(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09152 2025-10-13 cs.LG 85%

Logits Replay + MoClip: Stabilized, Low-Cost Post-Training with Minimal Forgetting

Suming Qiu, Jing Li, Zhicheng Zhou, Junjie Huang, Linyuan Qiu, Zhijie Sun

机构 * Global Technical Service (GTS) Huawei Technologies Co., Ltd(华为技术有限公司全球技术服务部)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13726 2025-10-13 cs.CL 85%

RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented Generation

Shi-Qi Yan, Quan Liu, Zhen-Hua Ling

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China(语音与语言信息处理国家工程研究中心,中国科学技术大学) State Key Laboratory of Cognitive Intelligence, iFLYTEK Research(认知智能国家重点实验室,iFLYTEK研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03517 2025-10-13 cs.CV 85%

DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models

Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Research University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract)

Comments NeurIPS 2025 Spotlight. Project page: https://snap-research.github.io/DenseDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06370 2025-10-13 cs.CL 81%

EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences

Kshitish Ghate, Andy Liu, Devansh Jain, Taylor Sorensen, Atoosa Kasirzadeh, Aylin Caliskan, Mona T. Diab, Maarten Sap

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01774 2025-10-13 cs.LG cs.AI 81%

VAGPO: Vision-augmented Asymmetric Group Preference Optimization for Graph Routing Problems

Shiyan Liu, Bohan Tan, Zhiguang Cao, Yan Jin

机构 * Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09056 2025-10-13 cs.CV 78%

Lesion-Aware Post-Training of Latent Diffusion Models for Synthesizing Diffusion MRI from CT Perfusion

Junhyeok Lee, Hyunwoong Kim, Hyungjin Chung, Heeseong Eom, Joon Jang, Chul-Ho Sohn, Kyu Sung Choi

机构 * College of Medicine, Seoul National University, Seoul, Republic of Korea(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Department of Biomedical Sciences, Seoul National University(首尔国立大学生物医学科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments MICCAI 2025, Lecture Notes in Computer Science Vol. 15961

Journal ref Med Image Comput Comput Assist Interv. LNCS 15961, 282-291, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07284 2025-10-13 cs.CL cs.AI cs.LG 75%

Online Rubrics Elicitation from Pairwise Comparisons

MohammadHossein Rezaei, Robert Vacareanu, Zihao Wang, Clinton Wang, Bing Liu, Yunzhong He, Afra Feyza Akyürek

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08696 2025-10-13 cs.LG 70%

Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting

Yunzhen Feng, Parag Jain, Anthony Hartshorn, Yaqi Duan, Julia Kempe

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏