arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-24 至 2025-10-24 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2510.20369 2025-10-24 cs.LG 87%

Ask a Strong LLM Judge when Your Reward Model is Uncertain

Zhenghao Xu, Qin Lu, Qingru Zhang, Liang Qiu, Ilgee Hong, Changlong Yu, Wenlin Yao, Yao Liu, Haoming Jiang, Lihong Li, Hyokun Yun, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments NeurIPS 2025, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04346 2025-10-24 cs.CL 84%

Permutative Preference Alignment from Listwise Ranking of Human Judgments

Yang Zhao, Yixin Wang, Mingzhang Yin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Florida(佛罗里达大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Published at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07520 2025-10-24 cs.SD cs.AI eess.AS 81%

LeVo: High-Quality Song Generation with Multi-Preference Alignment

Shun Lei, Yaoxun Xu, Zhiwei Lin, Huaicheng Zhang, Wei Tan, Hangting Chen, Jianwei Yu, Yixuan Zhang, Chenyu Yang, Haina Zhu, Shuai Wang, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院) Tencent AI Lab(腾讯AI实验室) Wuhan University(武汉大学) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) X-LANCE Lab, Shanghai Jiao Tong University, Shanghai(上海交通大学X-LANCE实验室) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18458 2025-10-24 cs.CL cs.AI cs.CV 81%

Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning

Wenyi Xiao, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12961 2025-10-24 cs.LG cs.AI physics.chem-ph q-bio.QM 79%

Aligning Transformers with Continuous Feedback via Energy Rank Alignment

Shriram Chennakesavalu, Frank Hu, Sebastian Ibarraran, Grant M. Rotskoff

机构 * Department of Chemistry Stanford University(化学系 斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20413 2025-10-24 cs.LG 77%

Why DPO is a Misspecified Estimator and How to Fix It

Aditya Gopalan, Sayak Ray Chowdhury, Debangshu Banerjee

机构 * IISc Bangalore(班加罗尔IISc) IIT Kanpur(坎purIIT) HP AI Research(HP人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20022 2025-10-24 cs.LG 77%

SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph

Jiazheng Li, Yawei Wang, David Yan, Yijun Tian, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * University of Connecticut(康涅狄格大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20411 2025-10-24 cs.CL 57%

Teacher Demonstrations in a BabyLM's Zone of Proximal Development for Contingent Multi-Turn Interaction

Suchir Salhan, Hongyi Gu, Donya Rooein, Diana Galvan-Sosa, Gabrielle Gaudeau, Andrew Caines, Zheng Yuan, Paula Buttery

机构 * ALTA Institute(ALTA研究所) Dept. of Computer Science & Technology, Cambridge University(计算机科学与技术系,剑桥大学) Bocconi University(博科尼大学) Sheffield University(谢菲尔德大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

Comments Outstanding Paper Award, EMNLP 2025 BabyLM Workshop - Oral presentation, Suzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏