arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-12 至 2025-11-12 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2511.07483 2025-11-12 cs.AI cs.LG 91%

Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning

Qianxi He, Qingyu Ren, Shanzhe Lei, Xuhong Wang, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07691 2025-11-12 cs.CL cs.AI 88%

CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences

Rhitabrat Pokharel, Yufei Tao, Ameeta Agrawal

机构 * Department of Computer Science(计算机科学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Accepted at IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06778 2025-11-12 cs.CL 87%

SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces

Ruiheng Liu, XiaoBing Chen, Jinyu Zhang, Qiongwen Zhang, Yu Zhang, Bailong Yang

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments AAAI 2026 Extended Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08325 2025-11-12 cs.CL cs.IR cs.LG 86%

AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress

Zhiheng Xi, Chenyang Liao, Guanyu Li, Yajie Yang, Wenxiang Chen, Zhihao Zhang, Binghai Wang, Senjie Jin, Yuhao Zhou, Jian Guan, Wei Wu, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23349 2025-11-12 cs.LG cs.AI 86%

Towards Reward Fairness in RLHF: From a Resource Allocation Perspective

Sheng Ouyang, Yulan Hu, Ge Chen, Qingyang Li, Fuzheng Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07477 2025-11-12 cs.CY cs.AI cs.CL 86%

The Polite Liar: Epistemic Pathology in Language Models

Bentley DeVilling

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 2 tables, Preprint - under review at AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07896 2025-11-12 cs.AI cs.CL 82%

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

Dengcan Liu, Jiahao Li, Zheren Fu, Yi Tu, Jiajun Li, Zhendong Mao, Yongdong Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 15pages,11figures,AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20995 2025-11-12 cs.CL 81%

ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models

Xiaomin Li, Xupeng Chen, Jingxuan Fan, Eric Hanchen Jiang, Mingye Gao

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08394 2025-11-12 cs.CL cs.AI cs.HC cs.LG 80%

Interaction Dynamics as a Reward Signal for LLMs

Sian Gooding, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07806 2025-11-12 cs.CV 50%

PC-Diffusion: Aligning Diffusion Models with Human Preferences via Preference Classifier

Shaomeng Wang, He Wang, Xiaolu Wei, Longquan Dai, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏