arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-29 至 2025-09-29 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2502.00666 2025-09-29 cs.LG cs.AI stat.ML 89%

Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration

Mingyu Chen, Yiding Chen, Wen Sun, Xuezhou Zhang

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Boston University(波士顿大学) Department of Computer Science(计算机科学系) Cornell University(康奈尔大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21528 2025-09-29 cs.LG cs.AI 88%

Preemptive Detection and Steering of LLM Misalignment via Latent Reachability

Sathwik Karnik, Somil Bansal

机构 * Safe and Intelligent Autonomy Lab, Stanford University(斯坦福大学安全与智能自主实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21351 2025-09-29 cs.CV cs.AI cs.CL 86%

Random Direct Preference Optimization for Radiography Report Generation

Valentin Samokhin, Boris Shirokikh, Mikhail Goncharov, Dmitriy Umerenkov, Maksim Bobrin, Ivan Oseledets, Dmitry Dylov, Mikhail Belyaev

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究院) Skolkovo Institute of Science and Technology(斯克罗夫学院) Institute for Information Transmission Problems(信息传输问题研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22624 2025-09-29 cs.CV cs.LG 84%

SPARK: Synergistic Policy And Reward Co-Evolving Framework

Ziyu Liu, Yuhang Zang, Shengyuan Ding, Yuhang Cao, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Project:https://github.com/InternLM/Spark

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07780 2025-09-29 cs.LG cs.CL 82%

A Critical Look At Tokenwise Reward-Guided Text Generation

Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Western University(西方大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Work accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21718 2025-09-29 cs.AI cs.LG eess.AS 81%

Align2Speak: Improving TTS for Low Resource Languages via ASR-Guided Online Preference Optimization

Shehzeen Hussain, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Subhankar Ghosh, Roy Fejgin, Ryan Langman, Mikyas Desta, Leili Tavabi, Jason Li

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02588 2025-09-29 cs.CV 78%

Calibrated Multi-Preference Optimization for Aligning Diffusion Models

Kyungmin Lee, Xiaohang Li, Qifei Wang, Junfeng He, Junjie Ke, Ming-Hsuan Yang, Irfan Essa, Jinwoo Shin, Feng Yang, Yinxiao Li

机构 * Google DeepMind(谷歌DeepMind) KAIST(韩国科学技术院) Google(谷歌) Google Research(谷歌研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Comments CVPR 2025, Project page: https://kyungmnlee.github.io/capo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22099 2025-09-29 cs.CL 70%

S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models

Shaoning Sun, Jiachen Yu, Zongqi Wang, Xuewei Yang, Tianle Gu, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21828 2025-09-29 cs.LG cs.MA 70%

Preference-Guided Learning for Sparse-Reward Multi-Agent Reinforcement Learning

The Viet Bui, Tien Mai, Hong Thanh Nguyen

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) University of Oregon(俄勒冈大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12663 2025-09-29 cs.CL 70%

Demystifying Multilingual Chain-of-Thought in Process Reward Modeling

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20725 2025-09-29 cs.GR cs.CV 67%

SeamCrafter: Enhancing Mesh Seam Generation for Artist UV Unwrapping via Reinforcement Learning

Duoteng Xu, Yuguang Chen, Jing Li, Xinhai Liu, Xueqi Ma, Zhuo Chen, Dongyu Zhang, Chunchao Guo

机构 * Tencent Hunyuan(腾讯文英) SYSU(南方科技大学) SZU(深圳大学) USTC(中国科学技术大学)

专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏