arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-22 至 2025-09-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2310.08164 2025-09-22 cs.LG 90%

Interpreting Learned Feedback Patterns in Large Language Models

Luke Marks, Amir Abdullah, Clement Neo, Rauno Arike, David Krueger, Philip Torr, Fazl Barez

机构 * Luke Marks Amir Abdullah Clement Neo Rauno Arike David Krueger Philip Torr Fazl Barez

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 19 pages, 8 figures. Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07570 2025-09-22 cs.CV cs.AI 89%

OptiScene: LLM-driven Indoor Scene Layout Generation via Scaled Human-aligned Data Synthesis and Multi-Stage Preference Optimization

Yixuan Yang, Zhen Luo, Tongsheng Ding, Junru Lu, Mingqi Gao, Jinyu Yang, Victor Sanchez, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Shanghai Innovation Institute(上海创新研究院) University of Warwick(沃林顿大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);SFT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14442 2025-09-22 cs.CL cs.AI 88%

Creative Preference Optimization

Mete Ismayilzada, Antonio Laverghetta, Simone A. Luchini, Reet Patel, Antoine Bosselut, Lonneke van der Plas, Roger Beaty

机构 * EPFL(苏黎世联邦理工学院) Università della Svizzera Italiana(瑞士联邦理工学院) Wesleyan University(韦斯利安大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14172 2025-09-22 cs.LG cs.AI 86%

TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning

Ziyuan Chen, Zhenghui Zhao, Zhangye Han, Miancan Liu, Xianhang Ye, Yiqing Li, Hongbo Min, Jinkui Ren, Xiantao Zhang, Guitao Cao

机构 * East China Normal University(东华大学) Alibaba Group(阿里巴巴集团) University of Electronic Science and Technology of China(电子科技大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12123 2025-09-22 cs.CL cs.AI 84%

MT-RewardTree: A Comprehensive Framework for Advancing LLM-Based Machine Translation via Reward Modeling

Zhaopeng Feng, Jiahan Ren, Jiayuan Su, Jiamei Zheng, Hongwei Wang, Zuozhu Liu

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings. Project page:https://sabijun.github.io/MT_RewardTreePage

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11006 2025-09-22 cs.LG cs.CL 79%

Entropy-Regularized Process Reward Model

Hanning Zhang, Pengcheng Wang, Shizhe Diao, Yong Lin, Rui Pan, Hanze Dong, Dylan Zhang, Pavlo Molchanov, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) NVIDIA(英伟达) Princeton University(普林斯顿大学) Salesforce Research(Salesforce研究)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments Upate TMLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16127 2025-09-22 cs.CV 75%

BaseReward: A Strong Baseline for Multimodal Reward Model

Yi-Fan Zhang, Haihua Yang, Huanyu Zhang, Yang Shi, Zezhou Chen, Haochen Tian, Chaoyou Fu, Haotian Wang, Kai Wu, Bo Cui, Xu Wang, Jianfei Pan, Haotian Wang, Zhang Zhang, Liang Wang

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) NJU(南京大学) PKU(北京大学) THU(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15811 2025-09-22 cs.CL cs.AI 73%

Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning

Sara Rajaee, Rochelle Choenni, Ekaterina Shutova, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) ILLC, University of Amsterdam(阿姆斯特丹大学语言学研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15557 2025-09-22 cs.LG cs.AI 73%

Reward Hacking Mitigation using Verifiable Composite Rewards

Mirza Farhan Bin Tarek, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at the 16th ACM Conference on Bioinformatics, Computational Biology, and Health Informatics (ACM-BCB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15968 2025-09-22 cs.RO cs.CV 50%

CoReVLA: A Dual-Stage End-to-End Autonomous Driving Framework for Long-Tail Scenarios via Collect-and-Refine

Shiyu Fang, Yiming Cui, Haoyang Liang, Chen Lv, Peng Hang, Jian Sun

机构 * College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏