arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-07 至 2025-11-07 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2510.25766 2025-11-07 cs.CL 90%

Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models

Sriram Balasubramanian, Samyadeep Basu, Koustava Goswami, Ryan Rossi, Varun Manjunatha, Roshan Santhosh, Ruiyi Zhang, Soheil Feizi, Nedim Lipka

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)

Comments Post-hoc attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03939 2025-11-07 cs.LG cs.AI cs.CL 87%

RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods

Raghav Sharma, Manan Mehta, Sai Tiger Raina

机构 * Northeastern University(东北大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13518 2025-11-07 cs.CL cs.AI cs.LG 87%

Selective Preference Optimization via Token-Level Reward Function Estimation

Kailai Yang, Zhiwei Liu, Qianqian Xie, Jimin Huang, Erxue Min, Sophia Ananiadou

机构 * National Centre for Text Mining, The University of Manchester(曼彻斯特大学文本挖掘中心) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究中心) The Fin AI(Fin AI公司) Baidu Inc.(百度公司) Archimedes Research(阿基米德研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by the EMNLP 2025 main conference

Journal ref https://aclanthology.org/2025.emnlp-main.359/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11234 2025-11-07 cs.RO cs.CV 82%

Poutine: Vision-Language-Trajectory Pre-Training and Reinforcement Learning Post-Training Enable Robust End-to-End Autonomous Driving

Luke Rowe, Rodrigue de Schaetzen, Roger Girgis, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13444 2025-11-07 econ.GN q-fin.EC 67%

Balancing Engagement and Polarization: Multi-Objective Alignment of News Content Using LLMs

Mengjie Cheng, Elie Ofek, Hema Yoganarasimhan

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

Comments 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03997 2025-11-07 cs.CV 50%

PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection

Peiyao Wang, Weining Wang, Qi Li

专题命中 后训练与偏好优化 :preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏