arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2506.14386 2025-06-18 cs.LG cs.AI 62%

ResNets Are Deeper Than You Think

Christian H. X. Ali Mehmeti-Göpel, Michael Wand

机构 * Department of Computer Science Johannes-Gutenberg University Mainz, Germany(计算机科学系格鲁特伯爵大学马因茨德国)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12725 2025-06-17 cs.AI cs.CL 62%

Rethinking DPO: The Role of Rejected Responses in Preference Misalignment

Jay Hyeon Cho, JunHyeok Oh, Myunsoo Kim, Byung-Jun Lee

机构 * Korea University(韩国大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07091 2025-06-13 cs.AI cs.LG 62%

AssistanceZero: Scalably Solving Assistance Games

Cassidy Laidlaw, Eli Bronstein, Timothy Guo, Dylan Feng, Lukas Berglund, Justin Svegliato, Stuart Russell, Anca Dragan

机构 * ucb(加州大学伯克利分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Presented at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18881 2025-06-06 cs.CV cs.AI cs.LG 62%

Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences

Weijian Luo

机构 * Peking University(北京大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Revision: The paper was accepted by Transactions of Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23474 2025-05-30 cs.AI cs.CL 62%

Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns

Xiang Li, Haiyang Yu, Xinghua Zhang, Ziyang Huang, Shizhu He, Kang Liu, Jun Zhao, Fei Huang, Yongbin Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15229 2025-04-30 cs.CL cs.AI 62%

A Practical Analysis of Human Alignment with *PO

Kian Ahrabian, Xihui Lin, Barun Patra, Vishrav Chaudhary, Alon Benhaim, Jay Pujara, Xia Song

机构 * University of Southern California, Information Sciences Institute(南加州大学信息科学研究所) Microsoft(微软公司)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 findings papers. 9 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17219 2025-04-25 cs.LG cs.AI cs.CR 62%

Enhancing Variational Autoencoders with Smooth Robust Latent Encoding

Hyomin Lee, Minseon Kim, Sangwon Jang, Jongheon Jeong, Sung Ju Hwang

机构 * Korea University(韩国大学) Microsoft(微软) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24150 2025-04-01 cs.LG cs.AI cs.HC 62%

Learning a Canonical Basis of Human Preferences from Binary Ratings

Kailas Vodrahalli, Wei Wei, James Zou

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18347 2025-03-25 cs.LG cs.AI cs.RO 62%

Latent Embedding Adaptation for Human Preference Alignment in Diffusion Planners

Wen Zheng Terence Ng, Jianda Chen, Yuan Xu, Tianwei Zhang

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18548 2025-03-14 cs.LG cs.AI 62%

What is the Alignment Objective of GRPO?

Milan Vojnovic, Se-Young Yun

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04070 2025-03-14 cs.CL cs.AI 62%

PAD: Personalized Alignment of LLMs at Decoding-Time

Ruizhe Chen, Xiaotian Zhang, Meng Luo, Wenhao Chai, Zuozhu Liu

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03185 2025-03-14 cs.LG cs.AI 62%

Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Cassidy Laidlaw, Shivam Singhal, Anca Dragan

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Spotlight at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00930 2025-03-04 cs.LG cs.AI 62%

Behavior Preference Regression for Offline Reinforcement Learning

Padmanaba Srinivasan, William Knottenbelt

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

Comments Conference paper at AAAI 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21038 2025-03-03 cs.LG cs.AI 62%

Reward Learning from Multiple Feedback Types

Yannick Metz, András Geiszl, Raphaël Baur, Mennatallah El-Assady

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03642 2025-02-24 cs.CL cs.LG 62%

Is Free Self-Alignment Possible?

Dyah Adila, Changho Shin, Yijing Zhang, Frederic Sala

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11287 2025-02-12 cs.CL cs.AI 62%

Process Reward Model with Q-Value Rankings

Wendi Li, Yixuan Li

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04576 2025-02-10 cs.LG cs.CL 62%

Self-Regulation and Requesting Interventions

So Yeon Min, Yue Wu, Jimin Sun, Max Kaufmann, Fahim Tajwar, Yonatan Bisk, Ruslan Salakhutdinov

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00634 2025-02-06 cs.CL cs.AI 62%

SimulPL: Aligning Human Preferences in Simultaneous Machine Translation

Donglei Yu, Yang Zhao, Jie Zhu, Yangyifan Xu, Yu Zhou, Chengqing Zong

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR 2025. 23 pages,13 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01667 2025-02-05 cs.LG cs.AI 62%

Refining Alignment Framework for Diffusion Models with Intermediate-Step Preference Ranking

Jie Ren, Yuhang Zhang, Dongrui Liu, Xiaopeng Zhang, Qi Tian

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18027 2025-01-24 cs.CL cs.AI 62%

Cross-lingual Transfer of Reward Models in Multilingual Alignment

Jiwoo Hong, Noah Lee, Rodrigo Martínez-Castaño, César Rodríguez, James Thorne

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10102 2025-01-23 cs.NE cs.AI cs.LG eess.AS 62%

A novel Reservoir Architecture for Periodic Time Series Prediction

Zhongju Yuan, Geraint Wiggins, Dick Botteldooren

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11525 2025-01-22 cs.LG cs.AI cs.CR 62%

Technical Report for the Forgotten-by-Design Project: Targeted Obfuscation for Machine Learning

Rickard Brännvall, Laurynas Adomaitis, Olof Görnerup, Anass Sedrati

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05501 2025-01-22 cs.AI cs.LG cs.MA 62%

Strategy Masking: A Method for Guardrails in Value-based Reinforcement Learning Agents

Jonathan Keane, Sam Keyser, Jeremy Kedziora

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20200 2024-12-31 cs.LG cs.AI cs.CR cs.DC 62%

Federated Unlearning with Gradient Descent and Conflict Mitigation

Zibin Pan, Zhichao Wang, Chi Li, Kaiyan Zheng, Boqi Wang, Xiaoying Tang, Junhua Zhao

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

Comments To be published in the Proceedings of the 39th AAAI Conference on Artificial Intelligence (AAAI-25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14167 2024-12-19 cs.CV cs.AI cs.LG 62%

VideoDPO: Omni-Preference Alignment for Video Diffusion Generation

Runtao Liu, Haoyu Wu, Zheng Ziqiang, Chen Wei, Yingqing He, Renjie Pi, Qifeng Chen

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14135 2024-12-19 cs.AI cs.LG 62%

Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective

Zhiyuan Zeng, Qinyuan Cheng, Zhangyue Yin, Bo Wang, Shimin Li, Yunhua Zhou, Qipeng Guo, Xuanjing Huang, Xipeng Qiu

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09544 2024-12-13 cs.LG cs.AI math.OC math.ST stat.ML stat.TH 62%

Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking

Paria Rashidinejad, Yuandong Tian

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

Comments 46 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01575 2024-12-10 math.OC cs.AI cs.LG stat.ML 62%

Contextual Bilevel Reinforcement Learning for Incentive Alignment

Vinzenz Thoma, Barna Pasztor, Andreas Krause, Giorgia Ramponi, Yifan Hu

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 60 pages, 21 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17747 2024-11-19 cs.LG cs.AI stat.ML 62%

When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback

Leon Lang, Davis Foote, Stuart Russell, Anca Dragan, Erik Jenner, Scott Emmons

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Advances in Neural Information Processing Systems 37 (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07451 2024-11-13 cs.HC cs.AI cs.LG 62%

Optimizing Data Delivery: Insights from User Preferences on Visuals, Tables, and Text

Reuben Luera, Ryan Rossi, Franck Dernoncourt, Alexa Siu, Sungchul Kim, Tong Yu, Ruiyi Zhang, Xiang Chen, Nedim Lipka, Zhehao Zhang, Seon Gyeom Kim, Tak Yeon Lee

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏