arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2509.25047 2025-09-30 cs.AI 81%

Scaling Synthetic Task Generation for Agents via Exploration

Ram Ramrakhya, Andrew Szot, Omar Attia, Yuhao Yang, Anh Nguyen, Bogdan Mazoure, Zhe Gan, Harsh Agrawal, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13310 2025-09-17 cs.CL 81%

Scaling Agents via Continual Pre-training

Liangcai Su, Zhen Zhang, Guangyu Li, Zhuo Chen, Chenxi Wang, Maojia Song, Xinyu Wang, Kuan Li, Jialong Wu, Xuanzhong Chen, Zile Qiao, Zhongwang Zhang, Huifeng Yin, Shihao Cai, Runnan Fang, Zhengwei Tao, Wenbiao Yin, Chenxiong Qian, Yong Jiang, Pengjun Xie, Fei Huang, Jingren Zhou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)

Comments https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05070 2025-08-06 cs.CL 81%

RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation

Tianjiao Li, Mengran Yu, Chenyu Shi, Yanjun Zhao, Xiaojing Liu, Qiang Zhang, Qi Zhang, Xuanjing Huang, Jiayin Wang

机构 * Bilibili Inc.(哔哩哔哩公司) Xi’an Jiaotong University(西安交通大学) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01368 2025-07-03 cs.CV cs.LG 81%

Activation Reward Models for Few-Shot Model Alignment

Tianning Chai, Chancharik Mitra, Brandon Huang, Gautam Rajendrakumar Gare, Zhiqiu Lin, Assaf Arbelle, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Deva Ramanan, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20653 2025-06-18 cs.AI 81%

Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries

Jiahao Yu, Haozheng Luo, Jerry Yao-Chieh Hu, Wenbo Guo, Han Liu, Xinyu Xing

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments published at USENIX Security 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08681 2025-06-12 cs.LG 81%

Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling

Phuc Minh Nguyen, Ngoc-Hieu Nguyen, Duy H. M. Nguyen, Anji Liu, An Mai, Binh T. Nguyen, Daniel Sonntag, Khoa D. Doan

机构 * VinUniversity(文大学) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心) University of Stuttgart(斯图加特大学) University of California Los Angeles (UCLA)(加州大学洛杉矶分校) International University - VNUHCM(国际大学 - VNUHCM) University of Science - VNUHCM(科学大学 - VNUHCM) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Oldenburg University(奥尔登堡大学) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments First version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23634 2025-05-30 cs.LG cs.CR 81%

MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment

John Halloran

机构 * Leidos(莱迪斯公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments 27 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22653 2025-05-29 cs.CL 81%

The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason

Ang Lv, Ruobing Xie, Xingwu Sun, Zhanhui Kang, Rui Yan

机构 * GSAI, Renmin University of China(清华大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Macau(澳门大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20871 2025-05-28 cs.CL 81%

Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG

Xin Sun, Jianan Xie, Zhongqi Chen, Qiang Liu, Shu Wu, Yuehe Chen, Bowen Song, Weiqiang Wang, Zilei Wang, Liang Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14946 2025-05-22 cs.AI 81%

Reinforcement Learning from User Feedback

Eric Han, Jun Chen, Karthik Abinav Sankararaman, Xiaoliang Peng, Tengyu Xu, Eryk Helenowski, Kaiyan Peng, Mrinal Kumar, Sinong Wang, Han Fang, Arya Talebzadeh

机构 * Meta GenAI(Meta 生成式人工智能)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16272 2025-04-24 cs.LG 81%

Learning Explainable Dense Reward Shapes via Bayesian Optimization

Ryan Koo, Ian Yang, Vipul Raheja, Mingyi Hong, Kwang-Sung Jun, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Georgia Institute of Technology(佐治亚理工学院) Grammarly University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22230 2025-04-03 cs.LG 81%

Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback

Wei Shen, Guanlin Liu, Zheng Wu, Ruofei Zhu, Qingping Yang, Chao Xin, Yu Yue, Lin Yan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21819 2025-03-31 cs.CL 81%

Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach

Xuying Li, Zhuo Li, Yuji Kosuga, Victor Bian

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13980 2025-03-19 cs.LG 81%

Empowering LLMs in Decision Games through Algorithmic Data Synthesis

Haolin Wang, Xueyan Li, Yazhe Niu, Shuai Hu, Hongsheng Li

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04783 2025-03-10 cs.CL cs.CR 81%

Comparative Analysis Based on DeepSeek, ChatGPT, and Google Gemini: Features, Techniques, Performance, Future Prospects

Anichur Rahman, Shahariar Hossain Mahir, Md Tanjum An Tashrif, Airin Afroj Aishi, Md Ahsan Karim, Dipanjali Kundu, Tanoy Debnath, Md. Abul Ala Moududi, MD. Zunead Abedin Eidmum

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02846 2025-03-05 cs.CL 81%

Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs

Yuzhe Gu, Wenwei Zhang, Chengqi Lyu, Dahua Lin, Kai Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by ICLR 2025. Code is available at https://github.com/open-compass/ANAH

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21545 2025-02-19 cs.CL 81%

CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling

Taneesh Gupta, Shivam Shandilya, Xuchao Zhang, Rahul Madhavan, Supriyo Ghosh, Chetan Bansal, Huaxiu Yao, Saravan Rajmohan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00847 2025-02-13 cs.LG 81%

Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Xingzhou Lou, Dong Yan, Wei Shen, Yuzi Yan, Jian Xie, Junge Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06148 2025-02-11 cs.CL cs.IR 81%

Optimizing Knowledge Integration in Retrieval-Augmented Generation with Self-Selection

Yan Weng, Fengbin Zhu, Tong Ye, Haoyan Liu, Fuli Feng, Tat-Seng Chua

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03095 2025-02-06 cs.LG 81%

Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms

Xuerui Su, Yue Wang, Jinhua Zhu, Mingyang Yi, Feng Xu, Zhiming Ma, Yuting Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07455 2025-01-22 cs.LG stat.ML 81%

Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis

Qining Zhang, Honghao Wei, Lei Ying

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01304 2024-12-13 cs.CL 81%

Improving the Validity of Automatically Generated Feedback via Reinforcement Learning

Alexander Scarlatos, Digory Smith, Simon Woodhead, Andrew Lan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Best student paper award, Published in AIED 2024: The 25th International Conference on Artificial Intelligence in Education

Journal ref In International Conference on Artificial Intelligence in Education (pp. 280-294). Cham: Springer Nature Switzerland (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03949 2024-10-30 cs.CL 81%

UltraMedical: Building Specialized Generalists in Biomedicine

Kaiyan Zhang, Sihang Zeng, Ermo Hua, Ning Ding, Zhang-Ren Chen, Zhiyuan Ma, Haoxin Li, Ganqu Cui, Biqing Qi, Xuekai Zhu, Xingtai Lv, Hu Jinfang, Zhiyuan Liu, Bowen Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Camera ready version for NeurIPS 2024 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19134 2024-10-28 cs.CL cs.SD eess.AS 81%

AlignCap: Aligning Speech Emotion Captioning to Human Preferences

Ziqi Liang, Haoxiang Shi, Hanhui Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted to EMNLP2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12832 2024-10-18 cs.LG 81%

Generative Reward Models

Dakota Mahan, Duy Van Phung, Rafael Rafailov, Chase Blagden, Nathan Lile, Louis Castricato, Jan-Philipp Fränken, Chelsea Finn, Alon Albalak

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09834 2024-09-02 cs.AI 81%

Minor DPO reject penalty to increase training robustness

Shiming Xie, Hong Chen, Fred Yu, Zeye Sun, Xiuyu Wu, Yingfan Hu

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 8 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11791 2024-08-22 cs.LG 81%

Critique-out-Loud Reward Models

Zachary Ankner, Mansheej Paul, Brandon Cui, Jonathan D. Chang, Prithviraj Ammanabrolu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15568 2024-07-10 cs.LG 81%

Robust Reinforcement Learning from Corrupted Human Feedback

Alexander Bukharin, Ilgee Hong, Haoming Jiang, Zichong Li, Qingru Zhang, Zixuan Zhang, Tuo Zhao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01771 2024-06-05 cs.CL 81%

LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual Feedback

Wen Lai, Mohsen Mesgar, Alexander Fraser

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to Findings of ACL 2024. The code, datasets, and models are publicly available at https://github.com/boschresearch/ACL24-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20335 2024-05-31 cs.CL 81%

Xwin-LM: Strong and Scalable Alignment Practice for LLMs

Bolin Ni, JingCheng Hu, Yixuan Wei, Houwen Peng, Zheng Zhang, Gaofeng Meng, Han Hu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏