arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2510.20358 2025-12-02 cs.CL 70%

Dialogue Is Not Enough to Make a Communicative BabyLM (But Neither Is Developmentally Inspired Reinforcement Learning)

对话不足以造就一个交际性的婴儿语言模型(但也不如发展启发式强化学习)

Francesca Padovani, Bastian Bunzeck, Manar Ali, Omar Momen, Arianna Bisazza, Hendrik Buschmeier, Sina Zarrieß

机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG)、格罗宁根大学) CRC 1646 – Linguistic Creativity in Communication, Bielefeld University(语言交流创造性研究(CRC 1646)、比尔特诺夫大学)

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文探讨了仅通过对话数据预训练是否能生成有效的小型语言模型,并通过多种微调策略提升模型的交际能力,发现DPO微调在自定义对话基准测试中表现更优。

Journal ref Proceedings of the First BabyLM Workshop (2025), pp. 421-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08068 2025-12-02 cs.LG 70%

Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions

分位数奖励策略优化:与点估计回归和精确分区函数对齐

Simon Matrenok, Skander Moalla, Caglar Gulcehre

机构 * CLAIRE, EPFL(CLAIRE,瑞士联邦理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 QRPO通过分位数奖励实现点绝对奖励学习,保留DPO的简单性和离线适用性,同时提升在聊天和编码任务中的性能。

Comments 58 pages, NeurIPS2025 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17265 2025-11-25 cs.CL cs.CV 70%

Systematic Reward Gap Optimization for Mitigating VLM Hallucinations

系统性奖励缺口优化以缓解视觉语言模型的幻觉

Lehan He, Zeren Chen, Zhelun Shi, Tianyu Yu, Jing Shao, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 TPR通过主题级偏好重写系统优化奖励缺口配置,显著减少VLM幻觉并提升对齐效果。

Comments 34 pages, 12 figures, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21651 2025-11-24 cs.AI 70%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05986 2025-11-24 cs.CL 70%

Fine-Grained Reward Optimization for Machine Translation using Error Severity Mappings

细粒度奖励优化用于机器翻译的误差严重性映射

Miguel Moura Ramos, Tomás Almeida, Daniel Vareta, Filipe Azevedo, Sweta Agrawal, Patrick Fernandes, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa (ELLIS Unit Lisbon)(里斯本大学理工学院(ELLIS单位里斯本)) Instituto de Telecomunicações(电信研究所) Carnegie Mellon University(卡内基梅隆大学) TransPerfect Core contributor(TransPerfect核心贡献者)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用细粒度词级奖励和误差严重性映射优化,提升机器翻译质量与训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14659 2025-11-19 cs.RO cs.AI 70%

NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards

Chia-Yu Hung, Navonil Majumder, Haoyuan Deng, Liu Renhang, Yankang Ang, Amir Zadeh, Chuan Li, Dorien Herremans, Ziwei Wang, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Lambda Labs(Lambda实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.AI

Comments https://declare-lab.github.io/nora-1.5

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02709 2025-11-19 cs.LG 70%

Preference Robustness for DPO with Applications to Public Health

Cheol Woo Kim, Shresth Verma, Mauricio Tec, Milind Tambe

专题命中 后训练与偏好优化 :LLM(abstract);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09047 2025-11-13 cs.LG 70%

Preference is More Than Comparisons: Rethinking Dueling Bandits with Augmented Human Feedback

Shengbo Wang, Hong Sun, Ke Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Extended version of our AAAI 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08594 2025-11-13 cs.CL 70%

Diverse Preference Learning for Capabilities and Alignment

Stewart Slocum, Asher Parker-Sartori, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL

Journal ref 13th International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21478 2025-11-04 cs.CV cs.AI 70%

Policy Optimized Text-to-Image Pipeline Design

Uri Gadot, Rinon Gal, Yftah Ziser, Gal Chechik, Shie Mannor

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21223 2025-10-27 cs.LG 70%

Model Merging with Functional Dual Anchors

Kexuan Shi, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.LG

Comments Technical report (23 pages, 15 figures, project page: https://spherelab.ai/fda/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16582 2025-10-21 cs.AI 70%

Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?

Junchi Yu, Yujie Liu, Jindong Gu, Philip Torr, Dongzhan Zhou

机构 * Department of Engineering Science, University of Oxford, UK(牛津大学工程科学系) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20673 2025-10-21 cs.CL 70%

Geometric-Mean Policy Optimization

Yuzhong Zhao, Yue Liu, Junpeng Liu, Jingye Chen, Xun Wu, Yaru Hao, Tengchao Lv, Shaohan Huang, Lei Cui, Qixiang Ye, Fang Wan, Furu Wei

机构 * UCAS(中国科学院大学) CUHK(香港中文大学) HKUST(香港科技大学) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Code is available at https://github.com/callsys/GMPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14526 2025-10-17 cs.CV cs.LG 70%

Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models

Yunze Tong, Didi Zhu, Zijing Hu, Jinluan Yang, Ziyu Zhao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG

Comments Appendix will be appended soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08696 2025-10-13 cs.LG 70%

Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting

Yunzhen Feng, Parag Jain, Anthony Hartshorn, Yaqi Duan, Julia Kempe

机构 * Meta Superintelligence Labs(Meta超智能实验室) New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06878 2025-10-09 cs.AI 70%

TGPR: Tree-Guided Policy Refinement for Robust Self-Debugging of LLMs

Daria Ozerova, Ekaterina Trofimova

机构 * HSE University(俄罗斯莫斯科国立高等经济学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06866 2025-10-09 cs.CL 70%

Unlocking Latent Discourse Translation in LLMs Through Quality-Aware Decoding

Wafaa Mohammed, Vlad Niculae, Chrysoula Zerva

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03905 2025-10-09 cs.CL 70%

Sotopia-RL: Reward Design for Social Intelligence

Haofei Yu, Zhengyang Qi, Yining Zhao, Kolby Nottingham, Keyang Xuan, Bodhisattwa Prasad Majumder, Hao Zhu, Paul Pu Liang, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Irvine(加州大学尔湾分校) Allen Institute for Artificial Intelligence(人工智能艾伦研究所) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06040 2025-10-08 cs.CV cs.AI 70%

VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization

Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Minzu University of China(民族大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03612 2025-10-07 cs.AI cs.CR 70%

Cross-Modal Content Optimization for Steering Web Agent Preferences

Tanqiu Jiang, Min Bai, Nikolaos Pappas, Yanjun Qi, Sandesh Swamy

机构 * Stony Brook University(石溪大学) AWS AI Labs(亚马逊人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24342 2025-09-30 cs.AI 70%

Fin-Ally: Pioneering the Development of an Advanced, Commonsense-Embedded Conversational AI for Money Matters

Sarmistha Das, Priya Mathur, Ishani Sharma, Sriparna Saha, Kitsuchart Pasupa, Alka Maurya

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(计算机科学与工程系,印度理工学院帕纳布分校) School of Information Technology, King Mongkut's Institute of Technology Ladkrabang, Thailand(信息科技学院,拉差班国王技术学院) CRISIL Limited, India(CRISIL有限公司)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16853 2025-09-30 cs.LG 70%

Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models

Semin Kim, Yeonwoo Cha, Jaehoon Yoo, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 29 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17673 2025-09-30 cs.CL 70%

Cross-lingual Human-Preference Alignment for Neural Machine Translation with Direct Quality Optimization

Kaden Uhlig, Joern Wuebker, Raphael Reinauer, John DeNero

机构 * LILT Amazon(亚马逊)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.CL

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22099 2025-09-29 cs.CL 70%

S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models

Shaoning Sun, Jiachen Yu, Zongqi Wang, Xuewei Yang, Tianle Gu, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21828 2025-09-29 cs.LG cs.MA 70%

Preference-Guided Learning for Sparse-Reward Multi-Agent Reinforcement Learning

The Viet Bui, Tien Mai, Hong Thanh Nguyen

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) University of Oregon(俄勒冈大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12663 2025-09-29 cs.CL 70%

Demystifying Multilingual Chain-of-Thought in Process Reward Modeling

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20838 2025-09-26 cs.CL 70%

Zero-Shot Privacy-Aware Text Rewriting via Iterative Tree Search

Shuo Huang, Xingliang Yuan, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(莫纳什大学) University of Melbourne(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18632 2025-09-24 cs.CL 70%

A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users

Nishant Balepur, Matthew Shu, Yoo Yeon Sung, Seraphina Goldfarb-Tarrant, Shi Feng, Fumeng Yang, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17105 2025-09-23 cs.LG 70%

GRPOformer: Advancing Hyperparameter Optimization via Group Relative Policy Optimization

Haoxin Guo, Jiawen Pan, Weixin Zhai

机构 * 1College of Information Electrical Engineering, \ Agricultural University, Beijing 100083, China Electrical Engineering, \ Agricultural University, Beijing 100083, China 2Key Laboratory of Agricultural Machinery Monitoring

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16965 2025-09-23 cs.CL 70%

Preference Distillation via Value based Reinforcement Learning

Minchan Kwon, Junwon Ko, Kangil Kim, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院) Gwangju Institute of Science and Technology (GIST)(全州科学技术院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL

Comments 20 page

Journal ref NIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏