arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-29 至 2025-07-29 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2507.20000 2025-07-29 cs.AI cs.DL 89%

Matching Game Preferences Through Dialogical Large Language Models: A Perspective

Renaud Fabre, Daniel Egret, Patrice Bellot

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 28 pages, 1 figure. Published in Applied Sciences

Journal ref Applied Sciences, 2025, 15(15), 8307

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12854 2025-07-29 cs.CL 89%

Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation

Songjun Tu, Jiahao Lin, Xiangyu Tian, Qichao Zhang, Linjing Li, Yuqian Fu, Nan Xu, Wei He, Xiangyuan Lan, Dongmei Jiang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wenge Technology(文生科技) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 23pages

Journal ref COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20181 2025-07-29 cs.CL cs.AI 88%

SGPO: Self-Generated Preference Optimization based on Self-Improver

Hyeonji Lee, Daejin Jo, Seohwan Yun, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20150 2025-07-29 cs.AI cs.CL cs.LG 88%

The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models

Xingcheng Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02193 2025-07-29 cs.AI 84%

More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment

Yifan Wang, Runjin Chen, Bolian Li, David Cho, Yihe Deng, Ruqi Zhang, Tianlong Chen, Zhangyang Wang, Ananth Grama, Junyuan Hong

机构 * Purdue University(普渡大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

Comments This version includes updated results and expanded discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06645 2025-07-29 cs.CL cs.AI 82%

FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings

Tong Liu, Xiao Yu, Wenxuan Zhou, Jindong Gu, Volker Tresp

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20566 2025-07-29 cs.AI 79%

Unlearning of Knowledge Graph Embedding via Preference Optimization

Jiajun Liu, Wenjun Ke, Peng Wang, Yao He, Ziyu Shang, Guozheng Li, Zijie Xu, Ke Ji

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20335 2025-07-29 cs.LG cs.AI 79%

Cultivating Helpful, Personalized, and Creative AI Tutors: A Framework for Pedagogical Alignment using Reinforcement Learning

Siyu Song, Wentao Liu, Ye Lu, Ruohua Zhang, Tao Liu, Jinze Lv, Xinyun Wang, Aimin Zhou, Fei Tan, Bo Jiang, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science and Technology(计算机科学与技术学院) Department of Educational Information Technology(教育信息技术系)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10505 2025-07-29 cs.LG cs.CL stat.ML 73%

Preference learning made easy: Everything should be understood through win rate

Lily H. Zhang, Rajesh Ranganath

机构 * Center for Data Science, New York University, New York, USA(数据科学中心,纽约大学,纽约,美国) Courant Institute, New York University, New York, USA(柯朗研究所,纽约大学,纽约,美国)

专题命中 后训练与偏好优化 :SFT(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20880 2025-07-29 cs.SD cs.AI 57%

JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment

Renhang Liu, Chia-Yu Hung, Navonil Majumder, Taylor Gautreaux, Amir Ali Bagherzadeh, Chuan Li, Dorien Herremans, Soujanya Poria

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

Comments https://github.com/declare-lab/jamify

详情

展开后加载摘要…

URL PDF HTML 收藏