arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-22 至 2025-10-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2502.00657 2025-10-22 cs.LG cs.AI cs.CY stat.ML 84%

LLM Safety Alignment is Divergence Estimation in Disguise

Rajdeep Haldar, Ziyi Wang, Qifan Song, Guang Lin, Yue Xing

机构 * Department of Statistics, Purdue University(普渡大学统计系) Department of Statistics, Michigan State University(密歇根州立大学统计系)

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12112 2025-10-22 cs.LG cs.AI cs.MA 84%

Balancing Act: Prioritization Strategies for LLM-Designed Restless Bandit Rewards

Shresth Verma, Niclas Boehmer, Lingkai Kong, Milind Tambe

机构 * Harvard University, USA(哈佛大学) Hasso Plattner Institute, Germany(哈索普拉特纳研究所)

专题命中 后训练与偏好优化 :LLM(title,abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18849 2025-10-22 cs.CL cs.AI 82%

Towards Faithful and Controllable Personalization via Critique-Post-Edit Reinforcement Learning

Chenghao Zhu, Meiling Tao, Tiannan Wang, Dongyi Ding, Yuchen Eleanor Jiang, Wangchunshu Zhou

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Electronic Science and Technology of China(电子科技大学) South China Agricultural University(华南农业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18147 2025-10-22 cs.CL 81%

LLMs Encode How Difficult Problems Are

William Lugoloobi, Chris Russell

机构 * University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04501 2025-10-22 cs.CL cs.AI cs.LG 80%

Understanding Reinforcement Learning for Model Training, and future directions with GRAPE

Rohit Patel

机构 * Rohit Patel(独立研究者)

专题命中 后训练与偏好优化 :instruction tuning(abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 35 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18851 2025-10-22 cs.CV cs.AI 79%

DP$^2$O-SR: Direct Perceptual Preference Optimization for Real-World Image Super-Resolution

Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Shihao Wang, Tianhe Wu, Qiaosi Yi, Shuai Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

Comments Accept by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18353 2025-10-22 cs.CV 78%

Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback

Yi-Lun Wu, Bo-Kai Ruan, Chiang Tseng, Hong-Han Shuai

机构 * Institute of Electrical and Computer Engineering, National Yang Ming Chiao Tung University(电子工程学院,阳明交通大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21090 2025-10-22 eess.AS 78%

Post-training for Deepfake Speech Detection

Wanying Ge, Xin Wang, Xuechen Liu, Junichi Yamagishi

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments Corrected previous implementation of EER calculation. Slight numerical changes in some of the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10935 2025-10-22 cs.CL 77%

Introducing Spotlight: A Novel Approach for Generating Captivating Key Information from Documents

Ankan Mullick, Sombit Bose, Rounak Saha, Ayan Kumar Bhowmick, Aditya Vempaty, Prasenjit Dey, Ravi Kokku, Pawan Goyal, Niloy Ganguly

机构 * IIT Kharagpur(印度克达尔普大学) Emergence AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

Comments Paper accepted in EMNLP 2025 Main Conference (Full Paper)

Journal ref EMNLP 2025 Main Conference (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14253 2025-10-22 cs.AI 57%

Towards Agentic Self-Learning LLMs in Search Environment

Wangtao Sun, Xiang Cheng, Jialin Fan, Yao Xu, Xing Yu, Shizhu He, Jun Zhao, Kang Liu

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Xiaohongshu Inc(小红书公司) Meituan Inc(美团公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏