arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-17 至 2025-10-17 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2505.18407 2025-10-17 cs.LG cs.AI 81%

KL-regularization Itself is Differentially Private in Bandits and RLHF

Yizhou Zhang, Kishan Panaganti, Laixi Shi, Juba Ziani, Adam Wierman

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14942 2025-10-17 cs.AI 77%

GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning

Yao Zhang, Yu Wu, Haowei Zhang, Weiguo Li, Haokun Chen, Jingpei Wu, Guohao Li, Zhen Han, Volker Tresp

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14374 2025-10-17 cs.CV 75%

Spatial Preference Rewarding for MLLMs Spatial Understanding

Han Qiu, Peng Gao, Lewei Lu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院) Zhejiang University of Technology(浙江工业大学) UCAS-Terminus AI Lab,University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13660 2025-10-17 cs.CV 75%

OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild

Hongyu Qu, Jianan Wei, Xiangbo Shu, Yazhou Yao, Wenguan Wang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Nanjing Forestry University(南京林业大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to NeurIPS 2025; Project page: https://github.com/quhongyu/OmniGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14526 2025-10-17 cs.CV cs.LG 70%

Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models

Yunze Tong, Didi Zhu, Zijing Hu, Jinluan Yang, Ziyu Zhao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG

Comments Appendix will be appended soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01545 2025-10-17 cs.LG cs.AI cs.RO 62%

Predictive Preference Learning from Human Interventions

Haoyuan Cai, Zhenghao Peng, Bolei Zhou

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Spotlight. Project page: https://metadriverse.github.io/ppl

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09561 2025-10-17 cs.LG 57%

Strategyproof Reinforcement Learning from Human Feedback

Thomas Kleine Buening, Jiarui Gan, Debmalya Mandal, Marta Kwiatkowska

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) Department of Computer Science University of Oxford(牛津大学计算机科学系) Department of Computer Science University of Warwick(Warwick大学计算机科学系)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

Comments To appear at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14583 2025-10-17 cs.CV cs.CL 57%

Talking Points: Describing and Localizing Pixels

Matan Rusanovsky, Shimon Malnick, Shai Avidan

机构 * Tel Aviv University(特拉维夫大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13331 2025-10-17 cs.CV 50%

Group-Wise Optimization for Self-Extensible Codebooks in Vector Quantized Models

Hong-Kai Zheng, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, China(人工智能学院,南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, Nanjing, China(国家工业和信息化部模式分析与机器智能重点实验室,南京) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing, China(教育部脑机智能技术重点实验室,南京)

专题命中 后训练与偏好优化 :post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏