arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-08 至 2025-10-08 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2504.09389 2025-10-08 cs.CL 89%

Measuring LLM Novelty As The Frontier Of Original And High-Quality Output

Vishakh Padmakumar, Chen Yueh-Han, Jane Pan, Valerie Chen, He He

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Updated results with higher coverage of open-data models and better quality judgments

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23058 2025-10-08 cs.AI cs.LG 87%

Risk Profiling and Modulation for LLMs

Yikai Wang, Xiaocheng Li, Guanting Chen

机构 * Department of Statistics and Operations Research, UNC-Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Imperial College Business School, Imperial College London(帝国理工学院伦敦校区商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06214 2025-10-08 cs.LG cs.AI cs.CL 87%

Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents

Mingkang Zhu, Xi Chen, Bei Yu, Hengshuang Zhao, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16366 2025-10-08 cs.CL cs.AI cs.CR cs.LG 87%

A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens

David Dobre, Mehrnaz Mofakhami, Sophie Xhonneux, Leo Schwinn, Gauthier Gidel

机构 * Université de Montréal(蒙特利尔大学) Mila(Mila研究所) Technical University of Munich(慕尼黑技术大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05410 2025-10-08 cs.CL cs.LG 84%

Aligning Language Models with Clinical Expertise: DPO for Heart Failure Nursing Documentation in Critical Care

Junyi Fan, Li Sun, Negin Ashrafi, Kamiar Alaei, Maryam Pishgar

机构 * University of Southern California(南加州大学) California State University(加州州立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05169 2025-10-08 cs.CR cs.AI 81%

From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs

Guangyu Shen, Siyuan Cheng, Xiangzhe Xu, Yuan Zhou, Hanxi Guo, Zhuo Zhang, Xiangyu Zhang

机构 * Purdue University(普渡大学) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06040 2025-10-08 cs.CV cs.AI 70%

VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization

Xinye Cao, Hongcan Guo, Jiawen Qian, Guoshun Nan, Chao Wang, Yuqi Pan, Tianhao Hou, Xiaojuan Wang, Yutong Gao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Minzu University of China(民族大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22688 2025-10-08 cs.CV 67%

Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization

Xu Jia

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13564 2025-10-08 cs.CV 50%

Imagining the Unseen: Generative Location Modeling for Object Placement

Jooyeol Yun, Davide Abati, Mohamed Omran, Jaegul Choo, Amirhossein Habibian, Auke Wiggers

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments Accepted by ICCV 2025 DRL4Real Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏