arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-31 至 2025-10-31 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2305.17608 2025-10-31 cs.LG cs.AI cs.CL math.OC stat.ML 89%

Reward Collapse in Aligning Large Language Models

Ziang Song, Tianle Cai, Jason D. Lee, Weijie J. Su

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for publication in the Journal of Data Science (JDS), reference JDS1201

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03710 2025-10-31 cs.CL cs.CR cs.LG 88%

Improving LLM Safety Alignment with Dual-Objective Optimization

Xuandong Zhao, Will Cai, Tianneng Shi, David Huang, Licong Lin, Song Mei, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07127 2025-10-31 cs.RO cs.AI 83%

Human-assisted Robotic Policy Refinement via Action Preference Optimization

Wenke Xia, Yichu Yang, Hongtao Wu, Xiao Ma, Tao Kong, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beijing Key Laboratory of Research on Large Models(北京大型模型研究重点实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);foundation model(abstract);分类 cs.AI

Comments Accepted By NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01369 2025-10-31 cs.LG cs.AI 79%

Incentivizing LLMs to Self-Verify Their Answers

Fuxiang Zhang, Jiacheng Xu, Chaojie Wang, Ce Cui, Yang Liu, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Skywork AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25884 2025-10-31 cs.AI cs.CL cs.LG 75%

Approximating Human Preferences Using a Multi-Judge Learned System

Eitán Sprejer, Fernando Avalos, Augusto Bernardi, Jose Pedro Brito de Azevedo Faustino, Jacob Haimes, Narmeen Fatimah Oozeer

机构 * BAISH | UBA | Apart Research(BAISH | UBA | Apart研究) University of São Paulo(圣保罗大学) Apart Research(Apart研究) Dovetail Research | Apart Research(Dovetail研究 | Apart研究)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01223 2025-10-31 cs.LG math.PR 74%

Explainable post-training bias mitigation with distribution-based fairness metrics

Ryan Franks, Alexey Miroshnikov, Konstandinos Kotsiopoulos

机构 * Discover Financial Services(Discover金融服务公司)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏