arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-20 至 2025-10-20 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 2 篇

2510.15716 2025-10-20 cs.AI 87%

Direct Preference Optimization with Unobserved Preference Heterogeneity: The Necessity of Ternary Preferences

Keertana Chidambaram, Karthik Vinary Seetharaman, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07242 2025-10-20 cs.CL cs.LG 79%

Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense

Leitian Tao, Ilia Kulikov, Swarnadeep Saha, Tianlu Wang, Jing Xu, Sharon Li, Jason E Weston, Ping Yu

机构 * FAIR at Meta(Meta 的 FAIR) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏