arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-20 至 2025-08-20 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 3 篇

2508.13445 2025-08-20 cs.LG 79%

ASAP: Unsupervised Post-training with Label Distribution Shift Adaptive Learning Rate

Heewon Park, Mugon Joe, Miru Kim, Minhae Kwon

机构 * Soongsil University(顺斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments 5 pages, 3 figures, accepted for ACM CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13437 2025-08-20 cs.AI 70%

Discrete Optimization of Min-Max Violation and its Applications Across Computational Sciences

Cheikh Ahmed, Mahdi Mostajabdaveh, Samin Aref, Zirui Zhou

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13189 2025-08-20 stat.ML cs.AI cs.LG 62%

Preference Models assume Proportional Hazards of Utilities

Chirag Nagpal

机构 * Meta Superintelligence Labs (MSL)(Meta超智能实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏