arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-05 至 2025-09-05 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2509.04243 2025-09-05 cs.CV cs.AI 79%

Learning Active Perception via Self-Evolving Preference Optimization for GUI Grounding

Wanfu Wang, Qipeng Huang, Guangquan Xue, Xiaobo Liang, Juntao Li

机构 * Wanfu Wang, Qipeng Huang, Guangquan Xue, Xiaobo Liang, Juntao Li(作者)

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04063 2025-09-05 cs.RO cs.LG 79%

Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models

Hongyin Zhang, Shiyuan Zhang, Junxi Jin, Qixin Zeng, Yifan Qiao, Hongchao Lu, Donglin Wang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03672 2025-09-05 cs.LG stat.ML 79%

SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences

Arpan Mukherjee, Marcello Bullo, Deniz Gündüz

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03535 2025-09-05 cs.CL cs.AI 62%

QuesGenie: Intelligent Multimodal Question Generation

Ahmed Mubarak, Amna Ahmed, Amira Nasser, Aya Mohamed, Fares El-Sadek, Mohammed Ahmed, Ahmed Salah, Youssef Sobhy

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 8 figures, 12 tables. Supervised by Dr. Ahmed Salah and TA Youssef Sobhy

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04372 2025-09-05 stat.ML cs.GL cs.LG math.ST stat.TH 57%

Connections between reinforcement learning with feedback,test-time scaling, and diffusion guidance: An anthology

Yuchen Jiao, Yuxin Chen, Gen Li

机构 * Department of Statistics and Data Science, Chinese University of Hong Kong(统计与数据科学系,香港中文大学) Department of Statistics and Data Science, the Wharton School, University of Pennsylvania(统计与数据科学系,沃顿商学院,宾夕法尼亚大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏