arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-12 至 2025-08-12 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2506.23998 2025-08-12 cs.CL 90%

Auto-TA: Towards Scalable Automated Thematic Analysis (TA) via Multi-Agent Large Language Models with Reinforcement Learning

Seungjun Yi, Joakim Nguyen, Huimin Xu, Terence Lim, Andrew Well, Mia Markey, Ying Ding

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments Presented at ACL 2025 SRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07768 2025-08-12 cs.LG cs.AI cs.CL 87%

Pareto Multi-Objective Alignment for Language Models

Qiang He, Setareh Maghsudi

机构 * Ruhr University Bochum(鲁尔大学波恩)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ECML/PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00624 2025-08-12 cs.CV 85%

VideoSAVi: Self-Aligned Video Language Models without Human Supervision

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08220 2025-08-12 cs.CV 67%

Learning User Preferences for Image Generation Model

Wenyi Mo, Ying Ba, Tianyu Zhang, Yalong Bai, Biye Li

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06924 2025-08-12 cs.CV 67%

AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning

Shihao Yuan, Yahui Liu, Yang Yue, Jingyuan Zhang, Wangmeng Zuo, Qi Wang, Fuzheng Zhang, Guorui Zhou

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏