arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-04 至 2025-11-04 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2511.01758 2025-11-04 cs.LG cs.AI cs.CL 83%

RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks

Mian Wu, Gavin Zhang, Sewon Min, Sergey Levine, Aviral Kumar

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Project page: https://mianwu01.github.io/RLAC_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01807 2025-11-04 cs.CL cs.AI 79%

Plan-and-Write: Structure-Guided Length Control for LLMs without Model Retraining

Adewale Akinfaderin, Shreyas Subramanian, Akarsha Sehwag

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Presented at Workshop on Prompt Optimization, KDD 2025, Toronto, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04251 2025-11-04 cs.AI cs.LG cs.MA 79%

Language-Driven Coordination and Learning in Multi-Agent Simulation Environments

Zhengyang Li, Sawyer Campos, Nana Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21478 2025-11-04 cs.CV cs.AI 70%

Policy Optimized Text-to-Image Pipeline Design

Uri Gadot, Rinon Gal, Yftah Ziser, Gal Chechik, Shie Mannor

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01083 2025-11-04 cs.RO 50%

Deployable Vision-driven UAV River Navigation via Human-in-the-loop Preference Alignment

Zihan Wang, Jianwen Li, Li-Fan Wu, Nina Mahmoudian

机构 * School of Mechanical Engineering, Purdue University(机械工程学院,普渡大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

Comments Submitted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏