arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-18 至 2026-02-18 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2510.03269 2026-02-18 cs.LG cs.AI cs.CL 87%

General Exploratory Bonus for Optimistic Exploration in RLHF

在RLHF中引入乐观探索的通用探索奖金

Wendi Li, Changdae Oh, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GEB框架,通过理论分析和实验验证,解决了RLHF中乐观探索的偏差问题,提供了一种统一且有效的探索奖金方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15222 2026-02-18 cs.LG cs.AI 82%

Automatically Finding Reward Model Biases

自动发现奖励模型偏差

Atticus Wang, Iván Arcuschin, Arthur Conmy

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种利用LLM自动发现奖励模型偏差的方法,揭示了已知和新型偏差,并展示了进化迭代优于传统搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16779 2026-02-18 cs.HC cs.LG 57%

Improving User Interface Generation Models from Designer Feedback

改进来自设计师反馈的用户界面生成模型

Jason Wu, Amanda Swearngin, Arun Krishna Vajjala, Alan Leung, Jeffrey Nichols, Titus Barik

机构 * Purdue University(普渡大学) Apple(苹果公司)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于设计师反馈的改进方法,通过评论、草图和直接操作等交互方式提升UI生成模型的质量,实验表明其优于传统排名反馈方法。

Comments Version accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15567 2026-02-18 cs.RO 50%

Constraining Streaming Flow Models for Adapting Learned Robot Trajectory Distributions

约束流式流模型以适应学习的机器人轨迹分布

Jieting Long, Dechuan Liu, Weidong Cai, Ian Manchester, Weiming Zhi

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学,澳大利亚) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney, Australia(航空航天、机械与机电工程学院,悉尼大学,澳大利亚) Australian Center For Robotics, The University of Sydney, Australia(机器人研究中心,悉尼大学,澳大利亚) College of Connected Computing, Vanderbilt University, TN, USA(连接计算学院,范德比尔特大学,美国)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 CASF通过约束感知流式流模型在实时中适应机器人轨迹,确保安全性和可行性,优于传统方法。

Comments 8 pages, 8 figure

详情

展开后加载摘要…

URL PDF HTML 收藏