arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2510.15862 2026-02-24 cs.AI 77%

Rethinking the Design of Reinforcement Learning-Based Deep Research Agents

重新思考基于强化学习的深度研究代理的设计

Yi Wan, Jiuqi Wang, Liam Li, Jinsong Liu, Ruihao Zhu, Zheqing Zhu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的深度研究代理设计,通过改进奖励机制、训练算法、样本过滤和测试策略,实现了在多个基准测试中的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05165 2026-02-24 cs.LG cs.AI cs.CL 75%

EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization

EBPO:经验贝叶斯收缩用于稳定群体相对策略优化

Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang

机构 * Meta AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EBPO通过经验贝叶斯收缩方法稳定群体相对策略优化,有效降低估计方差并提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19416 2026-02-24 cs.AI cs.LG 73%

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法

Mohammad Beigi, Ming Jin, Junshan Zhang, Jiaxin Zhang, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) Salesforce(Salesforce公司) Meta AI

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 67%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20140 2026-02-24 physics.chem-ph 50%

PackFlow: Generative Molecular Crystal Structure Prediction via Reinforcement Learning Alignment

PackFlow:通过强化学习对齐进行生成分子晶体结构预测

Akshay Subramanian, Elton Pan, Juno Nam, Maurice Weiler, Shuhui Qu, Cheol Woo Park, Tommi S. Jaakkola, Elsa Olivetti, Rafael Gomez-Bombarelli

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 PackFlow通过强化学习对齐生成分子晶体结构,提高预测准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 50%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18799 2026-02-24 cs.CV 50%

Rethinking Preference Alignment for Diffusion Models with Classifier-Free Guidance

重新思考扩散模型的偏好对齐:基于分类器自由引导

Zhou Jiang, Yandong Wen, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于分类器自由引导的方法,通过分解偏好学习为两个模块并生成对比引导向量,提升扩散模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏