arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2510.05526 2025-12-10 cs.LG cs.AI 89%

Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment

可证明地同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余

Ziyi Chen, Junyi Li, Peiran Yu, Heng Huang

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RLHF-COV和DPO-COV算法,同时缓解离线和在线RLHF/DPO对齐中的腐败、过度优化和冗余问题,并通过理论证明和实验验证其有效性。

Comments Edited a few incorrect numbers in Tables 2 and 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08153 2025-12-10 cs.LG cs.AI cs.CV 81%

TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models

TreeGRPO:基于树优势的在线强化学习后训练扩散模型

Zheng Ding, Weirui Ye

机构 * UC San Diego(圣迭戈大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 TreeGRPO通过树结构提升扩散模型后训练效率,实现2.4倍加速并优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17923 2025-12-10 cs.LG cs.AI 73%

Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning

奖励旅程,而非仅终点:一种复合路径和答案自评分奖励机制用于测试时强化学习

Jingyu Xing, Chenwei Tang, Xinyu Liu, Deng Xiong, Shudong Huang, Wei Ju, Jiancheng Lv, Ziyue Qiao

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Great Bay University(大湾大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 COMPASS通过自评分机制提升测试时强化学习的推理能力,增强模型分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08449 2025-12-10 cs.AI 57%

From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change

从准确度到影响:用于对齐工程架构与影响理论的影响力驱动AI框架(IDAIF)

Yong-Woon Kim

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 IDAIF通过整合影响理论与AI架构,提供了一种以影响为中心的AI开发框架,旨在提升AI系统的伦理性和社会价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08129 2025-12-10 cs.LG 57%

Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization

通过类别子空间正交化提高后门检测器的灵敏度

Guangmingmei Yang, David J. Miller, George Kesidis

机构 * School of EECS, Penn State(EECS学院,宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司) University Park, PA, USA(宾夕法尼亚州大学公园分校) State College, PA, USA(宾夕法尼亚州州立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出通过抑制类别内在特征并正交化以提高后门检测器灵敏度,针对混合标签和自适应攻击进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏