arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-26 至 2026-01-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2601.16403 2026-01-26 cs.LG 79%

Towards a Theoretical Understanding to the Generalization of RLHF

迈向RLHF泛化性的理论理解

Zhaochun Li, Mingyang Yi, Yue Wang, Shisheng Cui, Yong Liu

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16483 2026-01-26 eess.AS 67%

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

FlowSE-GRPO:通过在线强化学习训练流匹配语音增强

Haoxu Wang, Biao Tian, Yiheng Jiang, Zexu Pan, Shengkui Zhao, Bin Ma, Daren Chen, Xiangang Li

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 本文提出FlowSE-GRPO,通过在线强化学习优化语音增强,平衡多指标以提升音频质量与任务性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16276 2026-01-26 cs.CL cs.AI cs.GT cs.LG cs.MA 67%

GameTalk: Training LLMs for Strategic Conversation

GameTalk: 训练 LLMs 进行战略性对话

Victor Conchello Vendrell, Max Ruiz Luyten, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GameTalk 通过多轮互动训练 LLMs 实现战略性决策,优于传统方法,尤其在奖励塑造下表现突出。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏