arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2608.20374 2026-08-24 cs.CL cs.AI cs.LG 新提交 90%

VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models

VA-DPO:用于语言模型可控情感生成的效价-唤醒直接偏好优化

Hyunwoo Kim

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有情感生成无法表达细粒度情感的问题,提出VA-DPO方法,通过效价-唤醒连续目标优化LoRA适配器,在多模型上实现细粒度情感生成且不损害通用性能。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20512 2026-08-24 cs.CY 新提交 79%

From Urban Mobility to Epidemic Dynamics: A Mixture-of-Experts Framework with Preference Alignment for Policy Scenario Simulation

从城市流动性到流行病动力学:用于政策情景模拟的带偏好对齐的混合专家框架

Yun Ye, Arsalan Dezhkam, Junyuan Liu, Xinglei Wang, Tao Cheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CY

AI总结 该研究提出带偏好对齐的混合专家框架UrbanShare-MoE-PA,通过智能体级流动性建模连接政策、行为与流行病模拟,评估了不同封锁政策的流行病-活动权衡,为NPI情景分析提供了可解释工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17378 2026-08-24 cs.LG cs.AI 版本更新 73%

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09487 2026-08-24 cs.CL 版本更新 57%

SlidesGen-Bench: Evaluating Slides Generation via Computational and Quantitative Metrics

SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成

Yunqiao Yang, Wenbo Li, Houxing Ren, Zimu Lu, Ke Wang, Zhiyuan Huang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。

Comments 37 pages, 34 figures, EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏