arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-02 至 2025-12-02 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2512.01247 2025-12-02 cs.CR cs.CY cs.HC 79%

Benchmarking and Understanding Safety Risks in AI Character Platforms

在AI人物平台中进行基准测试与安全风险理解

Yiluo Wei, Peixian Zhang, Gareth Tyson

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 该研究首次对AI人物平台进行大规模安全评估,发现其平均不安全响应率高达65.1%,并提出基于机器学习模型的预测方法以提升平台安全性和交互质量。

Comments Accepted to NDSS '26: The Network and Distributed System Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01848 2025-12-02 cs.CL 70%

Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability

超越SFT:通过强化学习构建更安全且推理能力更强的大推理模型

Jinghan Jia, Nathalie Baracaldo, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出通过强化学习提升大推理模型的安全性和推理能力,克服了传统监督微调的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 70%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06981 2025-12-02 cs.AI cs.LG 62%

Deep RL Needs Deep Behavior Analysis: Exploring Implicit Planning by Model-Free Agents in Open-Ended Environments

深度强化学习需要深度行为分析:通过无模型智能体在开放性环境中探索隐式规划

Riley Simmons-Edler, Ryan P. Badman, Felix Baastad Berg, Raymond Chua, John J. Vastola, Joshua Lunger, William Qian, Kanaka Rajan

机构 * Department of Neurobiology, Harvard Medical School(哈佛医学院神经生物学系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Department of Mathematics, NTNU(NTNU数学系) School of Computer Science, McGill University & Mila(麦吉尔大学计算机科学学院及Mila) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Biophysics Graduate Program, Harvard University(哈佛大学生物物理学研究生项目)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过ForageWorld环境研究DRL智能体的行为,发现无模型智能体可通过涌现动态展现规划行为,提出通用分析框架用于研究复杂智能体的学习动态。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20804 2025-12-02 cs.CR cs.AI cs.LG 62%

AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models

AED: 利用大语言模型自动发现自主驾驶策略的有效且多样的漏洞

Le Qiu, Zelai Xu, Qixin Tan, Wenhao Tang, Chao Yu, Yu Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 AED 利用大语言模型自动发现自动驾驶策略的有效且多样的漏洞,提升漏洞发现的多样性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00611 2025-12-02 cs.CL 57%

Prism: A Minimal Compositional Metalanguage for Specifying Agent Behavior

Prism:一种最小的组合金属言用于指定代理行为

Franck Binard, Vanja Kljajevic

机构 * Deloitte AI(德勤人工智能) University of Oslo(奥斯陆大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Prism通过组合性金属言为代理行为提供最小化规格,结合领域特定词汇与工具,实现可检查和可执行的策略定义。

详情

展开后加载摘要…

URL PDF HTML 收藏