arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2308.02594 2026-02-06 cs.LG cs.AI cs.SE 81%

SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents

SMARLA:一种用于深度强化学习智能体的安全监控方法

Amirhossein Zolfagharian, Manel Abdellatif, Lionel C. Briand, Ramesh S

机构 * School of Electrical Engineering and Computer Science (EECS), University of Ottawa(电气工程与计算机科学系,渥太华大学) Software and Information Technology Engineering Department, École de Technologie Supérieure(软件与信息技术工程系,高等技术学院) Lero SFI Research Center and University of Limerick(Lero SFI研究中心和利默里克大学) Department of Research and Development, General Motors(研发部,通用汽车)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SMARLA是一种用于深度强化学习智能体的安全监控方法,通过状态抽象和Q值预测安全违规,实现早期检测与低假阳性率的平衡。

Journal ref in IEEE Transactions on Software Engineering, vol. 51, no. 01, pp. 82-105, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10520 2026-02-03 cs.AI cs.CY 81%

Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment

与规范性单一体制代理告别:GRACE:一种基于原因的神经符号架构,用于安全和道德的人工智能对齐

Felix Jahn, Yannic Muskalla, Lisa Dargasz, Patrick Schramowski, Kevin Baum

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Center for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心) Saarland Informatics Campus(萨尔州信息学校区) Computer Science Department, TU Darmstadt(图宾根大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 GRACE是一种基于原因的神经符号架构,用于安全和道德的人工智能对齐,通过分离规范性推理与工具性决策,确保AI代理的行为符合道德规范。

Comments 10 pages, 4 figures, accepted at 2nd Annual Conference of the International Association for Safe & Ethical AI (IASEAI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01037 2025-12-22 cs.CL cs.AI 81%

When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals

当安全阻止感知:测量大语言模型拒绝中的语义混淆

Riad Ahmed Anonto, Md Labid Al Nahiyan, Md Tanvir Hassan

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义混淆的概念及测量框架,通过ParaGuard语料库和三种模型无关指标,揭示大语言模型拒绝中的局部不一致问题,帮助开发者优化安全与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16279 2025-12-19 cs.AI cs.CL 81%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26935 2025-11-03 cs.RO cs.AI cs.CL cs.FL 81%

RepV: Safety-Separable Latent Spaces for Scalable Neurosymbolic Plan Verification

Yunhao Yang, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Zhanyang Wang, Ufuk Topcu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Code and data are available at: https://repv-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13139 2025-10-29 cs.CY cs.CE cs.CL cs.MA 81%

Addressing the alignment problem in transportation policy making: an LLM approach

Xiaoyu Yan, Tianxing Dai, Yu Marco Nie

机构 * Department of Civil and Environmental Engineering, Northwestern University(土木与环境工程系,西北大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00971 2025-10-28 cs.LG cs.AI 81%

Reasoning as an Adaptive Defense for Safety

Taeyoun Kim, Fahim Tajwar, Aditi Raghunathan, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 44 pages, 10 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16258 2025-10-27 cs.RO cs.AI cs.LG 81%

MEReQ: Max-Ent Residual-Q Inverse RL for Sample-Efficient Alignment from Intervention

Yuxin Chen, Chen Tang, Jianglan Wei, Chenran Li, Ran Tian, Xiang Zhang, Wei Zhan, Peter Stone, Masayoshi Tomizuka

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12083 2025-10-15 cs.CL cs.AI 81%

An AI-Based Behavioral Health Safety Filter and Dataset for Identifying Mental Health Crises in Text-Based Conversations

Benjamin W. Nelson, Celeste Wong, Matthew T. Silvestrini, Sooyoon Shin, Alanna Robinson, Jessica Lee, Eric Yang, John Torous, Andrew Trister

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Main Text: 2943; Abstract: 256; Tables and Figures: 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02768 2025-10-06 cs.LG cs.CL 81%

A Granular Study of Safety Pretraining under Model Abliteration

Shashank Agnihotri, Jonas Jakubassa, Priyam Dey, Sachin Goyal, Bernt Schiele, Venkatesh Babu Radhakrishnan, Margret Keuper

机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) Vision and AI Lab, Indian Institute of Science(印度科学院视觉与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

Comments Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01520 2025-10-03 cs.LG cs.AI 81%

Predictive Modeling and Explainable AI for Veterinary Safety Profiles, Residue Assessment, and Health Outcomes Using Real-World Data and Physicochemical Properties

Hossein Sholehrasa, Xuan Xu, Doina Caragea, Jim E. Riviere, Majid Jaberi-Douraki

机构 * DATA Consortium and FARAD Program, Kansas State University, Olathe, KS, USA(1DATA Consortium和FARAD计划,堪萨斯州立大学) Department of Computer Science, Kansas State University, Manhattan, KS, USA(计算机科学系,堪萨斯州立大学) Department of Statistics, Kansas State University, Manhattan, KS, USA(统计学系,堪萨斯州立大学) Department of Mathematics, Kansas State University, Olathe, KS, USA(数学系,堪萨斯州立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20016 2025-09-22 cs.AI cs.LG 81%

Dynamic Policy Fusion for User Alignment Without Re-Interaction

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * A2I2 Deakin University(德肯大学) School of IT(信息学院)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21201 2025-09-01 cs.CL cs.AI 81%

Improving Aviation Safety Analysis: Automated HFACS Classification Using Reinforcement Learning with Group Relative Policy Optimization

Arash Ahmadi, Sarah Sharif, Yaser Banad

机构 * School of Electrical, and Computer Engineering, University of Oklahoma(电气与计算机工程学院,俄克拉荷马大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12531 2025-08-19 cs.LG cs.AI 81%

Rethinking Safety in LLM Fine-tuning: An Optimization Perspective

Minseon Kim, Jin Myung Kwak, Lama Alssum, Bernard Ghanem, Philip Torr, David Krueger, Fazl Barez, Adel Bibi

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院) KAUST(韩国科学技术大学) Université de Montréal(蒙特利尔大学) Mila(蒙特利尔人工智能研究院) WhiteBox(WhiteBox公司) University of Oxford(牛津大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14850 2025-08-19 cs.LG cs.AI cs.RO 81%

Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems

H. M. Sabbir Ahmad, Ehsan Sabouni, Alexander Wasilkoff, Param Budhraja, Zijian Guo, Songyuan Zhang, Chuchu Fan, Christos Cassandras, Wenchao Li

机构 * Boston University(波士顿大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05360 2025-08-08 cs.CY cs.AI 81%

Building Effective Safety Guardrails in AI Education Tools

Hannah-Beth Clark, Laura Benton, Emma Searle, Margaux Dowland, Matthew Gregory, Will Gayne, John Roberts

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

Comments 9 pages, published in proceedings of International Conference on Artificial Intelligence in Education (AIED) 2025: Posters and Late Breaking Results, Workshops and Tutorials, Industry and Innovation Tracks, Practitioners, Doctoral Consortium, Blue Sky, and WideAIED

Journal ref Communications in Computer and Information Science (2025) vol 2590, pp. 129-136

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04010 2025-08-07 cs.CL cs.AI 81%

HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization

Yurun Chen, Xavier Hu, Yuhan Liu, Keting Yin, Juncheng Li, Zhuosheng Zhang, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17275 2025-07-29 eess.SY cs.AI cs.LG cs.SY 81%

Conformal Safety Shielding for Imperfect-Perception Agents

William Scarbro, Calum Imrie, Sinem Getir Yaman, Kavan Fatehi, Corina S. Pasareanu, Radu Calinescu, Ravi Mangal

机构 * Colorado State University, USA(科罗拉多州立大学) University of York, UK(约克大学) Carnegie Mellon University, USA(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 32 pages; Equal contribution by W. Scarbro and C. Imrie; Accepted at 25th International Conference on Runtime Verification, 2025 (RV25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11544 2025-07-17 cs.CY cs.LG 81%

The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models

Ann-Kathrin Dombrowski, Dillon Bowen, Adam Gleave, Chris Cundy

专题命中 安全训练 :safety(title,abstract);分类 cs.CY、cs.LG

Comments 9 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08848 2025-07-15 cs.LG cs.AI cs.RO cs.SE 81%

Assuring the Safety of Reinforcement Learning Components: AMLAS-RL

Calum Corrie Imrie, Ioannis Stefanakos, Sepeedeh Shahbeigi, Richard Hawkins, Simon Burton

机构 * Department of Computer Science, University of York(约克大学计算机科学系)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02505 2025-07-10 cs.AI cs.CV cs.LG cs.RO 81%

ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment

Shaofei Cai, Zhancun Mu, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Team CraftJarvis(CraftJarvis团队)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08399 2025-06-12 cs.AI cs.LG 81%

SafeCoT: Improving VLM Safety with Minimal Reasoning

Jiachen Ma, Zhanhui Zhou, Chao Yang, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08243 2025-06-05 cs.CL cs.CY 81%

Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset

Khaoula Chehbouni, Jonathan Colaço Carr, Yash More, Jackie CK Cheung, Golnoosh Farnadi

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.CY

Comments NAACL Main Conference 2025 - Accepted as an Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11184 2025-06-04 cs.CL cs.AI cs.CV cs.MM 81%

Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs

Wenxuan Wang, Xiaoyuan Liu, Kuiyi Gao, Jen-tse Huang, Youliang Yuan, Pinjia He, Shuai Wang, Zhaopeng Tu

机构 * Renmin University of China(中国人民大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰霍普金斯大学) Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24445 2025-06-02 cs.LG cs.AI 81%

Learning Safety Constraints for Large Language Models

Xin Chen, Yarden As, Andreas Krause

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18289 2025-05-29 cs.LG cs.AI cs.SY eess.SY 81%

Criticality and Safety Margins for Reinforcement Learning

Alexander Grushin, Walt Woods, Alvaro Velasquez, Simon Khan

机构 * Galois, Inc.(Galois公司) University of Colorado Boulder(科罗拉多大学波德摩尔分校) Air Force Research Laboratory(空军研究实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20087 2025-05-27 cs.AI cs.CL 81%

Safety Through Reasoning: An Empirical Study of Reasoning Guardrail Models

Makesh Narsimhan Sreedhar, Traian Rebedea, Christopher Parisien

机构 * NVIDIA Santa Clara, CA(NVIDIA圣克拉拉分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09121 2025-05-26 cs.CL cs.AI 81%

Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training

Youliang Yuan, Wenxiang Jiao, Wenxuan Wang, Jen-tse Huang, Jiahao Xu, Tian Liang, Pinjia He, Zhaopeng Tu

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03040 2025-04-07 cs.LG cs.AI 81%

Safety Modulation: Enhancing Safety in Reinforcement Learning through Cost-Modulated Rewards

Hanping Zhang, Yuhong Guo

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12127 2025-03-18 cs.CV cs.AI cs.CL cs.MM 81%

Hyperbolic Safety-Aware Vision-Language Models

Tobia Poppi, Tejaswi Kasarla, Pascal Mettes, Lorenzo Baraldi, Rita Cucchiara

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏