arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2201.08111 2022-01-25 cs.AI cs.LG 81%

Safety-Aware Multi-Agent Apprenticeship Learning

Junchen Zhao

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 58 pages, 4 figures. Master's report. arXiv admin note: text overlap with arXiv:1710.07983 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05311 2020-12-08 cs.LG cs.AI 81%

A Safety Framework for Critical Systems Utilising Deep Neural Networks

Xingyu Zhao, Alec Banks, James Sharp, Valentin Robu, David Flynn, Michael Fisher, Xiaowei Huang

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by SafeComp2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.02846 2020-10-07 cs.LG cs.AI 81%

Safety Aware Reinforcement Learning (SARL)

Santiago Miret, Somdeb Majumdar, Carroll Wainwright

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09142 2019-09-23 cs.LG cs.AI cs.LO stat.ML 81%

Using Quantifier Elimination to Enhance the Safety Assurance of Deep Neural Networks

Hao Ren, Sai Krishnan Chandrasekar, Anitha Murugesan

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.02526 2019-04-23 cs.LG cs.AI cs.RO 81%

Safety-Guided Deep Reinforcement Learning via Online Gaussian Process Estimation

Jiameng Fan, Wenchao Li

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16856 2025-10-07 cs.CV cs.AI 80%

SIA: Enhancing Safety via Intent Awareness for Vision-Language Models

Youngjin Na, Sangheon Jeong, Youngwan Lee, Jian Lee, Dawoon Jeong, Youngman Kim

机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ETRI(电子技术研究院) KAIST(韩国科学技术院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI;trustworthy(comments)

Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08526 2022-05-18 cs.LG cs.RO 80%

Invariance Through Latent Alignment

Takuma Yoneda, Ge Yang, Matthew R. Walter, Bradly Stadie

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

Comments To appear in RSS 2022. Here's our project page: https://invariance-through-latent-alignment.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10740 2026-06-16 cs.AI cs.CL cs.LG 新提交 80%

When the Chain of Thought Knows Better: Failure Modes in Multi-Turn Reasoning Models

当思维链更清楚时:多轮推理模型的失败模式

Sai Kartheek Reddy Kasu, Nils Lukas, Samuele Poppi

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。

Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21975 2026-03-24 cs.CR cs.AI cs.CL cs.LG 80%

SecureBreak -- A dataset towards safe and secure models

SecureBreak -- 一个面向安全和安全模型的数据集

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ .

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML 80%

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08951 2026-02-04 cs.CY cs.AI cs.CL 80%

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

PluriHarms:对AI危害全谱人类判断的基准测试

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

机构 * UC Berkeley(伯克利大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) New York University(纽约大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PluriHarms通过系统研究人类对AI危害的判断,旨在推动更安全的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13203 2025-08-26 cs.CR cs.AI cs.CL cs.LG cs.MA 80%

X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents

Salman Rahman, Liwei Jiang, James Shiffer, Genglin Liu, Sheriff Issaka, Md Rizwan Parvez, Hamid Palangi, Kai-Wei Chang, Yejin Choi, Saadia Gabriel

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00598 2025-06-12 cs.CL cs.CR cs.CY cs.LG 80%

Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Bang An, Sicheng Zhu, Ruiyi Zhang, Michael-Andrei Panaitescu-Liess, Yuancheng Xu, Furong Huang

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Adobe Research(Adobe 研究院) Capital One(Capital One 公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03303 2024-02-06 cs.CL cs.AI cs.LG 80%

Nevermind: Instruction Override and Moderation in Large Language Models

Edward Kim

专题命中 安全训练 :safety(abstract);jailbreak(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20513 2026-08-24 cs.SE cs.AI 新提交 79%

Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety

在 Meta 保障部署安全:面向持续变更安全的健康检查

Prakash KL, Anton Korenkov, Uttam Thakore, Christopher Hegre

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Meta 介绍其用于平衡持续部署速度与可靠性的 Service Health Checker 健康检查基础设施,阐述其架构、集成方式、解决的运营问题及未来 AI 辅助调优方向。

Comments 6 pages, 4 figures, Accepted to ISSRE 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19579 2026-08-21 cs.AI math.DS 新提交 79%

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

基于DMD的提示-响应嵌入动态分类实现大语言模型安全

Mohamed Akrout, Olivera Kotevska, Dan Wilson

机构 * University of Tennessee(田纳西大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文将幻觉检测的动力系统框架扩展到LLM安全分类,通过拟合安全与不安全状态的Koopman模型,利用差分残差评分分类不安全输出,在多基准测试中验证了纳入提示嵌入的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18142 2026-08-20 cs.LG 79%

Enhance the Safety in Reinforcement Learning by ADRC Lagrangian Methods

通过ADRC拉格朗日方法增强强化学习的安全性

Mingxu Zhang, Huicheng Zhang, Jiaming Ji, Yaodong Yang, Ying Sun

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(人工智能方向,香港科技大学(广州)) School of Artificial Intelligence, Peking University, Beijing, China(人工智能学院,北京大学,北京,中国) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出ADRC-拉格朗日方法,通过主动扰动抵消控制提升强化学习的安全性,实验显示在复杂环境中显著减少安全违规和成本

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16564 2026-08-18 cs.AI 新提交 79%

CUBICS: Situation-aware performance estimation for safety-relevant ML components

CUBICS:面向安全相关机器学习组件的情境感知性能估计

Benjamin Herd, Jessica Kelly, Mario Trapp

机构 * Fraunhofer Institute for Cognitive Systems IKS(弗劳恩霍夫认知系统研究所IKS) Technical University of Munich(慕尼黑工业大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出CUBICS框架,将运行设计域划分为情境,用主观逻辑以贝叶斯方式建模安全相关ML组件的情境特定保证,结合情境频率信念得出组件风险估计,为模块化安全保证提供基础。

Comments To be published in the proceedings for the 37th International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13304 2026-08-14 cs.CL 新提交 79%

Refusing Intent, Not Form: Wrapper-Based Intent-Group Supervision for LLM Safety

拒绝意图,而非形式:基于包装器的意图组监督用于大语言模型安全

Ping Wu, Haibo Tong, Feifei Zhao, Han Shen, Yu Shi, Yilin Zhao, Sicheng Shen, Guobin Shen, Yun Luo, Yi Zeng

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型安全调优的表面形式捷径问题,提出WIFA方法,结合两种微调路径提升有害内容拒绝能力并降低良性提示过度拒绝率,在Qwen和Llama上验证了效果。

Comments 23 pages, 11 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23859 2026-08-14 cs.AI 版本更新 79%

Time-Series Forecasting in Safety-Critical Environments: An Open-Source Package for EU-AI-Act-Compliant Development / Zeitreihenprognose in sicherheitskritischen Umgebungen: Ein Open-Source-Paket für die KI-VO-konforme Entwicklung

安全关键环境中的时间序列预测:符合EU-AI-Act的开源包

Thomas Bartz-Beielstein, Eva Bartz

机构 * Bartz & Bartz GmbH(巴茨与巴茨公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一个符合EU-AI-Act的设计方法,通过库内集成点预测方法,确保安全关键环境中的合规性,包含代码开发规则和过程规则,排除了可视化和AutoML等可能引入风险的功能。

Comments Version 3. Working paper. Bilingual twin paper: English version first, German original below (100 pages total). Single shared bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11823 2026-08-14 cs.LG cs.HC math.OC stat.ML 版本更新 79%

Harmonizing Safety and Speed: A Human-Algorithm Approach to Enhance the FDA's Medical Device Clearance Policy

协调安全与速度:一种人机方法以增强FDA的医疗器械审批政策

Mohammad Zhalechian, Soroush Saghafian, Omar Robles

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种人机协同方法,通过数据驱动的审批政策降低医疗器械召回风险并减少监管工作量,提升FDA 510(k)审批流程的安全性和效率。

Comments Accepted for publication in Management Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 79%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11498 2026-08-13 cs.CV cs.ET cs.LG 新提交 79%

Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

Aditya Humnabadkar, Huaizhong Zhang, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。

Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11451 2026-08-13 cs.RO cs.AI cs.SY eess.SY 新提交 79%

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

通过神经符号安全护卫实现端到端自动驾驶的引导

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 79%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04415 2026-08-06 cs.CL 新提交 79%

Social Pressure Breaks Majority Voting in LLM Safety Panels

社交压力会破坏大语言模型安全评审团的多数投票机制

Yibo Hu, Jiaming Qu

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26820 2026-07-30 cs.LG cs.CR 新提交 79%

Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions

黑盒多轮交互中轨迹级安全风险预测

Shi Lin, Peng Qian, Dinghao Liu, Renjie Sun, Sifan Wu, Dezhang Kong, Chenpei Wang, Xun Wang

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24758 2026-07-30 cs.AI 版本更新 79%

Do Models Fake Alignment Without Clear Consequences?

模型是否会在没有明确后果的情况下假装对齐?

Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。

Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 79%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 79%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏