Safety-Aware Multi-Agent Apprenticeship Learning
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
Comments 58 pages, 4 figures. Master's report. arXiv admin note: text overlap with arXiv:1710.07983 by other authors
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
Comments 58 pages, 4 figures. Master's report. arXiv admin note: text overlap with arXiv:1710.07983 by other authors
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
Comments Accepted by SafeComp2020
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
Comments 13 pages, 5 figures
机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ; ETRI(电子技术研究院) ; KAIST(韩国科学技术院)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI;trustworthy(comments)
Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track
专题命中 安全训练 :alignment(title,abstract);分类 cs.LG
Comments To appear in RSS 2022. Here's our project page: https://invariance-through-latent-alignment.github.io
当思维链更清楚时:多轮推理模型的失败模式
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CoT-Output 2x2安全矩阵诊断多轮推理模型隐藏的时间动态失败,发现监督悖论和上下文注入失败两种可复现漏洞。
Comments Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN)
SecureBreak -- 一个面向安全和安全模型的数据集
机构 * Department of Electrical, Computer ; Biomedical Engineering, University of Pavia, Italy\ .
专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。
通过推理时间激活能量缓解对齐大语言模型中的过度拒绝
机构 * UCLA(加州大学洛杉矶分校) ; Alibaba Cloud Computing(阿里云计算) ; SJTU(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; NTU(国立科技大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。
PluriHarms:对AI危害全谱人类判断的基准测试
机构 * UC Berkeley(伯克利大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute for AI(人工智能研究院) ; New York University(纽约大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 PluriHarms通过系统研究人类对AI危害的判断,旨在推动更安全的AI发展。
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; Adobe Research(Adobe 研究院) ; Capital One(Capital One 公司)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.CY、cs.LG
专题命中 安全训练 :safety(abstract);jailbreak(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 pages
在 Meta 保障部署安全:面向持续变更安全的健康检查
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 Meta 介绍其用于平衡持续部署速度与可靠性的 Service Health Checker 健康检查基础设施,阐述其架构、集成方式、解决的运营问题及未来 AI 辅助调优方向。
Comments 6 pages, 4 figures, Accepted to ISSRE 2026 Industry Track
基于DMD的提示-响应嵌入动态分类实现大语言模型安全
机构 * University of Tennessee(田纳西大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本文将幻觉检测的动力系统框架扩展到LLM安全分类,通过拟合安全与不安全状态的Koopman模型,利用差分残差评分分类不安全输出,在多基准测试中验证了纳入提示嵌入的改进效果。
通过ADRC拉格朗日方法增强强化学习的安全性
机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(人工智能方向,香港科技大学(广州)) ; School of Artificial Intelligence, Peking University, Beijing, China(人工智能学院,北京大学,北京,中国) ; Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 本文提出ADRC-拉格朗日方法,通过主动扰动抵消控制提升强化学习的安全性,实验显示在复杂环境中显著减少安全违规和成本
Journal ref Transactions on Machine Learning Research, 2026
CUBICS:面向安全相关机器学习组件的情境感知性能估计
机构 * Fraunhofer Institute for Cognitive Systems IKS(弗劳恩霍夫认知系统研究所IKS) ; Technical University of Munich(慕尼黑工业大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本文提出CUBICS框架,将运行设计域划分为情境,用主观逻辑以贝叶斯方式建模安全相关ML组件的情境特定保证,结合情境频率信念得出组件风险估计,为模块化安全保证提供基础。
Comments To be published in the proceedings for the 37th International Symposium on Software Reliability Engineering (ISSRE 2026)
拒绝意图,而非形式:基于包装器的意图组监督用于大语言模型安全
机构 * Ant Group(蚂蚁集团)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL
AI总结 该研究针对大语言模型安全调优的表面形式捷径问题,提出WIFA方法,结合两种微调路径提升有害内容拒绝能力并降低良性提示过度拒绝率,在Qwen和Llama上验证了效果。
Comments 23 pages, 11 figures, 24 tables
安全关键环境中的时间序列预测:符合EU-AI-Act的开源包
机构 * Bartz & Bartz GmbH(巴茨与巴茨公司)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本文提出一个符合EU-AI-Act的设计方法,通过库内集成点预测方法,确保安全关键环境中的合规性,包含代码开发规则和过程规则,排除了可视化和AutoML等可能引入风险的功能。
Comments Version 3. Working paper. Bilingual twin paper: English version first, German original below (100 pages total). Single shared bibliography
协调安全与速度:一种人机方法以增强FDA的医疗器械审批政策
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 本文提出一种人机协同方法,通过数据驱动的审批政策降低医疗器械召回风险并减少监管工作量,提升FDA 510(k)审批流程的安全性和效率。
Comments Accepted for publication in Management Science
提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。
面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习
机构 * Edge Hill University(埃奇希尔大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。
Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026
通过神经符号安全护卫实现端到端自动驾驶的引导
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。
面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。
社交压力会破坏大语言模型安全评审团的多数投票机制
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Amazon(亚马逊)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL
AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。
黑盒多轮交互中轨迹级安全风险预测
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 本文提出 Recast 框架,通过双尺度轨迹视图建模风险演变,可提前2.41轮预测88.3%的安全故障,误报率12.3%,实现轨迹级安全风险预测。
模型是否会在没有明确后果的情况下假装对齐?
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI
AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。
Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables
作为非平稳强化学习安全约束的调整速度
机构 * McMaster University(麦克马斯特大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。
Comments 15 pages, 5 figures, 2 tables. Preprint
SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏
机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) ; Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; AI Security Lab, Beijing, China(360人工智能安全实验室)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。
Comments Accepted by ICML 2026