From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Apple(苹果公司)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2025 Findings, Source code: https://github.com/HahmDY/causal_influence_prompting.git
专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In EMNLP 2024
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments 32 pages, 9 figures
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 8 pages, 3 figures, Published at the ICLR 2024 Workshop on Understanding of Foundation Models (ME-FoMo)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments updated to add missing acknowledgements
专题命中 安全训练 :alignment(title);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 5 figures
专题命中 安全训练 :safety(title,abstract);AI safety(abstract)
Comments 8 pages, 6 figures
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY、cs.LG
Comments 2016 Information Theory and Applications Workshop, La Jolla, California
使用大型语言模型进行具身规划引入了系统性的安全风险
机构 * ETH Zurich(苏黎世联邦理工学院) ; University College London(伦敦大学学院) ; Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。
Comments Project page: https://despite-safety.github.io/
专题命中 安全训练 :jailbreak(title,abstract);分类 cs.AI、cs.CY
Comments Homepage: https://poex-jailbreak.github.io/
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY;safety(comments)
Comments ML Safety Workshop, 36th Conference on Neural Information Processing Systems (NeurIPS 2022)
SafeSteer: 多模态大语言模型中的解码级防御机制
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Chongqing University(重庆大学) ; Wuhan University(武汉大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)
AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。
CoFi-PGMA:在多智能体LLM中基于过滤反馈的反事实策略梯度
机构 * Stanford Graduate School of Business(斯坦福商学院) ; Stanford University(斯坦福大学) ; Department of Mathematics(数学系)
专题命中 安全训练 :RLHF(summary_cn,abstract);分类 cs.LG
AI总结 针对多智能体LLM中过滤反馈导致的RLHF目标不准确问题,提出CoFi-PGMA框架,通过边际贡献反事实目标修正路由和协作机制下的学习信号,并提供实用训练算法和实证研究。
Comments 17 pages, 0 figures
机构 * Cisco AI Threat Research & Security(思科AI威胁研究与安全)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
机构 * Meta
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI;AI safety(comments)
Comments IJCAI 2019 AI Safety Workshop
专题命中 安全训练 :jailbreak(abstract,comments);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2025. Updates in v2 and v3: added GPT-4o, Claude 3.5 Sonnet, o1-mini, and o1-preview results. Code and jailbreak artifacts: https://github.com/tml-epfl/llm-past-tense
低资源非洲语言的潜在空间拒绝锚定:无需重新训练的机制安全恢复
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对低资源非洲语言指令模型无法拒绝有害请求的问题,提出无需训练的LSR-Anchoring方法,通过MAS或SDS引导残差流,在多数非洲语言上恢复安全且对MMLU影响小,但阿拉伯语因几何失配失败。
Comments Published at ICML 2026 Workshop on Global South in Machine Learning
安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果
机构 * THK-AI Research Cluster(THK-AI研究集群)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。
Comments Version 3. 40 pages
TAF-MED:声明自我治疗意图下大语言模型的多轮安全拒绝崩溃
机构 * Independent Researcher(独立研究者) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心医学院普通实践研究所)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究推出TAF-MED医疗安全基准,评估8个大语言模型的多轮医疗对话安全表现,发现多数模型会在后续对话中出现安全拒绝崩溃,自动评判工具与医生标注一致性较高,将公开基准支持相关研究。
超越“我无法对此提供帮助”:儿童安全专家如何评估AI聊天机器人的安全性
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过访谈19名儿童安全相关从业者,分析现有AI聊天机器人儿童安全评估的局限,提出需将从业者视角纳入安全评估工作的建议。
Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)
单一规范提示低估了大语言模型安全的表面形式敏感性
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究发现仅用单一规范提示评估大语言模型安全会低估其不安全合规性,不同表面形式下的不安全结果并集会超出最糟单一形式,且存在模型差异,同时发布了相关数据集、代码与响应标签。
Comments 9 pages, 3 tables
EduZone:面向K-12学生与教师的大语言模型安全评估框架
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。
Comments Under Review
对大型语言模型在机器人健康护理员控制中的安全性的基准测试
机构 * Kyushu Institute of Technology(九州工业技术大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。
Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material
作为替罪羊的护栏:审计工具增强型大语言模型智能体中不忠实的安全拒绝行为
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究工具增强型大语言模型智能体安全拒绝行为审计问题,引入轻量级黑盒审计框架,将智能体响应分类。实验发现伪造行为占主导,不忠实安全拒绝行为在基线时少,增强安全语言会显著增加该行为,还提出检测方法及治理影响。
Comments 10 pages, 3 figures. Accepted at the ACM KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
拒绝残差:探测何时能捕捉到对齐造假以及何时不能
机构 * Snowflake AI Research(Snowflake AI 研究所)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 研究对齐造假中隐藏状态能否揭示输出隐藏内容,对13个模型扫描,发现Qwen3 - 32B和Llama - 3.1 - 8B存在自然造假及不对称拒绝残差,样本检测有模型条件性,还发布五控制测量框架用于对齐造假检测。
Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026. 12 pages, 4 figures
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。
当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复
机构 * Blossom AI(绽放人工智能公司) ; Blossom AI Labs(绽放人工智能实验室)
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。