Episodic Learning for Safe Bipedal Locomotion with Control Barrier Functions and Projection-to-State Safety
专题命中 安全训练 :safety(title,abstract)
Comments 13 pages, 4 figures, to appear at the Conference on Learning for Dynamics and Control 2021
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract)
Comments 13 pages, 4 figures, to appear at the Conference on Learning for Dynamics and Control 2021
专题命中 安全训练 :safety(title,abstract)
Comments Approved for publication as a chapter in 'Robotics Roadmap for Australia V2' by Robotics Australia Network [forthcoming]. 31 pages, 10 Figures, 1 table
专题命中 安全训练 :safety(title,abstract)
Comments 20 pages, 10 figures
专题命中 安全训练 :safety(title,abstract)
专题命中 安全训练 :safety(title,abstract)
专题命中 安全训练 :alignment(title,abstract)
Comments 34 pp
专题命中 安全训练 :safety(title,abstract)
Comments Accepted by 39th International Conference On Computer Aided Design(ICCAD 2020)
专题命中 安全训练 :safety(title,abstract)
Comments 27 pages and 19 figures
专题命中 安全训练 :safety(title,abstract)
Journal ref 2018 21st International Conference on Intelligent Transportation Systems (ITSC)
专题命中 安全训练 :alignment(title,abstract)
专题命中 安全训练 :safety(title,abstract)
Comments Published in the Proceedings from the 9th International Symposium of NASA Formal Methods, 2017
Journal ref In: Barrett C., Davies M., Kahsai T. (eds) NASA Formal Methods. NFM 2017. Lecture Notes in Computer Science, vol 10227. Springer, Cham
专题命中 安全训练 :safety(title,abstract)
Comments 8 pages version of 2016ACC conference paper, experimental results added
Journal ref American Control Conference (ACC), pages 5213-5218, July 2016
通过安全表示理解并缓解大语言模型的过度拒绝
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL
AI总结 本文提出MOSR方法,通过干预大语言模型的安全表示来缓解过度拒绝问题,同时保持安全性。
Comments Added experiments
FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器
专题命中 安全训练 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL
AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。
大语言模型分别编码有害性和拒绝性
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL
AI总结 研究大语言模型对有害性的理解,发现其有害性和拒绝性在模型内分别编码,有害性方向与拒绝方向不同,据此揭示越狱方法原理及对抗微调影响,提出潜在危害表示的安全应用。
学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型
机构 * Microsoft Research(微软研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL
AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
自适应转向与重掩码用于扩散语言模型中的安全生成
机构 * Department of Computer Science(计算机科学系) ; Yonsei University(延世大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。
Comments 17 pages, 3 figures
鲁棒策略优化以防止灾难性遗忘
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
专题命中 安全训练 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG
AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。
从浅层到深层:通过因果GRPO固定语义意图
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。
善良并不总是安全:诊断大语言模型中的情感幻觉
机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)
专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。
Comments EACL 2026 Findings
基于异质反馈的离线安全策略优化
机构 * Shenzhen Institute of Advanced Technology (SIAT), CAS(深圳先进技术研究院(SIAT)、中国科学院) ; Singapore Management University(新加坡管理学院)
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出PreSa方法,通过直接学习基于偏好和安全性的策略,解决离线安全强化学习中的性能下降问题。
Comments Accepted at AAMAS 2026 (Extended Abstract)
机构 * Stony Brook University(石英布鲁克大学) ; Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
机构 * School of Computing, Macquarie University, Australia(计算机学院,麦考瑞大学,澳大利亚)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL
Comments EMNLP'25 Main
专题命中 安全训练 :alignment(abstract);RLHF(abstract);jailbreak(abstract);分类 cs.AI
Comments published at USENIX Security 25
专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI
Comments NeurIPS 2024 Safe Generative AI Workshop
专题命中 安全训练 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 10/26 (Main Body/Total), 8 figures
专题命中 安全训练 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL
Comments Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables