MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
机构 * Future Lab, Alibaba Group(阿里巴巴集团未来实验室)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Future Lab, Alibaba Group(阿里巴巴集团未来实验室)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL
机构 * National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);trustworthy(abstract);分类 cs.CL
Comments Work in Progress
机构 * Ant Group(蚂蚁集团)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);trustworthy(abstract);分类 cs.AI
超越浅层安全的推理时脆弱性:沿生成轨迹的对齐
机构 * Hankuk University of Foreign Studies(翰江大学外国语大学) ; Seoul National University(首尔国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文揭示安全对齐的大语言模型在推理时存在更广泛的脆弱性,即任意生成步骤的短标记注入都能显著改变后续安全行为,并提出通过直接在生成轨迹上对齐模型来提升鲁棒性。
AgentDoG 1.5:一种轻量级且可扩展的AI智能体安全与安保对齐框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对开放世界智能体的新兴安全风险,提出一种轻量级可扩展的安全对齐框架,通过更新安全分类法、构建数据引擎并训练小模型(0.8B-8B参数),实现与闭源模型相当的性能,并降低部署开销两个数量级。
Comments 44 pages, 12 Figures, 9 Tables
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)
Comments Accepted by EMNLP2025 Finding
机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Under Review
机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * ETH Zurich(苏黎世联邦理工学院) ; Princeton University(普林斯顿大学)
专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in Transactions on Machine Learning Research (TMLR); Best technical paper at Neurips 2024 SoLaR workshop
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2024
机构 * Wenbo Pan(温波 Pan) ; Zhichao Liu(刘志超 Liu) ; Qiguang Chen(陈启广 Chen) ; Xiangyang Zhou(周祥阳 Zhou) ; Haining Yu(于航 Yu) ; Xiaohua Jia(贾小华 Jia)
专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.CL、cs.AI
Comments Code and artifacts: https://github.com/BMPixel/safety-residual-space Accepted by ICML 2025
SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性
专题命中 安全训练 :safety(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)
AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。
Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap
通过验证内部化安全理解以提升大推理模型
机构 * National University of Singapore(国立新加坡大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :safety(title,summary_cn);alignment(abstract);分类 cs.AI
AI总结 本文提出Safety Internal框架,通过训练模型在安全验证任务中自我批判生成答案,提升模型对自身输出安全性的判断能力,增强对抗性突破的鲁棒性。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
Comments Proceedings from the Columbia Convening on Openness in Artificial Intelligence and AI Safety
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);red teaming(abstract)
Comments NAACL 2024
SafeSteer: 局部化在策略蒸馏用于高效安全对齐
机构 * Beihang University(北航) ; Beijing Institute of Technology(北京理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。
Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference
工具可及性对LLM代理安全对齐的因果影响
机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) ; Harvard Medical School(哈佛医学院) ; Clark University(克拉克大学) ; Harvard University(哈佛大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。
AI安全训练数据集中的语言特定缺口
专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG
AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。
SafeMERGE: 通过选择性层间模型融合在微调大语言模型中保持安全对齐
机构 * Technical University Munich(慕尼黑技术大学) ; IBM Research(IBM研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SafeMERGE,一种轻量级后微调框架,通过选择性融合层间模型来恢复安全对齐,同时保持下游性能,减少有害输出并提升实用性。
Journal ref Findings of the ACL 2026
SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐
机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。
Comments Accepted by SIGKDD 2026
通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡
机构 * Ritzz-AI
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。
Comments ICML 2026 Poster
超越安全数据:具有正则安全反射的预训练阶段对齐
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。
少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.LG
AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。
Comments Accepted to KDD 2026
SafeGene: 可重用的适配器实现可迁移的安全对齐
机构 * Southeast University(东南大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出SafeGene,一种可重用的安全适配器模块,通过从对齐-退化模型差异中提取安全表示,并利用数据感知层选择和少样本系数重校准,实现跨任务的安全恢复,在保持下游性能的同时降低有害响应率。
量化地理文化价值对多元安全对齐的显著性
机构 * University of Oxford(牛津大学) ; University of Cambridge(剑桥大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CY、cs.LG
AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。
Comments 119 pages, 13 figures. ICML 2026 camera ready
安全变换器:一种可解释和可控的对齐显式安全位
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 Safe Transformer通过在模型中插入显式安全位,实现安全行为的可解释和可控,通过对比训练解耦表示,提升安全性和生成能力。
对齐崩溃的几何学:当微调破坏安全性
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 研究揭示了微调过程中对齐脆弱性是梯度下降在曲面上的固有几何属性,提出四次方定律描述对齐损失随训练时间的增长,并呼吁发展曲率感知方法以提升安全性。
Comments 27 pages, 4 figures
A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型
机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) ; Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 A2D通过令牌级对齐方法,在扩散语言模型中实现任意顺序和步长攻击的鲁棒防御,显著降低有害输出生成概率并提升安全终止效率。
Comments Accepted at ICLR 2026. Code and models are available at https://ai-isl.github.io/A2D
通过单个神经元的模型自反进行轻量级对齐以提升大语言模型的安全性
机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; Ant Group Co., Ltd.(蚂蚁集团有限公司) ; BrainCog Lab., CASIA(CASIA脑认知实验室) ; Zhongguancun Academy(中关村学院)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 通过单个神经元的模型自反实现轻量级对齐,提升大语言模型的安全性和实用性
Comments 21 pages, 3 figures
通过安全规则的自教推理提升安全性
机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 安全训练 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。
Comments 19 pages,4 figures