arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2608.21100 2026-08-24 cs.AI 新提交 89%

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame:多模态大语言模型中基于证据的测试时安全对齐

Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。

Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-08-24 cs.AI cs.CL 版本更新 88%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01913 2026-08-24 cs.LG cs.AI cs.CE cs.CL cs.CR 版本更新 85%

RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

RefusalGuard:面向大语言模型安全的保几何微调方法

Sadia Asif, Mohammad Mohammadi Amiri

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-08-24 cs.AI cs.CR 版本更新 83%

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20513 2026-08-24 cs.SE cs.AI 新提交 79%

Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety

在 Meta 保障部署安全:面向持续变更安全的健康检查

Prakash KL, Anton Korenkov, Uttam Thakore, Christopher Hegre

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Meta 介绍其用于平衡持续部署速度与可靠性的 Service Health Checker 健康检查基础设施,阐述其架构、集成方式、解决的运营问题及未来 AI 辅助调优方向。

Comments 6 pages, 4 figures, Accepted to ISSRE 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20378 2026-08-24 cs.AI 新提交 70%

Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification

真相藏于深处:通过潜在意图验证对抗语义伪装

Md. Hasib Ur Rahman

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对大语言模型安全对齐的表面性问题,该研究提出潜在意图验证(LIV)方法,利用小型语言模型早期层的有害特征,在不重新训练的情况下,将语义伪装攻击的检测性能提升20%-50%。

Comments 5 pages, 3 figures. Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence, and Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-24 cs.CL cs.LG 版本更新 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-08-24 cs.AI 版本更新 57%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Z. Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21069 2026-08-24 cs.SE 新提交 56%

Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation

Spike-Killer:面向真实Windows工作站安全性能诊断的证据门控大语言模型辅助方案

Baocheng Zeng, Jinhao Yang

专题命中 安全训练 :trustworthy(abstract);safety(comments)

AI总结 该研究提出Spike-Killer,一种人在环的证据门控工作流,用于安全诊断Windows工作站的帧时间问题,以CS2为目标应用验证了其可审计性,为LLM辅助智能体提供了可信操作模式。

Comments 6 pages. Experience report; no causal CS2 frame-time improvement or autonomous-safety claim is made

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21066 2026-08-24 cs.CV 新提交 50%

Robust Validation to Geometric Perturbations for Autonomous Pose Estimation

面向自主位姿估计的几何扰动鲁棒性验证

Gregoire Theau, Melanie Ducoffe

机构 * Airbus SAS(空中客车公司) IRT Saint-Exupery(圣埃克苏佩里技术研究院)

专题命中 安全训练 :safety(abstract)

AI总结 本文针对自主位姿估计的几何扰动鲁棒性验证问题,提出基于全局利普希茨优化(GLO)的方法,在YOLOv8-Pose模型上验证其可高效定位失效模式并剪枝80%以上搜索空间,为鲁棒自主感知验证提供了新途径。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏