arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2508.05766 2025-08-11 cs.AI cs.LG cs.SY eess.SY nlin.AO 79%

A Framework for Inherently Safer AGI through Language-Mediated Active Inference

Bo Wen

机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08898 2025-07-18 cs.CL cs.AI 79%

SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems

Wenliang Shan, Michael Fu, Rui Yang, Chakkrit Tantithamthavorn

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22492 2025-07-01 cs.CY cs.AI 79%

Report on NSF Workshop on Science of Safe AI

Rajeev Alur, Greg Durrett, Hadas Kress-Gazit, Corina Păsăreanu, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) NASA Ames and CMU(NASA阿姆斯特朗研究中心和卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cornell University(康奈尔大学) Penn(宾夕法尼亚大学) UT Austin(德克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03185 2025-04-07 cs.CL cs.AI 79%

Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents

Jaymari Chua, Chen Wang, Lina Yao

专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15657 2025-02-25 cs.AI cs.LG 79%

Superintelligent Agents Pose Catastrophic Risks: Can Scientist AI Offer a Safer Path?

Yoshua Bengio, Michael Cohen, Damiano Fornasiere, Joumana Ghosn, Pietro Greiner, Matt MacDermott, Sören Mindermann, Adam Oberman, Jesse Richardson, Oliver Richardson, Marc-Antoine Rondeau, Pierre-Luc St-Charles, David Williams-King

专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.LG

Comments v2 with fixed formatting for URLs and hyperlinks

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16318 2024-07-24 cs.AI cs.CL cs.CR cs.SE 79%

PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing

Blazej Manczak, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments ICML 2024 NextGenAISafety workshop version with links to implementation and dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02532 2024-04-04 cs.AI cs.CL 79%

Learn to Disguise: Avoid Refusal Responses in LLM's Defense via a Multi-agent Attacker-Disguiser Game

Qianqiao Xu, Zhiliang Tian, Hongyan Wu, Zhen Huang, Yiping Song, Feng Liu, Dongsheng Li

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09304 2023-05-17 cs.LG cs.AI 79%

OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research

Jiaming Ji, Jiayi Zhou, Borong Zhang, Juntao Dai, Xuehai Pan, Ruiyang Sun, Weidong Huang, Yiran Geng, Mickel Liu, Yaodong Yang

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07532 2020-12-15 cs.LG cs.AI 79%

An overview of 11 proposals for building safe advanced AI

Evan Hubinger

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-08-19 cs.CL cs.AI cs.LG 版本更新 78%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08572 2026-08-11 cond-mat.stat-mech 新提交 78%

Reliability-Safety Trade-off in AI Distillation: A Renormalization-Group Approach

AI知识蒸馏中的可靠性-安全性权衡:一种重整化群方法

Y. M. Du, Miao-Miao Yi, Tan-Ji Zhou, C. P. Sun

专题命中 安全训练 :safety(title,abstract)

AI总结 该研究基于统计力学构建知识蒸馏的粗粒化模型,以参数K表征危险辨别能力,揭示了AI蒸馏中可靠性与安全性的权衡关系,为多代蒸馏提供了可检验的标度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05578 2026-08-07 cs.CR 新提交 78%

Detecting Safety Training Modification in Language Models via Activation Analysis

通过激活分析检测语言模型中的安全训练修改

Glen Messenger

专题命中 安全训练 :safety(title,abstract)

AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。

Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 78%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25019 2026-07-29 econ.TH cs.GT cs.MA 新提交 78%

Interactive Alignment

交互式对齐

Sylvain Chassang

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。

Comments 53 pages, 18 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 78%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 78%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 78%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 安全训练 :safety(title,abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 78%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 78%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 78%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18879 2026-06-30 cs.PL 78%

Adaptive Shielding via Parametric Safety Proofs

基于参数安全证明的自适应防护

Yao Feng, Jun Zhu, André Platzer, Jonathan Laurent

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。

Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22096 2026-06-23 eess.SY cs.SY 新提交 78%

A Pre-Dispatch Resonance Safety Criterion for AI Training Clusters

AI训练集群的预调度共振安全准则

Chandan Chaudhary, Abanish Tiwari, Yansong Pei, Mohammed Ben-Idris, Joydeep Mitra

专题命中 安全训练 :safety(title,abstract)

AI总结 针对AI训练集群在BSP协议下对电网产生的周期性功率波动,提出一种预调度安全准则,通过解析两区域摇摆方程,界定危险迭代周期带,并量化集群规模上限。

Comments Submitted for North American Power Symposium (NAPS) 2026, October 11 - 13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05497 2026-06-23 cs.RO 版本更新 78%

Safe-SAGE: Social-Semantic Adaptive Guidance for Safe Engagement through Laplace-Modulated Poisson Safety Functions

Safe-SAGE: 通过拉普拉斯调制泊松安全函数实现安全交互的社会-语义自适应引导

Lizhi Yang, Ryan M. Bena, Meg Wilkinson, Gilbert Bahati, Andy Navarro Brenes, Ryan K. Cosner, Aaron D. Ames

机构 * Caltech MCE(Caltech机械工程系) Tufts ME(Tufts大学机械工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出Safe-SAGE框架,结合泊松安全函数与拉普拉斯引导场,融合多传感器点云与视觉语义分割,通过多层安全滤波器实现腿式机器人在语义丰富动态环境中的安全导航。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Copyright transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06846 2026-06-19 eess.SY cs.SY 版本更新 78%

Decentralized CBF-based Safety Filters for Collision Avoidance of Cooperative Missile Systems with Input Constraints

基于CBF的去中心化安全滤波器:面向输入受限的协同导弹系统碰撞避免

Johannes Autenrieb, Mark Spiller

专题命中 安全训练 :safety(title,abstract)

AI总结 针对多飞行器拦截场景,提出基于鲁棒控制屏障函数的去中心化安全滤波器,通过事件触发和松弛变量优化实现碰撞避免,兼顾计算效率与可扩展性。

Comments 7 pages, 5 figures, accepted for presentation at the 2026 American Control Conference (ACC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21546 2026-06-19 eess.SY cs.SY 版本更新 78%

Auction-Based Responsibility Allocation for Scalable Decentralized Safety Filters in Cooperative Multi-Agent Collision Avoidance

基于拍卖的责任分配用于可扩展的去中心化安全滤波器在多智能体协同避碰中

Johannes Autenrieb, Mark Spiller

专题命中 安全训练 :safety(title,abstract)

AI总结 提出基于高阶控制屏障函数和拍卖责任分配的可扩展去中心化安全滤波器,通过非对称分配约束减少计算负荷,实现多智能体协同避碰。

Comments 6 pages, 3 figures, accepted for presentation at the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11636 2026-06-11 cs.RO 新提交 78%

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning

SAFER-Nav: 通过分割感知微调增强视觉机器人导航的安全性

Geonyeong Ko, Giung Lee, Changjoo Nam

机构 * Dept. of Electronic Engineering, Sogang University(西江大学电子工程系) Dept. of Computer Science, Rice University(莱斯大学计算机科学系) Vertical Labs, Co., Ltd.(Vertical Labs 有限公司)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出SAFER-Nav方法,通过分割感知微调将障碍物边界和可通行空间结构直接融入导航策略,降低碰撞频率并保持目标到达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04394 2026-06-04 cs.SE 78%

Beyond Single-Policy: Evaluating Composed Organization-Specific Policy Alignment in LLM Chatbots

超越单一策略:评估LLM聊天机器人中组合的组织特定策略对齐

Yingjie Liu, Yongxiang Hu, Xuan Wang, Yilun Li, Yunlei Wei, Xiaoyu Wang, Yangfan Zhou

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对现有基准忽视的组合策略违规问题,提出COPAL工具,通过经验推导的交互模式和显式处理契约生成触发组合策略失败的查询,在9个模型中平均错误率达33.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06365 2026-06-04 eess.SY cs.SY 78%

Herding an Adversarial Attacker to a Safe Area for Defending Safety-Critical Infrastructure

将对抗性攻击者驱赶至安全区域以保护关键安全基础设施

Vishnu S Chipade, Dimitra Panagou

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究了在城市环境中防御关键安全基础设施免受对抗性空中攻击的问题,通过圆形弧形防御者阵型,在存在矩形障碍物的情况下,利用向量场引导法则将攻击者驱赶至预定义的安全区域。提出了一种新的有限时间稳定控制器,用于引导防御者形成 desired 阵型并避免障碍物和相互碰撞。

Comments ACC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04345 2026-06-04 eess.SY cs.MA cs.SY 78%

Automatic Generation of Communication Requirements for Enforcing Multi-Agent Safety

多智能体安全性的自动通信需求生成

Eric S. Kim, Murat Arcak, Sanjit A. Seshia, BaekGyu Kim, Shinichi Shiraishi

专题命中 安全训练 :safety(title,abstract)

AI总结 本文研究多智能体系统中通信需求的自动生成,提出无需协调的可控前驱运算符以确定安全约束下的自主行为,展示连接延迟上限和自触发协调方案的应用。

Comments In Proceedings SCAV 2018, arXiv:1804.03406

Journal ref EPTCS 269, 2018, pp. 3-16

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28097 2026-05-28 cs.RO 78%

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents

ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) Soochow University(苏州大学)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出ICAN-Deploy中间件,通过分离能力名称与版本,在安全关键具身智能体的金丝雀部署中保持身份哈希不变,避免重新认证。

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏