arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2510.18082 2026-02-12 cs.LG cs.RO cs.SY eess.SY 79%

Provably Optimal Reinforcement Learning under Safety Filtering

在安全过滤下可证明最优的强化学习

Donggeon David Oh, Duy P. Nguyen, Haimin Hu, Jaime F. Fisac

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文证明在安全过滤下强化学习可实现最优性能,通过安全关键MDP和过滤MDP的理论框架,展示安全与性能优化的分离,并验证了在安全过滤器下的训练和部署方法。

Comments Accepted for publication in the proceedings of The International Association for Safe & Ethical AI (IASEAI) 2026; 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10740 2026-02-12 cs.CL 79%

Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs

强化课程预对齐用于领域自适应视觉-语言模型

Yuming Yan, Shuo Yang, Kai Tang, Sihong Chen, Yang Zhang, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu, Edith C. H. Ngai

机构 * Tencent(腾讯)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10007 2026-02-11 cs.RO cs.AI cs.MA cs.SY eess.SY 79%

A Collaborative Safety Shield for Safe and Efficient CAV Lane Changes in Congested On-Ramp Merging

用于拥堵上坡合并中安全高效CAV变道的协作安全盾

Bharathkumar Hegde, Melanie Bouroche

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学系,三一学院都柏林)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出MARL-MASS,通过整合多智能体安全盾和定制奖励函数,在拥堵交通中实现安全且高效的车道变换。

Comments Accepted in IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06623 2026-02-09 cs.CL cs.CR 79%

Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention

提示是否保证安全?通过子空间干预减轻大语言模型生成中的毒性

Himanshu Singh, Ziwei Xu, A. V. Subramanyam, Mohan Kankanhalli

机构 * Department of Computer Science(计算机科学系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Electronics and Communications Engineering(电子与通信工程系)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种子空间干预策略,通过减少大语言模型生成中的毒性,同时保持生成文本的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22118 2026-01-30 cs.AI 79%

Defining Operational Conditions for Safety-Critical AI-Based Systems from Data

从数据定义安全关键AI系统的操作条件

Johann Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多维核表示的方法,从已有数据后验定义安全关键AI系统的操作条件领域,以实现更有效的认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13589 2026-01-21 cs.AI cs.SD 79%

Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification

基于多智能体AI系统的运动到响应内容生成及实时安全验证

HyeYoung Lee

机构 * Department of Artificial Intelligence(人工智能系) Korean University(韩国大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于多智能体AI系统的实时内容生成方法,通过情感识别与安全验证代理,实现安全可控的响应内容生成,适用于儿童媒体和智能设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09740 2026-01-16 cs.RO cs.AI cs.SE 79%

Formal Safety Guarantees for Autonomous Vehicles using Barrier Certificates

使用屏障证书为自动驾驶车辆提供形式安全保证

Oumaima Barhoumi, Mohamed H Zaki, Sofiène Tahar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合屏障证书与时间到碰撞度量的形式验证安全框架,通过SMT求解器和自适应控制机制,提升自动驾驶车辆的安全性和可解释性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08489 2026-01-14 cs.CL 79%

Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning

手术拒绝消融:通过概念引导的频谱清洁分离安全与智能

Tony Cristofano

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 通过概念引导的频谱清洁技术,SRA有效分离语言模型的安全性与智能,减少拒绝行为的同时保持模型性能和分布稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 79%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13762 2025-12-17 cs.AI cs.HC 79%

State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models

基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型

TK Lee

专题命中 安全训练 :RLHF(title);alignment(abstract);分类 cs.AI

AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。

Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12901 2025-12-16 cs.LG 79%

Predicted-occupancy grids for vehicle safety applications based on autoencoders and the Random Forest algorithm

基于自编码器和随机森林算法的预测占用网格用于车辆安全应用

Parthasarathy Nadarajan, Michael Botsch, Sebastian Sardina

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于自编码器和随机森林算法的预测占用网格方法,用于复杂交通场景中的车辆安全应用,通过降维和分类提高预测准确性。

Comments 2017 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12387 2025-12-16 cs.LG 79%

Anchoring Values in Temporal and Group Dimensions for Flow Matching Model Alignment

在时间和群体维度上锚定值以实现流匹配模型对齐

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 VGPO通过在时间和群体维度上锚定值,改进流匹配模型对齐,提升图像生成质量与任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19486 2025-12-12 eess.SY cs.LG cs.MA cs.SY 79%

VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture

VLMLight:通过视觉-语言元控制与双分支推理架构实现安全关键的交通信号控制

Maonan Wang, Yirong Chen, Aoyu Pang, Yuxin Cai, Chung Shue Chen, Yuheng Kan, Man-On Pun

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nokia Bell Labs(诺基亚贝尔实验室) Fourier Intelligence(Fourier智能)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 VLMLight通过视觉-语言元控制与双分支推理架构,实现安全关键的交通信号控制,显著减少紧急车辆等待时间并提升系统安全性。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02682 2025-12-03 cs.MA cs.AI 79%

Beyond Single-Agent Safety: A Taxonomy of Risks in LLM-to-LLM Interactions

超越单体安全:LLM到LLM交互中的风险分类

Piercosma Bisconti, Marcello Galisai, Federico Pierucci, Marcantonio Bracale, Matteo Prandi

机构 * icaro-lab(ICARO实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出从模型级安全向系统级安全的转变,引入ESRH框架,阐述LLM交互中的集体风险并提出InstitutionalAI架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01247 2025-12-02 cs.CR cs.CY cs.HC 79%

Benchmarking and Understanding Safety Risks in AI Character Platforms

在AI人物平台中进行基准测试与安全风险理解

Yiluo Wei, Peixian Zhang, Gareth Tyson

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

AI总结 该研究首次对AI人物平台进行大规模安全评估,发现其平均不安全响应率高达65.1%,并提出基于机器学习模型的预测方法以提升平台安全性和交互质量。

Comments Accepted to NDSS '26: The Network and Distributed System Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22738 2025-12-01 cs.LG cs.CR 79%

ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning

ShieldAgent: 通过可验证的安全策略推理实现安全代理

Zhaorun Chen, Mintong Kang, Bo Li

机构 * University of Chicago, Chicago IL, USA(芝加哥大学) University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17846 2025-11-27 cs.RO cs.AI 79%

Safety Control of Service Robots with LLMs and Embodied Knowledge Graphs

服务机器人中结合大语言模型和具身知识图谱的安全控制

Yong Qi, Gabriel Kyebambo, Siyuan Xie, Wei Shen, Shenghui Wang, Bitao Xie, Bin He, Zhipeng Wang, Shuo Jiang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与具身知识图谱的方法,提升服务机器人安全控制,通过预定义指令和知识库验证增强安全实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14865 2025-11-10 cs.AI cs.FL cs.RO 79%

Joint Verification and Refinement of Language Models for Safety-Constrained Planning

Yunhao Yang, Neel P. Bhatt, William Ward, Zichao Hu, Joydeep Biswas, Ufuk Topcu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02371 2025-11-05 cs.LG 79%

LUMA-RAG: Lifelong Multimodal Agents with Provably Stable Streaming Alignment

Rohan Wandre, Yash Gajewar, Namrata Patel, Vivek Dhalkari

机构 * Dept. of Computer Engineering(计算机工程系) SIES Graduate School of Technology(SIES技术研究生学院) Bharatiya Vidya Bhavan's Sardar Patel Institute of Technology(巴哈里亚·维达·巴万学院萨达尔·帕特尔技术学院)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21254 2025-10-27 cs.AI 79%

Out-of-Distribution Detection for Safety Assurance of AI and Autonomous Systems

Victoria J. Hodge, Colin Paterson, Ibrahim Habli

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07961 2025-10-15 cs.RO cs.AI 79%

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models

Peiyan Li, Yixiang Chen, Hongtao Wu, Xiao Ma, Xiangnan Wu, Yan Huang, Liang Wang, Tao Kong, Tieniu Tan

机构 * CASIA(中国科学院自动化研究所) ByteDance Seed(字节跳动种子实验室) UCAS(中国科学院大学) FiveAges NJU(南京大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10823 2025-10-14 cs.AI cs.NE cs.RO 79%

The Irrational Machine: Neurosis and the Limits of Algorithmic Safety

Daniel Howard

机构 * Howard Science Limited, Malvern, UK(霍华德科学有限公司,英国马尔文) QinetiQ Fellow, UK(QinetiQ Fellow,英国) Member of Senior Common Room, Pembroke College, University of Oxford(奥克斯福德大学彭伯里学院高级共同房间成员)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 41 pages, 17 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05865 2025-10-08 cs.AI cs.CV cs.RO 79%

The Safety Challenge of World Models for Embodied AI Agents: A Review

Lorenzo Baraldi, Zifan Zeng, Chongzhe Zhang, Aradhana Nayak, Hongbo Zhu, Feng Liu, Qunli Zhang, Peng Wang, Shiming Liu, Zheng Hu, Angelo Cangelosi, Lorenzo Baraldi

机构 * University of Pisa(比萨大学) Huawei RAMS Lab(华为RAMS实验室) Technical University of Munich(慕尼黑技术大学) Technical University of Berlin(柏林技术大学) University of Manchester(曼彻斯特大学) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05156 2025-10-08 cs.SE cs.AI cs.CR 79%

VeriGuard: Enhancing LLM Agent Safety via Verified Code Generation

Lesly Miculicich, Mihir Parmar, Hamid Palangi, Krishnamurthy Dj Dvijotham, Mirko Montanari, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23614 2025-09-30 cs.AI 79%

PSG-Agent: Personality-Aware Safety Guardrail for LLM-based Agents

Yaozu Wu, Jizhou Guo, Dongyuan Li, Henry Peng Zou, Wei-Chieh Huang, Yankai Chen, Zhen Wang, Weizhi Zhang, Yangning Li, Meng Zhang, Renhe Jiang, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15241 2025-09-29 cs.CL 79%

MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety

Yahan Yang, Soham Dan, Shuo Li, Dan Roth, Insup Lee

机构 * University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软公司) Oracle AI

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20513 2025-09-26 cs.AI cs.DC 79%

Reconstruction-Based Adaptive Scheduling Using AI Inferences in Safety-Critical Systems

Samer Alshaer, Ala Khalifeh, Roman Obermaisser

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19688 2025-09-25 cs.RO cs.LG cs.SY eess.SY math.OC 79%

Formal Safety Verification and Refinement for Generative Motion Planners via Certified Local Stabilization

Devesh Nath, Haoran Yin, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18382 2025-09-24 cs.AI 79%

Evaluating the Safety and Skill Reasoning of Large Reasoning Models Under Compute Constraints

Adarsha Balaji, Le Chen, Rajeev Thakur, Franck Cappello, Sandeep Madireddy

机构 * Argonne National Laboratory(阿贡国家实验室) Mathematics and Computer Science Division(数学与计算机科学 division) Data Science and Learning Division(数据科学与学习 division)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16861 2025-09-23 cs.CR cs.AI cs.SE 79%

AdaptiveGuard: Towards Adaptive Runtime Safety for LLM-Powered Software

Rui Yang, Michael Fu, Chakkrit Tantithamthavorn, Chetan Arora, Gunel Gulmammadova, Joey Chua

机构 * Monash University(墨尔本大学) The University of Melbourne(墨尔本大学) Transurban

专题命中 安全训练 :safety(title);jailbreak(abstract);分类 cs.AI

Comments Accepted to the ASE 2025 International Conference on Automated Software Engineering, Industry Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏