arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2604.12019 2026-04-30 cs.AI cs.HC 70%

A Framework for Longitudinal Health AI Agents

面向长期健康AI代理的框架

Georgianna Lin, Rencong Jiang, Noémie Elhadad, Xuhai "Orson" Xu

机构 * Columbia University, Biomedical Informatics(哥伦比亚大学生物医学信息学) Columbia University, Computer Science(哥伦比亚大学计算机科学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个多层框架,用于支持长期健康交互的AI代理,强调适应性、连贯性、连续性和自主性,通过案例展示如何维持有意义的参与并支持个性化决策。

Comments 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13128 2026-04-16 cs.MA cs.LG cs.RO cs.SY eess.SY 70%

Learning Probabilistic Responsibility Allocations for Multi-Agent Interactions

多智能体交互中的概率责任分配学习

Isaac Remy, Caleb Chang, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) NVIDIA

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种学习多智能体交互中概率责任分配模型的方法,通过条件变分自动编码器的潜在空间和多智能体轨迹预测技术,实现基于场景和智能体上下文的责任分配分布学习,展示了在INTERACTION驾驶数据集上的强预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01438 2026-04-07 cs.AI 70%

ClawSafety: "Safe" LLMs, Unsafe Agents

ClawSafety: 安全的LLM,不安全的代理

Bowen Wei, Yunbei Zhang, Jinhao Pan, Kai Mei, Xiao Wang, Jihun Hamm, Ziwei Zhu, Yingqiang Ge

机构 * George Mason University(乔治梅森大学) Tulane University(杜兰大学) Rutgers University(罗格斯大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 ClawSafety评估了120个对抗性测试场景,揭示了高权限工作环境中LLM的安全性问题,强调部署栈对安全性的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22059 2026-03-31 hep-ph cs.LG hep-ex 70%

Stable and Interpretable Jet Physics with IRC-Safe Equivariant Feature Extraction

利用 IRC 安全等价特征提取实现稳定且可解释的喷注物理

Partha Konar, Vishal S. Ngairangbam, Michael Spannowsky, Deepanshu Srivastava

机构 * Physical Research Laboratory(物理研究实验室) Durham University(杜伦大学) Indian Institute of Technology(印度理工学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文通过图神经网络实现喷注分类,结合物理诱导偏置,设计 IRC 安全和等价性架构,提升模型稳定性与可解释性,建立学习表示与 QCD 观测的联系。

Comments 30 pages, 3 tables, 7 figures

Journal ref JHEP 03 (2026) 219

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 70%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01899 2026-03-19 cs.LG stat.ML 70%

Provably Safe Model Updates

可证明安全的模型更新

Leo Elmecker-Plakolm, Pierre Fasterling, Philip Sosnin, Calvin Tsay, Matthew Wicker

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校) School of Computer and Comm. Sciences (IC)(计算机与通信科学系) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出可证明安全的模型更新框架,通过计算最大局部不变域来确保模型更新的安全性,有效避免遗忘并提供形式化安全保证。

Comments 12 pages, 9 figures. This work has been accepted for publication at SaTML 2026. The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16734 2026-03-18 cs.AI 70%

Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure

个性化LLM代理中的差异性伤害倾向:心理健康披露的奇特案例

Caglar Yildirim

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究探讨了心理健康披露对代理有害行为的影响,发现个性化设置可降低伤害,但易受对抗性压力影响,需加强个性化评估与安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI 70%

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 70%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00544 2026-03-11 cs.CL 70%

When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment

当思考反噬:对推理引发的不一致的机理洞察

Hanqi Yan, Hainiu Xu, Siya Qi, Shu Yang, Yulan He

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文揭示了推理能力增强导致的不一致现象,通过神经元层面的分析,解释了推理与安全之间的纠缠如何引发灾难性遗忘。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19680 2026-02-27 cs.HC cs.AI 70%

PolicyPad: Collaborative Prototyping of LLM Policies

PolicyPad: LLM策略协同原型设计

K. J. Kevin Feng, Tzu-Sheng Kuo, Quan Ze Chen, Inyoung Cheong, Kenneth Holstein, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 PolicyPad通过结合用户体验原型设计方法,为LLM策略协作设计提供交互式支持,提升政策制定的协作效率与反馈质量。

Comments CHI 2026 paper. Supplementary materials: https://docs.google.com/document/d/1jBmKXusoWmCHfwpmNhSTJtbwZ5fwVWLNppKeqqd_-pY/edit?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20094 2026-02-26 cs.IR cs.CL cs.HC 70%

Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition

迈向安全且人本对齐的游戏对话推荐的多智能体分解

Zheng Hui, Xiaokai Wei, Yexi Jiang, Kevin Gao, Chen Wang, Frank Ong, Se-eun Yoon, Rachit Pareek, Michelle Gong

机构 * Roblox Corporation(Roblox公司) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MATCHA通过多智能体框架提升游戏对话推荐的安全性与人本对齐,实现更精细的个性化和更强的对抗防御能力。

Comments ICML 2025 MAS, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19844 2026-02-24 cs.CR cs.AI cs.SE 70%

LLM-enabled Applications Require System-Level Threat Monitoring

依赖大语言模型的应用需要系统级威胁监控

Yedi Zhang, Haoyu Wang, Xianglin Yang, Jin Song Dong, Jun Sun

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13860 2026-02-17 cs.CL 70%

Tutoring Large Language Models to be Domain-adaptive, Precise, and Safe

指导大语言模型成为领域自适应、精确和安全的

Somnath Banerjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克哈格浦分校)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过领域适应、伦理严谨性和文化对齐,指导大语言模型实现精确性、安全性和全球包容性。

Comments Accepted to the PhD Symposium at Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09434 2026-02-11 cs.CR cs.AI 70%

A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors

大型语言模型的行为指纹:通过拒绝向量进行溯源追踪

Zhenyu Xu, Victor S. Sheng

机构 * Department of Computer Science, Texas Tech University(计算机科学系,塔尔萨大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出通过拒绝向量进行大型语言模型溯源追踪的方法,开发了稳健的行为指纹系统,并验证其在知识产权保护中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10566 2026-02-10 cs.LG 70%

ASIDE: Architectural Separation of Instructions and Data in Language Models

ASIDE: 语言模型中指令与数据的架构分离

Egor Zverev, Evgenii Kortukov, Alexander Panfilov, Alexandra Volkova, Soroush Tabesh, Sebastian Lapuschkin, Wojciech Samek, Christoph H. Lampert

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学与技术研究所) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) Centre of eXplainable Artificial Intelligence(可解释人工智能中心) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 ASIDE通过在令牌嵌入层面实现指令与数据的分离,提升了语言模型的安全性和性能

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17600 2026-02-04 cs.CY 70%

STAMP/STPA Informed Characterization of Factors Leading to Loss of Control in AI Systems

基于STAMP/STPA的AI系统失控因素特征化

Steve Barrett, Anna Bruvere, Sean P. Fillingham, Catherine Rhodes, Stefano Vergani

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文基于STAMP/STPA方法,提出一个结构化框架来特征化AI系统失控的因果因素,以提升AI系统安全运行的保障能力。

Comments This new version only corrects some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17892 2026-01-27 cs.CY cs.AI cs.CL cs.LG 70%

Artificial Intelligence and Intellectual Property Rights: Comparative Transnational Policy Analysis

人工智能与知识产权权利:比较跨国政策分析

Sahibpreet Singh, Manjit Singh

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究分析了人工智能与知识产权法的结合,揭示印度法律在适应AI生成内容方面的不足,并提出协调法律分类以促进公平创新。

Comments Published in Journal of University Institute of Legal Studies, Vol. 19, Issue 1, pp. 182-208, 2025

Journal ref Journal of University Institute of Legal Studies 19(1), 182-208 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17168 2026-01-27 cs.AI cs.MA 70%

Interpreting Agentic Systems: Beyond Model Explanations to System-Level Accountability

解释代理系统:超越模型解释到系统级问责

Judy Zhu, Dhari Gandhi, Himanshu Joshi, Ahmad Rezaie Mianroodi, Sedef Akinli Kocak, Dhanesh Ramachandran

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Texas, Austin(德克萨斯大学奥斯汀分校) Dalhousie University(达尔豪斯大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨了代理系统中可解释性技术的必要性,提出需设计专门方法以确保系统在目标形成、环境交互和结果评估等阶段的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 70%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03994 2026-01-21 cs.LG 70%

Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs

无需训练的策略违规检测:通过激活空间白化在大语言模型中

Oren Rachmil, Avishag Shapira, Roy Betser, Itay Gershon, Omer Hofman, Asaf Shabtai, Yuval Elovici, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究机构) Ben-Gurion University of the Negev(贝内杰尔大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的策略违规检测方法,通过激活空间白化技术在大语言模型中实现高效检测。

Comments Accepted to the AAAI 2026 Deployable AI (DAI) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20293 2026-01-06 cs.CL 70%

AprielGuard

AprielGuard:一个统一安全与对抗防御的8B参数模型

Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana, Lakshmi Sirisha Chodisetty, Sourav Sharma, Abhigya Verma, Abhishek Bhardwaj, Debasish Kanhar, Aakash Bhagat, Khalil Slimi, Seganrasan Subramanian, Sathwik Tejaswi Madhusudhan, Ranga Prasad Chenna, Srinivas Sunkara

机构 * AprielGuard

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06059 2025-12-30 cs.CY 70%

Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles

优先原则,原则其次:一种适应性解读有助于、诚实和无害原则

Yue Huang, Chujie Gao, Yujun Zhou, Kehan Guo, Xiangqi Wang, Or Cohen-Sasson, Max Lamparth, Xiangliang Zhang

专题命中 安全训练 :alignment(abstract);harmlessness(abstract);分类 cs.CY

AI总结 本文提出了一种适应性解读有助于、诚实和无害原则的方法,通过优先级顺序平衡不同维度,以提高AI对齐的伦理和操作有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 70%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01848 2025-12-02 cs.CL 70%

Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability

超越SFT:通过强化学习构建更安全且推理能力更强的大推理模型

Jinghan Jia, Nathalie Baracaldo, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出通过强化学习提升大推理模型的安全性和推理能力,克服了传统监督微调的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 70%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09341 2025-11-26 cs.AI 70%

Access Controls Will Solve the Dual-Use Dilemma

访问控制将解决双重用途困境

Evžen Wybitul

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出基于访问控制的概念框架,通过验证用户访问双重用途输出,以解决人工智能安全系统在双重用途请求中的决策困境。

Comments Accepted at ICML 2025 Workshop on Technical AI Governance (TAIG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16144 2025-10-21 cs.NI cs.AI cs.MA 70%

Agentic AI for Ultra-Modern Networks: Multi-Agent Framework for RAN Autonomy and Assurance

Sukhdeep Singh, Avinash Bhat, Shweta M, Subhash K Singh, Moonki Hong, Madhan Raj K, Kandeepan Sithamparanathan, Sunder A. Khowaja, Kapal Dev

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15017 2025-10-20 cs.CR cs.AI 70%

Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks

ChenYu Wu, Yi Wang, Yang Liao

机构 * Wuhan, China(中国武汉) The University of Tokyo(东京大学) Xi’an Jiaotong University(西安交通大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 6pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23441 2025-10-15 cs.CL 70%

Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models

Xuanming Zhang, Yuxuan Chen, Samuel Yeh, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏