arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 13 篇

2602.06981 2026-02-10 cs.CY cs.AI cs.HC 87%

What is Safety? Corporate Discourse, Power, and the Politics of Generative AI Safety

什么是安全?企业话语、权力与生成式人工智能安全的政治

Ankolika De, Gabriel Lima, Yixin Zou

机构 * College of Information Sciences and Technology, The Pennsylvania State University(信息科学与技术学院,宾夕法尼亚州立大学) Max Planck Institute for Security and Privacy(安全与隐私研究所)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 本文通过批判性话语分析,探讨生成式人工智能公司如何构建安全概念,揭示企业话语对安全治理的影响,并呼吁关注问责、公平与正义。

Comments 18 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14185 2026-02-10 cs.LG cs.AI cs.CL 85%

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

安全子空间并非线性区分:一项微调案例研究

Kaustubh Ponkshe, Shaan Shah, Raghav Singhal, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。

Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07381 2026-02-10 cs.CL 83%

When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified

当模型说'无话可说'时,我们得知有帮助性已死,诚实仍活着,安全性却感到害怕

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 安全训练 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 AlignX通过两阶段框架解决LLM多目标对齐问题,提升有帮助性、无害性和诚实性,同时减少延迟和内存使用。

Comments Accepted at EACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08621 2026-02-10 cs.LG cs.AI cs.CR 81%

Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs

稀疏模型,稀疏安全:混合专家大语言模型中的不安全路线

Yukun Jiang, Hai Huang, Mingjie Li, Yage Zhang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了混合专家大语言模型中的不安全路由问题,提出RoSais评分和F-SOUR框架以量化和发现安全风险,通过实验展示了高ASR的攻击效果,并提出防御策略以提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 81%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07007 2026-02-10 cs.RO 78%

ARGOS: Automated Functional Safety Requirement Synthesis for Embodied AI via Attribute-Guided Combinatorial Reasoning

ARGOS:通过属性引导的组合推理实现具身AI的自动功能安全需求合成

Dongsheng Chen, Yuxuan Li, Yi Lin, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学, 深圳, 中国) City University of Hong Kong, Hong Kong, China(香港城市大学, 香港, 中国) The University of Tokyo, Tokyo, Japan(东京大学, 东京, 日本) Lingnan University, Hong Kong, China(岭南大学, 香港, 中国)

专题命中 安全训练 :safety(title,abstract)

AI总结 ARGOS通过属性引导的组合推理,实现具身AI自动功能安全需求生成,提升开放环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17420 2026-02-10 cs.LG cs.AI cs.CL 75%

The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence

大语言模型中的拒绝几何学:概念锥与表征独立性

Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger

机构 * School of Computation, Information \& Technology Munich Data Science Institute, Technical University of Munich Google Research Now at Google Research

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出基于梯度的表征工程方法,揭示大语言模型拒绝行为的复杂空间结构及多维概念锥,证明多个独立机制驱动拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07022 2026-02-10 cs.LG cs.AI cs.CR 73%

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 73%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10566 2026-02-10 cs.LG 70%

ASIDE: Architectural Separation of Instructions and Data in Language Models

ASIDE: 语言模型中指令与数据的架构分离

Egor Zverev, Evgenii Kortukov, Alexander Panfilov, Alexandra Volkova, Soroush Tabesh, Sebastian Lapuschkin, Wojciech Samek, Christoph H. Lampert

机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学与技术研究所) Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) Centre of eXplainable Artificial Intelligence(可解释人工智能中心) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 ASIDE通过在令牌嵌入层面实现指令与数据的分离,提升了语言模型的安全性和性能

Comments ICLR 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08082 2026-02-10 cs.LG cs.AI eess.SP 62%

Spectral Guardrails for Agents in the Wild: Detecting Tool Use Hallucinations via Attention Topology

野生环境中代理的频谱护栏:通过注意力拓扑检测工具使用幻觉

Valentin Noël

机构 * Devoteam

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过分析注意力拓扑谱,提出一种无需训练数据的防护方法,有效检测代理幻觉,揭示模型错误时注意力噪声特征。

Comments 32 pages, 2 fgures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 50%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06971 2026-02-10 cs.RO 50%

Formal Methods in Robot Policy Learning and Verification: A Survey on Current Techniques and Future Directions

机器人策略学习与验证中的形式方法:对当前技术与未来方向的综述

Anastasios Manganaris, Vittorio Giammarino, Ahmed H. Qureshi, Suresh Jagannathan

专题命中 安全训练 :safety(abstract)

AI总结 本文综述了形式方法在机器人策略学习与验证中的应用,探讨了当前技术及未来发展方向,旨在提升机器人系统的安全性和正确性。

Comments 19 Pages. 6 Figures. Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏