arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-26 至 2026-02-26 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 13 篇

2602.22146 2026-02-26 cs.LG cs.AI 84%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12033 2026-02-26 cs.LG cs.AI 81%

EARL: Entropy-Aware RL Alignment of LLMs for Reliable RTL Code Generation

EARL: 用于可靠RTL代码生成的熵感知强化学习对齐大语言模型

Jiahe Shi, Zhengqi Gao, Ching-Yun Ko, Duane Boning

机构 * MIT(麻省理工学院) IBM(国际商业机器公司)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 EARL通过熵感知强化学习提升Verilog代码生成的可靠性与准确性

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 79%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 79%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20094 2026-02-26 cs.IR cs.CL cs.HC 70%

Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition

迈向安全且人本对齐的游戏对话推荐的多智能体分解

Zheng Hui, Xiaokai Wei, Yexi Jiang, Kevin Gao, Chen Wang, Frank Ong, Se-eun Yoon, Rachit Pareek, Michelle Gong

机构 * Roblox Corporation(Roblox公司) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MATCHA通过多智能体框架提升游戏对话推荐的安全性与人本对齐,实现更精细的个性化和更强的对抗防御能力。

Comments ICML 2025 MAS, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 67%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06966 2026-02-26 cs.LG cs.AI cs.CY 67%

Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research

机器去学习并不如你所想:生成式AI政策与研究的启示

A. Feder Cooper, Christopher A. Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alexandra Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Elyse Mitchell, Niloofar Mireshghallah, Abigail Z. Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, Ilia Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, danah boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel E. Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy B. Cyphert, Mark A. Lemley, Nicolas Papernot, Katherine Lee

机构 * The GenLaw Center(GenLaw中心) Microsoft Research(微软研究院) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Center for Democracy & Technology(民主与科技中心) Princeton(普林斯顿) Google(谷歌) University of Washington(华盛顿大学) University of Michigan(密歇根大学) Cornell Tech(康奈尔科技) Cornell Law School(康奈尔法学院) Cornell University(康奈尔大学) Lighthouse Stanford Law School(斯坦福法学院) UC Berkeley(伯克利大学) Independent(独立研究者) Northeastern University(东北大学) Harvard Business School(哈佛商学院) W. Virginia University College of Law(维珍尼亚大学法学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出机器去学习并非通用解决方案,揭示其在生成式AI政策与研究中的局限性。

Comments NeurIPS 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17729 2026-02-26 cs.CY cs.AI cs.ET cs.HC 62%

Stop Saying "AI"

别再说『人工智能』了

Nathan G. Wood, Scott Robbins, Eduardo Zegarra Berodt, Anton Graf von Westerholt, Michelle Behrndt, Hauke Budig, Daniel Kloock-Schreiber

机构 * Institute of Air Transportation Systems, Hamburg University of Technology(空气交通系统研究所,汉堡技术大学) Ethics + Emerging Sciences Group, California Polytechnic State University San Luis Obispo(伦理与新兴科学小组,加州州立大学圣路易斯奥比斯波分校) Center for Environmental and Technology Ethics – Prague(环境与技术伦理中心–布拉格) Academy for Responsible Research, Teaching, and Innovation, Karlsruhe Institute of Technology(负责任研究、教学与创新学院,卡尔斯鲁厄理工学院) Department of Philosophy, University of Hamburg(哲学系,汉堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了『人工智能』术语在军事领域的应用,指出其泛化带来的问题,并主张在讨论中明确具体系统以提高讨论的精确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21269 2026-02-26 cs.LG cs.AI stat.ML 62%

Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space

群体正交化策略优化:将群体策略优化视为希尔伯特空间中的正交投影

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过正交投影在希尔伯特空间中优化群体策略,实现精确稀疏性和稳定梯度动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12415 2026-02-26 cs.LG cs.AI 62%

Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space

正交化策略优化:作为希尔伯特空间中的正交投影的策略优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分支)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 OPO通过正交投影在希尔伯特空间中实现策略优化,利用守恒定律而非方差减少启发式方法,提升模型在长时程训练和分布外泛化中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 62%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18060 2026-02-26 cs.LG cs.AI cs.RO 62%

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR:基于集中参考模型的自我对战锚定

Wei-Jer Chang, Akshay Rangesh, Kevin Joseph, Matthew Strong, Masayoshi Tomizuka, Yihan Hu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SPACeR通过集中参考模型指导自我对战,实现高效、可扩展的自动驾驶策略生成。

Comments Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21496 2026-02-26 cs.AI 57%

Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information

超越拒绝:探求代理自我校正对语义敏感信息的极限

Umid Suleymanov, Zaur Rajabov, Emil Mirzazada, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏