arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 6 篇

2509.23286 2026-02-04 cs.CL cs.AI 88%

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型

Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 A2D通过令牌级对齐方法,在扩散语言模型中实现任意顺序和步长攻击的鲁棒防御,显著降低有害输出生成概率并提升安全终止效率。

Comments Accepted at ICLR 2026. Code and models are available at https://ai-isl.github.io/A2D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08951 2026-02-04 cs.CY cs.AI cs.CL 80%

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

PluriHarms:对AI危害全谱人类判断的基准测试

Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

机构 * UC Berkeley(伯克利大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) New York University(纽约大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 PluriHarms通过系统研究人类对AI危害的判断,旨在推动更安全的AI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17600 2026-02-04 cs.CY 70%

STAMP/STPA Informed Characterization of Factors Leading to Loss of Control in AI Systems

基于STAMP/STPA的AI系统失控因素特征化

Steve Barrett, Anna Bruvere, Sean P. Fillingham, Catherine Rhodes, Stefano Vergani

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文基于STAMP/STPA方法,提出一个结构化框架来特征化AI系统失控的因果因素,以提升AI系统安全运行的保障能力。

Comments This new version only corrects some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00755 2026-02-04 cs.MA cs.AI cs.NE 57%

Evolving Interpretable Constitutions for Multi-Agent Coordination

为多智能体协调演化可解释的宪法

Ujwal Kumar, Alice Saito, Hershraj Niranjani, Rayan Yessou, Phan Xuan Tan

机构 * College of Engineering Shibaura Institute of Technology(Shibaura Institute of Technology 工程学院) Faculty of Arts and Sciences The University of Tokyo(东京大学 文理学部) Department of EECS University of California, Berkeley(加州大学伯克利分校 电子工程与计算机科学系) Department of Informatics Università degli Studi di Milano-Bicocca(米兰-比科卡大学 信息学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过进化算法自动发现多智能体协调的可解释宪法,通过实验展示进化宪法在提升社会稳定性方面的有效性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02970 2026-02-04 cs.LG 57%

Co2PO: Coordinated Constrained Policy Optimization for Multi-Agent RL

Co2PO:多智能体强化学习中的协调约束策略优化

Shrenik Patel, Christine Truong

机构 * Rutgers University, New Brunswick, NJ(罗杰斯大学,新不伦瑞克,新泽西) Carnegie Mellon University, Pittsburgh, PA(卡内基梅隆大学,匹兹堡,宾夕法尼亚)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 Co2PO通过引入共享黑板架构和风险预测机制,实现多智能体强化学习中的协调安全优化,提升探索效率并减少保守性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03248 2026-02-04 cs.RO physics.app-ph physics.optics 50%

A thin and soft optical tactile sensor for highly sensitive object perception

一种薄而柔软的光学触觉传感器用于高灵敏度物体感知

Yanchen Shen, Kohei Tsuji, Haruto Koizumi, Jiseon Hong, Tomoaki Niiyama, Hiroyuki Kuwabara, Hayato Ishida, Jun Hiramitsu, Mitsuhito Mase, Satoshi Sunada

机构 * Graduate School of Natural Science and Technology, Kanazawa University(自然科学技术研究生院,金泽大学) Faculty of Mechanical Engineering, Institute of Science and Engineering, Kanazawa University(机械工程学部,科学工程研究所,金泽大学) Hamamatsu Photonics K.K.(Hamamatsu光子株式会社)

专题命中 安全训练 :alignment(abstract)

AI总结 本研究提出了一种薄而柔软的光学触觉传感器,通过散射图案变化实现高灵敏度的力测量和纹理识别,适用于软机器人和可穿戴设备。

详情

展开后加载摘要…

URL PDF HTML 收藏