arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2602.01539 2026-02-09 cs.AI cs.CL cs.LG cs.MA 85%

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06623 2026-02-09 cs.CL cs.CR 79%

Do Prompts Guarantee Safety? Mitigating Toxicity from LLM Generations through Subspace Intervention

提示是否保证安全?通过子空间干预减轻大语言模型生成中的毒性

Himanshu Singh, Ziwei Xu, A. V. Subramanyam, Mohan Kankanhalli

机构 * Department of Computer Science(计算机科学系) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Electronics and Communications Engineering(电子与通信工程系)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种子空间干预策略,通过减少大语言模型生成中的毒性,同时保持生成文本的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06258 2026-02-09 cs.LG cs.AI 73%

GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt

GRP-Obliteration: 通过单个无标签提示解耦大语言模型

Mark Russinovich, Yanan Cai, Keegan Hines, Giorgio Severi, Blake Bullwinkel, Ahmed Salem

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 GRP-Obliteration通过单个无标签提示解耦大语言模型,利用GRPO技术有效移除安全约束,实现更强的不对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06540 2026-02-09 cs.AI cs.CL 62%

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report: 交错起草与深入以促进开放性深度研究

Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * AgentCPM Team(AgentCPM团队)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 AgentCPM-Report通过交错起草与深入的方法,提升开放性深度研究的性能,优于现有闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06359 2026-02-09 cs.LG cs.AI 62%

Training Data Selection with Gradient Orthogonality for Efficient Domain Adaptation

基于梯度正交性的训练数据选择用于高效的领域适应

Xiyang Zhang, Yuanhe Tian, Hongzhi Wang, Yan Song

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OGS方法,通过梯度正交性选择训练数据,提升领域适应的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06375 2026-02-09 cs.AI 57%

Difficulty-Estimated Policy Optimization

难度估计策略优化

Yu Zhao, Fan Jiang, Tianle Liu, Bo Zeng, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07210 2026-02-09 cs.RO cs.AI 57%

HyPlan: Hybrid Learning-Assisted Planning Under Uncertainty for Safe Autonomous Driving

HyPlan:在不确定环境下通过混合学习辅助规划实现安全自动驾驶

Donald Pfaffmann, Matthias Klusch, Marcel Steinmetz

机构 * Saarland University, Computer Science Dept.(萨尔兰大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) French National Centre for Scientific Research (CNRS)(法国国家科学研究中心)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 HyPlan通过结合多智能体行为预测、深度强化学习和POMDP规划,实现安全且高效的自动驾驶导航

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04188 2026-02-09 cs.CV 50%

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo:用于运动生成与理解的离散扩散建模

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

机构 * Huawei Central Media Technology Institute(华为中央媒体技术研究所) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全训练 :alignment(abstract)

AI总结 DiMo提出了一种离散扩散式框架,实现双向文本-运动理解和生成,通过迭代掩码标记细化提升运动质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏