arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2601.10307 2026-01-16 cs.CL 81%

The Straight and Narrow: Do LLMs Possess an Internal Moral Path?

直行与狭窄:大型语言模型是否具有内在的道德路径?

Luoming Hu, Jingjie Zeng, Liang Yang, Hongfei Lin

机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10407 2026-01-16 cs.LG 57%

CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning

CS-GBA:一种基于关键样本的梯度引导后门攻击用于离线强化学习

Yuanjie Zhao, Junnan Qiu, Yue Ding, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 CS-GBA提出了一种基于关键样本的梯度引导后门攻击方法,通过优化攻击预算和隐蔽性,有效对抗安全约束算法。

详情

展开后加载摘要…

URL PDF HTML 收藏