arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-14 至 2026-01-14 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2601.08000 2026-01-14 cs.AI cs.SE 89%

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety

在法规中进行推理:结合案例的 deliberative 对齐方法用于 LLM 安全性

Can Jin, Rui Wu, Tong Che, Qixin Zhang, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) NVIDIA Research(NVIDIA研究) Nanyang Technological University(南洋理工大学) Adobe Research(Adobe研究) University of Connecticut(康涅狄格大学) Fordham University(福特汉姆大学) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文提出CADA方法,通过案例增强的推理链进行强化学习,提升LLM的安全性和实用性,避免过度依赖规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08489 2026-01-14 cs.CL 79%

Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning

手术拒绝消融:通过概念引导的频谱清洁分离安全与智能

Tony Cristofano

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 通过概念引导的频谱清洁技术,SRA有效分离语言模型的安全性与智能,减少拒绝行为的同时保持模型性能和分布稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 79%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 73%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08668 2026-01-14 cs.CL 57%

Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification

分析大型语言模型在仇恨言论净化中的虚假拒绝行为偏见

Kyuri Im, Shuzhou Yuan, Michael Färber

机构 * TU Dresden(德累斯顿理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究分析了大型语言模型在仇恨言论净化中的虚假拒绝偏见,并提出通过中英互译策略减少此类拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08327 2026-01-14 cs.RO cs.AI 57%

Safe Heterogeneous Multi-Agent RL with Communication Regularization for Coordinated Target Acquisition

安全的异构多智能体强化学习与通信正则化用于协同目标获取

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology, Luleå, Sweden.(计算机科学与空间工程系,卢勒奥技术大学,卢勒奥,瑞典)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种安全的异构多智能体强化学习框架,通过通信正则化和安全过滤器实现协同目标获取任务中的安全与稳定执行。

Comments 7 pages, 4 figures, submitted to the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07972 2026-01-14 cs.CL 57%

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

知晓而不做:在大语言模型中收敛的道德与发散的行为

Jen-tse Huang, Jiantong Qin, Xueli Qiu, Sharon Levy, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) Rutgers University(罗格斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型在价值对齐训练下仍存在知识与行为之间的不一致,通过ValAct-15k数据集发现模型在情境决策上高度一致,但自我报告与实际行为关联较弱。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08012 2026-01-14 cs.SE 50%

Towards Verifiably Safe Tool Use for LLM Agents

面向LLM代理工具使用的可验证安全性

Aarya Doshi, Yining Hong, Congying Xu, Eunsuk Kang, Alexandros Kapravelos, Christian Kästner

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于STPA的框架,通过形式化规范数据流和工具序列,实现LLM代理的可验证安全性,减少对人工标注的依赖。

Comments 4 pages, 1 figure; accepted to ICSE NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏