arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-22 至 2025-12-22 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2512.01037 2025-12-22 cs.CL cs.AI 81%

When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals

当安全阻止感知:测量大语言模型拒绝中的语义混淆

Riad Ahmed Anonto, Md Labid Al Nahiyan, Md Tanvir Hassan

机构 * Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义混淆的概念及测量框架,通过ParaGuard语料库和三种模型无关指标,揭示大语言模型拒绝中的局部不一致问题,帮助开发者优化安全与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10716 2025-12-22 eess.SY cs.SY math.OC 78%

Combinatorial Control Barrier Functions: Nested Boolean and p-choose-r Compositions of Safety Constraints

组合控制障碍函数:安全约束的嵌套布尔和p-choose-r组合

Pio Ong, Haejoon Lee, Tamas G. Molnar, Dimitra Panagou, Aaron D. Ames

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出组合控制障碍函数框架,用于处理安全约束的嵌套布尔和p-choose-r组合,通过可扩展的方式确保系统安全性。

Comments 6 pages, 3 figures, Accepted for publication in Control System Letters (L-CSS) with the possibility of presenting at the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19041 2025-12-22 cs.CL cs.AI cs.CV cs.LG cs.MM 75%

LookAhead Tuning: Safer Language Models via Partial Answer Previews

LookAhead Tuning: 通过部分答案预览实现更安全的语言模型

Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Lei Liang, Zhiqiang Zhang, Jun Zhou, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LookAhead Tuning通过预览部分答案前缀,有效保持语言模型在微调过程中的安全性,同时不损害下游任务的性能。

Comments WSDM 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏