arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-06 至 2026-01-06 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2601.01836 2026-01-06 cs.AI cs.CY 86%

COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs

COMPASS:一个评估大语言模型在组织特定政策对齐性的框架

Dasol Choi, DongGeon Lee, Brigitta Jesica Kartono, Helena Berndt, Taeyoun Kwon, Joonwon Jang, Haon Park, Hwanjo Yu, Minsuk Kahng

机构 * AIM Intelligence(AIM智能科技) BMW Group(宝马集团) Yonsei University(延世大学) POSTECH Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 COMPASS框架通过评估大语言模型在组织特定政策下的对齐性,揭示了模型在合规性与对抗性鲁棒性上的显著差异,为组织AI安全提供了关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20293 2026-01-06 cs.CL 70%

AprielGuard

AprielGuard:一个统一安全与对抗防御的8B参数模型

Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana, Lakshmi Sirisha Chodisetty, Sourav Sharma, Abhigya Verma, Abhishek Bhardwaj, Debasish Kanhar, Aakash Bhagat, Khalil Slimi, Seganrasan Subramanian, Sathwik Tejaswi Madhusudhan, Ranga Prasad Chenna, Srinivas Sunkara

机构 * AprielGuard

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01800 2026-01-06 cs.LG cs.AI 62%

Sparse Threats, Focused Defense: Criticality-Aware Robust Reinforcement Learning for Safe Autonomous Driving

稀疏威胁,聚焦防御:面向安全自动驾驶的关键性感知鲁棒强化学习

Qi Wei, Junchao Fan, Zhao Yang, Jianhua Wang, Jingkai Mao, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University, P.R.China(北京智能交通安全与隐私重点实验室,北京交通大学,中华人民共和国)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CARRL方法,通过关键性感知的对抗训练,提升自动驾驶中稀疏安全关键风险的鲁棒性,实验显示碰撞率降低22.66%。

详情

展开后加载摘要…

URL PDF HTML 收藏