arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-16 至 2026-01-16 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2601.10141 2026-01-16 cs.LG cs.AI 86%

Understanding and Preserving Safety in Fine-Tuned LLMs

理解并保持在微调大语言模型中的安全性

Jiawen Zhang, Yangfan Hu, Kejia Chen, Lipeng He, Jiachen Ma, Jian Lou, Dan Li, Jian Liu, Xiaohu Yang, Ruoxi Jia

机构 * Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Waterloo(滑铁卢大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出安全保持微调(SPF)方法,通过分析安全性与实用性梯度的几何关系,有效解决微调过程中安全性与实用性之间的矛盾,保持模型性能并恢复预训练的安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 83%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09740 2026-01-16 cs.RO cs.AI cs.SE 79%

Formal Safety Guarantees for Autonomous Vehicles using Barrier Certificates

使用屏障证书为自动驾驶车辆提供形式安全保证

Oumaima Barhoumi, Mohamed H Zaki, Sofiène Tahar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合屏障证书与时间到碰撞度量的形式验证安全框架,通过SMT求解器和自适应控制机制,提升自动驾驶车辆的安全性和可解释性。

Comments Accepted to AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14375 2026-01-16 cs.LG cs.AI 62%

Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards

通过离线强化学习与混合动作和临床对齐奖励推进安全机械通气

Muhammad Hamza Yousuf, Jason Li, Sahar Vahdati, Raphael Theilen, Jakob Wittenstein, Jens Lehmann

机构 * Amazon(亚马逊)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习与混合动作空间的AI方法,通过临床对齐奖励函数优化机械通气设置,提升安全性和临床效果。

Comments Accepted to AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 57%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏