arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-21 至 2025-11-21 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 2 篇

2511.16297 2025-11-21 cs.LG cs.SY eess.SY 57%

Optimizing Operation Recipes with Reinforcement Learning for Safe and Interpretable Control of Chemical Processes

利用强化学习优化操作配方以实现化学过程的安全可控

Dean Brandner, Sergio Lucia

机构 * TU Dortmund University(图卢兹大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出利用强化学习优化操作配方,结合专家知识提升化学过程控制的安全性和可解释性,通过仿真验证其性能优势。

Comments 16 pages, 3 figures, Part of the workshop 'Machine Learning for Chemistry and Chemical Engineering (ML4CCE)' at the ECML24 conference: Link: https://ml4cce-ecml.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15992 2025-11-21 cs.AI 57%

Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis

通过语义漂移分析检测大语言模型中的休眠代理

Shahin Zanbaghi, Ryan Rostampour, Farhan Abid, Salim Al Jarmakani

机构 * School of Computer Science, University of Windsor(计算机科学学院,温莎大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过语义漂移分析与canary基线比较,实现大语言模型中休眠代理的实时检测,准确率达92.5%。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏