arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-26 至 2026-02-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2602.05066 2026-02-26 cs.CR cs.AI 70%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22157 2026-02-26 cs.CL cs.HC cs.LG 62%

Dynamic Personality Adaptation in Large Language Models via State Machines

通过状态机实现大语言模型的动态人格适应

Leon Pielage, Ole Hätscher, Mitja Back, Bernhard Marschall, Benjamin Risse

机构 * Institute for Geoinformatics, University of Münster(地理信息研究所,穆尔斯特大学) Faculty of Mathematics and Computer Science, University of Münster(数学与计算机科学学院,穆尔斯特大学) Department of Psychology, University of Münster(心理学系,穆尔斯特大学) Institute of Medical Education and Student Affairs, University of Münster(医学教育与学生事务研究所,穆尔斯特大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过状态机实现大语言模型动态人格适应的框架,通过模块化评分管道实现人格状态的动态调整,提升在复杂互动场景中的表现。

Comments 22 pages, 5 figures, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 57%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏