arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2512.23557 2025-12-30 cs.CR cs.AI 86%

Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks

迈向可信的代理AI:一种多模态框架用于防止提示注入攻击

Toqeer Ali Syed, Mishal Ateeq Almutairi, Mahmoud Abdel Moaty

机构 * Faculty of Computer and Information System(计算机与信息系统系) Islamic University of Madinah(麦地那伊斯兰大学) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(title);分类 cs.AI

AI总结 本文提出一种多模态框架,通过溯源感知机制防止代理AI中的提示注入攻击,提升系统安全性和稳定性。

Comments It is accepted in a conference paper, ICCA 2025 in Bahrain on 21 to 23 December

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23684 2025-12-30 cs.CL cs.AI 81%

Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing

多语言隐藏提示注入攻击对基于LLM的学术评审的影响

Panagiotis Theocharopoulos, Ajinkya Kulkarni, Mathew Magimai. -Doss

机构 * International School of Athens(希腊国际学校) Idiap Research Institute(Idiap研究 institute)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,多语言隐藏提示注入攻击对LLM基于的学术评审系统产生显著影响,尤其在英语、日语和中文中表现明显,而阿拉伯语则影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏