arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2603.03637 2026-03-05 cs.CV cs.AI cs.CR 79%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12594 2026-03-05 cs.CR cs.LG 57%

ceLLMate: Sandboxing Browser AI Agents

ceLLMate: 浏览器级沙箱框架

Luoxi Meng, Henry Feng, Ilia Shumailov, Earlence Fernandes

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 ceLLMate通过在HTTP层实现浏览器级沙箱化,有效防止浏览器代理中的提示注入攻击,同时保持较低的延迟开销。

Comments Homepage: https://cellmate-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏