arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 537 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 537 篇

2603.28345 2026-07-07 cs.SE cs.AI 版本更新 57%

Reachability Across the NL/PL Boundary: A Taxonomy-Driven Dataflow Model for LLM-Integrated Applications

当代码遇见自然语言:基于分类法的LLM集成应用信息流分析

Zihao Xu, Xiao Cheng, Ruijie Meng, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出一种基于定量信息流理论的分类法,定义24个标签以跨越LLM调用的自然语言与编程语言边界,实现信息流分析,并在污点传播和程序切片中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 57%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 57%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29142 2026-06-30 cs.CY cs.SE 57%

Agent Security Meets Regulatory Reality -- A Practitioner Systematization of Autonomous-Agent Threats and Controls in Regulated Financial Systems

代理安全遇上监管现实——受监管金融系统中自主代理威胁与控制的从业者系统化

Krishna Mohan, Guda Nagavenkata Srinivasa

专题命中 提示注入 :prompt injection(abstract);分类 cs.CY

AI总结 本文基于生产经验,将六类代理威胁映射到美欧金融监管义务,提出四种架构模式将手动流程自动化处理约80%案例,并报告三项负面结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI 57%

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交 57%

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 57%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 57%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15057 2026-06-23 cs.CR cs.AI 新提交 57%

AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents

AutoDojo: 自适应攻击揭示LLM智能体的浅层防御与用户未指定限制

Xinhang Ma, Taoran Li, Chaowei Xiao, Zhiyuan Yu, Ning Zhang, Yevgeniy Vorobeychik

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对间接提示注入防御的静态基准不足,提出自适应攻击框架AutoDojo,通过迭代优化注入突破多数防御,并揭示动作开放任务的结构性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04329 2026-06-23 cs.CR cs.AI 版本更新 57%

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10104 2026-06-16 cs.CR cs.AI cs.IR 交叉投稿 57%

Phishing Email Detection Using Large Language Models

使用大型语言模型检测钓鱼邮件

Najmul Hasan, Prashanth BusiReddyGari, Haitao Zhao, Yihao Ren, Jinsheng Xu, Shaohu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出LLMPEA框架,利用GPT-4o等三种前沿LLM检测钓鱼邮件,准确率超90%,并揭示对抗攻击、提示注入和多语言攻击的漏洞。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04981 2026-06-15 cs.CV cs.LG 版本更新 57%

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的人口统计偏见

NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

机构 * KAIST(韩国科学技术院) HKUST (GZ)(香港科技大学(广州))

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 研究LLM增强的文本到图像系统在提示扩展中引入隐性人口统计偏见的问题,提出无训练的去偏框架FairPro,通过自适应生成公平性指令减少人口统计差异。

Comments Project page: https://fairpro-t2i.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13038 2026-06-12 cs.AI 新提交 57%

Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior

Nous: 提取并注入预测市场行为背后认知的尝试

Haowei Qian

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM代理在预测市场中认知同质化问题,提出Nous方法从真实交易行为提取八维行为画像并注入提示,发现提取部分有效但提示注入无法传递认知多样性。

Comments 37 pages, 1 figure, 7 tables. Reproduction artifacts (code, frozen profiles, prompts, model outputs): https://github.com/WillChienT/nous-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09923 2026-06-05 cs.AI 57%

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Toronto & Vector Institute(多伦多大学及向量研究所) ETH Zurich(苏黎世联邦理工学院) AI Security Company(人工智能安全公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04141 2026-06-04 cs.CR cs.AI 57%

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

当场抓获(激活):面向LLM智能体的凭证泄露预输出和多轮检测

Kargi Chauhan, Pratibha Revankar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究通过激活探针、蜜令令牌和累积信息流追踪三种互补防御方法,在预输出和多轮对话中检测LLM智能体的凭证泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03777 2026-06-03 cs.AI cs.CR q-fin.RM 57%

From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the CER Framework

从控制边界到保险索赔:通过CER框架重构AI中介损失

Alex Leung, Rex Zhang, Kentaroh Toyoda, SiewMei Loh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出CER框架(控制边界、证据重构、保险响应),用于诊断和重构由生成式或代理式AI系统导致的损失,以支持保险索赔。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23593 2026-06-02 cs.AI 57%

When AI reviews science: Can we trust the referee?

当AI评审科学:我们能信任审稿人吗?

Jialiang Wang, Yuchen Liu, Hang Xu, Kaichun Hu, Shimin Di, Wangze Ni, Linan Yue, Min-Ling Zhang, Kui Ren, Lei Chen

机构 * School of Electronic Engineering, Southeast University(东南大学电子工程学院) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对AI审稿的安全性和可靠性问题,本文通过分类攻击类型并实验验证声望框架、断言强度、反驳谄媚和上下文投毒对评分的影响,为评估AI同行评审的可靠性提供基线。

Journal ref The Innovation Informatics 2:100030 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30454 2026-06-01 cs.CR cs.AI 57%

The Surface You Test Is Not the Surface That Breaks

测试的表面并非断裂的表面

Shifat E Arman, Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文发现工具增强的LLM代理对提示注入的脆弱性依赖于攻击表面(工具输出 vs 工具描述),提出自适应攻击率并强调评估需报告每个表面的脆弱性。

Comments 8 Figures, 8 Tables, Under Review at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29737 2026-05-29 cs.CR cs.CL cs.SE 57%

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

最小提示扰动导致代码漏洞:编码大语言模型中的提示脆弱性和隐藏状态信号

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO, Le Foyer, Techno-Pôle 1, Sierre, Switzerland(瑞士苏黎世联邦理工学院(HES-SO)技术园区1号,西尔尔) Cyber-Defence Campus, armasuisse Science and Technology, Thun, Switzerland(瑞士图恩 Cyber-Defence 营地,armasuisse 科学与技术)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文通过token级突变实验,发现微小提示扰动(如单字符变化)即可使LLM生成代码从安全变为脆弱,并利用隐藏状态分析揭示输入处理漏洞比安全默认值漏洞更可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26506 2026-05-29 cs.CL cs.CR 57%

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

SafeReview: 防御基于LLM的评审系统免受对抗性隐藏提示攻击

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Backes, Yue Zhang, Linyi Yang

机构 * CISPA Westlake University(西交利物浦大学) Southern University of Science and Technology(南方科技大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 提出SafeReview,一种共进化对抗训练框架,通过联合训练生成器和防御者模型,增强基于LLM的同行评审系统对对抗性隐藏提示的鲁棒性。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 57%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15338 2026-05-19 cs.CR cs.AI 57%

Hidden in Memory: Sleeper Memory Poisoning in LLM Agents

记忆中的隐患:LLM代理中的潜伏记忆污染

Sidharth Pulipaka, Stanislau Hlebik, Leonidas Raghav, Sahar Abdelnabi, Vyas Raina, Ivaxi Sheth, Mario Fritz

机构 * SPAR ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) APTA CISPA Helmholtz Center for Information Security(信息安全海德堡中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理中由于持久化内存带来的安全风险,提出并研究了潜伏记忆污染攻击,该攻击通过操控外部上下文使代理存储伪造的记忆,影响后续交互,实验显示攻击可跨多次对话持续生效。

Comments 86 pages, 60 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16407 2026-05-19 cs.LO cs.CL cs.CR cs.PL 57%

Proof-Carrying Certificates for LLM Pipelines: A Trust-Boundary Architecture

为LLM流水线提供证明携带证书:一种信任边界架构

George Koomullil

机构 * Ascendr, Inc.(Ascendr公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出一种验证大型语言模型周围确定性结构计算的框架,扩展了Lean 4信任边界架构至现代LLM流水线的通用接口。核心贡献包括三个证书家族和两个操作符,用于高风险部署中的专利检索、金融监管等场景。

Comments 83 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 57%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 57%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 57%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11032 2026-05-13 cs.CR cs.AI 57%

Portable Agent Memory: A Protocol for Cryptographically-Verified Memory Transfer Across Heterogeneous AI Agents

可携带代理记忆:一种用于跨异构AI代理加密验证记忆传输的协议

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出Portable Agent Memory协议,通过结构化内存模型、基于能力的访问控制、抗注入重水化协议和JSON优先的序列化格式,实现跨异构AI代理的安全记忆传输。

Comments 8 pages, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 57%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 57%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏