arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 537 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 537 篇

2511.00230 2025-11-25 cs.HC cs.AI 57%

Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI

神经透明:用于预测模型行为的机制可解释性接口以实现个性化AI

Sheer Karny, Anthony Baez, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 本研究提出神经透明接口,通过可视化语言模型内部结构帮助用户预测AI行为,提升信任并促进更安全的人机交互。

Comments SK and AB are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11519 2025-11-06 cs.CV cs.CL 57%

Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models

Hao Cheng, Erjia Xiao, Yichi Wang, Lingfeng Zhang, Qiang Zhang, Jiahang Cao, Kaidi Xu, Mengshu Sun, Xiaoshuai Hao, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

Comments This paper is accepted by IJCAI2025 Workshop on Deepfake Detection, Localization, and Interpretability as Best Student Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20190 2025-10-24 cs.AI cs.IT math.IT 57%

The Lock-In Phase Hypothesis: Identity Consolidation as a Precursor to AGI

Marcelo Maciel Amaral, Raymond Aschheim

机构 * Gauge Freedom, Inc. (Public Benefit Corporation)(Gauge Freedom公司)

专题命中 提示注入 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12188 2025-09-16 cs.CR cs.LG 57%

Multi-Agent Systems Execute Arbitrary Malicious Code

Harold Triedman, Rishi Jha, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

Comments 33 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23643 2025-09-04 cs.CR cs.AI 57%

Securing AI Agents with Information-Flow Control

Manuel Costa, Boris Köpf, Aashish Kolluri, Andrew Paverd, Mark Russinovich, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06418 2025-08-11 cs.CL 57%

Quantifying Conversation Drift in MCP via Latent Polytope

Haoran Shi, Hongwei Yao, Shuo Shao, Shaopeng Jiao, Ziqi Peng, Zhan Qin, Cong Wang

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15330 2025-07-22 cs.AI 57%

QSAF: A Novel Mitigation Framework for Cognitive Degradation in Agentic AI

Hammad Atta, Muhammad Zeeshan Baig, Yasir Mehmood, Nadeem Shahzad, Ken Huang, Muhammad Aziz Ul Haq, Muhammad Awais, Kamal Ahmed

机构 * Qorvex Consulting(Qorvex咨询公司) Wentworth Institute of Higher Education(文森特高等教育学院) RAN Verification NOKIA, Germany(NOKIA德国RAN验证) Roshan Consulting(罗尚咨询) Skylink Antenna(Skylink天线) Eviden Saudi Arabia(沙特Eviden) Deloitte Enterprise Risk | Internal Audit | Technology GRC(德勤企业风险管理|内部审计|技术治理)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14860 2025-07-22 cs.CY physics.ed-ph 57%

Strategic Integration of AI Chatbots in Physics Teacher Preparation: A TPACK-SWOT Analysis of Pedagogical, Epistemic, and Cybersecurity Dimensions

N. Mohammadipour

专题命中 提示注入 :prompt injection(abstract);分类 cs.CY

Comments 34 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02644 2025-06-02 cs.CR cs.AI 57%

Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents

Hanrong Zhang, Jingyuan Huang, Kai Mei, Yifei Yao, Zhenting Wang, Chenlu Zhan, Hongwei Wang, Yongfeng Zhang

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22852 2025-05-30 cs.CR cs.AI 57%

Operationalizing CaMeL: Strengthening LLM Defenses for Enterprise Deployment

Krti Tallam, Emma Miller

机构 * SentinelAI

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21029 2025-05-01 cs.CR cs.AI 57%

PICO: Secure Transformers via Robust Prompt Isolation and Cybersecurity Oversight

Ben Goertzel, Paulos Yibelo

机构 * Ben Goertzel Paulos Yibelo

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19277 2025-04-29 cs.AI cs.SE 57%

Small Models, Big Tasks: An Exploratory Empirical Study on Small Language Models for Function Calling

Ishan Kavathekar, Raghav Donakanti, Ponnurangam Kumaraguru, Karthik Vaidhyanathan

机构 * IIIT-Hyderabad(IIIT- Hyderabad)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

Comments Accepted at EASE 2025 AI Models and Data Evaluation track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13919 2025-02-12 cs.CR cs.AI 57%

LLM Agent Honeypot: Monitoring AI Hacking Agents in the Wild

Reworr, Dmitrii Volkov

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18410 2025-02-06 cs.CL 57%

Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting

Bowen Xu, Shaoyu Wu, Kai Liu, Lulu Hu

专题命中 提示注入 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17692 2024-10-16 cs.CL 57%

Mitigating the Influence of Distractor Tasks in LMs with Prior-Aware Decoding

Raymond Douglas, Andis Draguns, Tomáš Gavenčiak

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00925 2024-08-05 cs.CR cs.AI 57%

WHITE PAPER: A Brief Exploration of Data Exfiltration using GCG Suffixes

Victor Valbuena

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

Comments 8 pages, 8 figures. Conducted as part of employment at Microsoft Corporation

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09728 2024-02-16 cs.CR cs.AI 57%

AbuseGPT: Abuse of Generative AI ChatBots to Create Smishing Campaigns

Ashfak Md Shibli, Mir Mehedi A. Pritom, Maanak Gupta

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

Comments 6 pages, 12 figures, published in ISDFS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18609 2023-12-01 cs.CL 57%

ArthModel: Enhance Arithmetic Skills to Large Language Model

Yingdi Guo

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

Comments 7 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 50%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 提示注入 :prompt injection(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 50%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21824 2026-07-27 cs.CR 新提交 50%

Protocol-Level Attacks on Agentic Commerce Platforms: A Cross-Platform Taxonomy, AIP-Bench, and Unified Defense

对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御

Yedidel Louck

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10080 2026-07-14 cs.IR 新提交 50%

The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment

多语言和关键词对抗性注入对大语言模型相关性判断的影响

Nguyen Khoi Vo, Duy Duong Tuong, Oleg Zendel, Mark Sanderson

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09938 2026-07-14 cs.HC 新提交 50%

"Code Is Cheap. Show Me the Talk.": Lessons from Teaching and Managing AI Coding Tool Usage in a Visualization Course

“代码很廉价。给我看看讲解。”:可视化课程中教授和管理人工智能编码工具使用的经验教训

Zhongzheng Xu, Taehyun Yang, Fumeng Yang

专题命中 提示注入 :prompt injection(abstract)

AI总结 在可视化课程中分享管理和教授人工智能使用的经验,实施提示注入等,发现学生使用情况及问题,指出需明确人工智能使用界限、提示指导,教学生质疑并适应通用设计。

Comments 5 Figures, 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07433 2026-07-09 cs.CR 新提交 50%

Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting

警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击

Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。

Comments Website: https://sites.google.com/view/agentic-botnets/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28893 2026-07-07 cs.SE cs.CR 50%

Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities

迈向揭示与修复LLM-in-the-Loop漏洞

Yujie Ma, Jialin Rong, Chenxi Yang, Lili Quan, Jin Wen, Xiaofei Xie, Yongqiang Lyu, Qiang Hu

专题命中 提示注入 :prompt injection(abstract)

AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02811 2026-07-03 cs.NI cs.SY eess.SY 版本更新 50%

Tool Use as Action: Towards Agentic Control in Mobile Core Networks

工具使用作为行动:迈向移动核心网络中的智能体控制

Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi, Xueli An

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。

Comments Accepted for presentation at IEEE PIMRC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 50%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28791 2026-06-30 cs.SE 50%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22779 2026-06-23 cs.CR cs.CV 新提交 50%

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings

DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示

Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 提示注入 :prompt injection(abstract)

AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 50%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏