arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2512.10449 2026-01-07 cs.AI cs.CL cs.CR 81%

When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection

当拒绝转为接受:量化基于LLM的科学评审员对间接提示注入的脆弱性

Devanshu Sahoo, Manish Prasad, Vasudev Majhi, Jahnvi Singh, Vinay Chamola, Yash Sinha, Murari Mandal, Dhruv Kumar

机构 * BITS Pilani KIIT University(KIIT大学)

专题命中 提示注入 :prompt injection(title);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究量化了基于LLM的科学评审系统对间接提示注入攻击的脆弱性,揭示了通过隐藏文本注入和布局感知攻击翻转评审决定的风险,并提出WAVS指标评估此类攻击的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06311 2026-01-07 cs.CR cs.AI 79%

Defending against Indirect Prompt Injection by Instruction Detection

对抗间接提示注入的指令检测

Tongyu Wen, Chenglong Wang, Xiyuan Yang, Haoyu Tang, Yueqi Xie, Lingjuan Lyu, Zhicheng Dou, Fangzhao Wu

机构 * Renmin University of China(中国人民大学) Peking University Shenzhen Graduate School(北京大学深圳研究生院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Sony AI(索尼人工智能) Microsoft Research Asia(微软亚洲研究院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏