arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2601.07072 2026-01-13 cs.CR cs.AI 79%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06403 2026-01-13 cs.CL 57%

Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding

超越助手的引导模型:通过对比解码控制系统提示强度

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏