arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2512.15353 2025-12-18 cs.CL cs.AI 88%

Adversarial versification in portuguese as a jailbreak operator in LLMs

葡萄牙对抗性韵律作为LLMs中的对抗性操作符

Joao Queiroz

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)

AI总结 研究发现,将提示改写为诗歌能显著提高LLMs的安全漏洞,揭示当前对齐机制的不足,并指出葡萄牙语评估的缺失。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01353 2025-12-18 cs.CR 67%

The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search

恶意知识:通过无害提示编织和自适应树搜索绕过商业大语言模型的安全防护

Rongzhe Wei, Peizhi Niu, Xinjie Shen, Tony Tu, Yifan Li, Ruihan Wu, Eli Chien, Pin-Yu Chen, Olgica Milenkovic, Pan Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 通过无害提示编织和自适应树搜索,研究提出CKA-Agent攻击方法,成功绕过商业大语言模型的安全防护,揭示了知识分解攻击的严重性。

Comments Updated with new baselines and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15081 2025-12-18 cs.CR cs.AI cs.CL 62%

Quantifying Return on Security Controls in LLM Systems

对LLM系统中安全控制的回报进行量化

Richard Helder Moulton, Austin O'Brien, John D. Hastings

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种量化LLM系统安全控制回报的方法,通过模拟攻击和风险评估,比较了ABAC、NER删除和NeMo Guardrails三种安全措施的效果,发现ABAC显著降低风险,RoC达到9.83。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14741 2025-12-18 cs.CR cs.AI 57%

Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs

在LLM持续微调下的持久后门攻击

Jing Cui, Yufei Han, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出P-Trojan算法,研究在LLM持续微调中后门的持久性问题,实验显示其在保持清洁任务准确性的同时实现高持久性。

详情

展开后加载摘要…

URL PDF HTML 收藏