arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-26 至 2026-01-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2509.14558 2026-01-26 cs.CR cs.AI cs.CL 84%

LLM Jailbreak Detection for (Almost) Free!

几乎免费的LLM劫持检测

Guorui Chen, Yifan Xia, Xiaojun Jia, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Nanyang Technological University(南洋理工大学) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种几乎免费的LLM劫持检测方法,通过调整输入指令和logits温度来提高检测性能,无需额外计算成本。

Comments EMNLP 2025 (Findings) https://aclanthology.org/2025.findings-emnlp.309/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 57%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11020 2026-01-26 cs.CR cs.AI 57%

Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis

医疗AI架构中的数据中毒漏洞:安全威胁分析

Farhad Abtahi, Fernando Seoane, Iván Pau, Mario Vega-Barbas

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 医疗AI面临数据中毒威胁,需多层防御措施和可解释系统以提高安全性。

Journal ref J Med Internet Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏