arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-25 至 2025-11-25 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 3 篇

2509.15478 2025-11-25 cs.CL 83%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 红队测试 :red teaming(title);safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15998 2025-11-25 cs.CR cs.AI 79%

Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming

AI流量中的隐藏:利用MCP进行LLM驱动的代理红队攻击

Strahinja Janjusevic, Anna Baron Garcia, Sohrob Kazerounian

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

AI总结 本文提出一种基于MCP的C2架构,用于LLM驱动的红队攻击,通过异步并行操作和实时情报共享,减少检测足迹并提升系统整体效能。

Comments 23 pages, 9 figures, 3 tables. Submitted as a full paper for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16466 2025-11-25 cs.CR cs.AI 79%

Incalmo: An Autonomous LLM-assisted System for Red Teaming Multi-Host Networks

Incalmo:一种自主的LLM辅助系统用于多主机网络红队测试

Brian Singer, Keane Lucas, Lakshmi Adiga, Meghna Jain, Lujo Bauer, Vyas Sekar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

AI总结 Incalmo是一种基于LLM的自主红队测试系统,通过高层次任务规划和专用任务代理实现多主机网络攻击,显著提高了红队测试的效率和成功率。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏