arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-07-25 至 2025-07-25 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2505.02581 2025-07-25 cs.AI 79%

Neurodivergent Influenceability as a Contingent Solution to the AI Alignment Problem

Alberto Hernández-Espinosa, Felipe S. Abrahão, Olaf Witkowski, Hector Zenil

机构 * Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新) London Institute for Healthcare Engineering(伦敦医疗工程研究所) University of Tokyo(东京大学) The Arrival Institute(抵达研究所) Cancer Research Group(癌症研究组) The Francis Crick Institute(弗朗西斯·克里克研究所) Cross Labs(交叉实验室) King’s Institute for Artificial Intelligence(国王人工智能研究所) King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17256 2025-07-25 cs.CL 70%

Weak-to-Strong Jailbreaking on Large Language Models

Xuandong Zhao, Xianjun Yang, Tianyu Pang, Chao Du, Lei Li, Yu-Xiang Wang, William Yang Wang

机构 * Sea AI Lab, Singapore(新加坡海智实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17922 2025-07-25 cs.LG cs.AI 62%

From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models

Jessica Quaye, Charvi Rastogi, Alicia Parrish, Oana Inel, Minsuk Kahng, Lora Aroyo, Vijay Janapa Reddi

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏