arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-24 至 2025-11-24 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 12 篇

2510.22300 2025-11-24 cs.CR cs.AI cs.CV 79%

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

T2I-RiskyPrompt:用于评估、攻击和防御文本到图像模型安全性的基准

Chenyu Zhang, Tairen Zhang, Lanjun Wang, Ruidong Chen, Wenhui Li, Anan Liu

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 T2I-RiskyPrompt提出了一种用于评估文本到图像模型安全性的综合基准,通过层次化风险分类和原因驱动的检测方法,全面评估了多种模型和防御策略的安全性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16823 2025-11-24 cs.LG cs.AI cs.HC 73%

Monte Carlo Expected Threat (MOCET) Scoring

蒙特卡洛预期威胁(MOCET)评分

Joseph Kim, Saahith Potluri

机构 * Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 MOCET是一种可解释且双重可扩展的指标,用于量化大语言模型在现实世界中的安全风险。

Comments Accepted to NeurIPS 2025 BioSafe GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 73%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16699 2025-11-24 cs.CL cs.AI 62%

Detecting and Steering LLMs' Empathy in Action

检测和引导大语言模型的同理心行为

Juan P. Cadile

机构 * Department of Philosophy University of Rochester(哲学系罗切斯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比提示检测和引导大语言模型的同理心行为,发现不同模型在引导效果和鲁棒性上存在差异。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11393 2025-11-24 cs.SE cs.AI cs.CR cs.MA 61%

LLM-Agent-UMF: LLM-based Agent Unified Modeling Framework for Seamless Design of Multi Active/Passive Core-Agent Architectures

LLM-Agent-UMF: 基于大语言模型的代理统一建模框架,用于无缝设计多主动/被动核心代理架构

Amine Ben Hassouna, Hana Chaari, Ines Belhaj

机构 * Mediterranean Institute of Technology(地中海技术研究所) South Mediterranean University(南地中海大学) National School of Computer Science(国家计算机科学学校) University of Manouba(曼努巴大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI;trustworthy(comments)

AI总结 LLM-Agent-UMF提出了一种基于大语言模型的代理统一建模框架,用于设计多主动/被动核心代理架构,解决了现有架构的模块化和术语不一致问题。

Comments 39 pages, 19 figures, 3 tables. Published in Information Fusion, Volume 127, March 2026, 103865. Part of the special issue "Data Fusion Approaches in Data-Centric AI for Developing Trustworthy AI Systems"

Journal ref Information Fusion 127 (2026) 103865

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21651 2025-11-24 cs.AI 57%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01588 2025-11-24 cs.LG cs.CV 57%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27629 2025-11-24 cs.CR cs.AI 57%

Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation Models

开放权重生物基础模型的生物风险评估最佳实践

Boyi Wei, Zora Che, Nathaniel Li, Udari Madhushani Sehwag, Jasper Götting, Samira Nedungadi, Julian Michael, Summer Yue, Dan Hendrycks, Peter Henderson, Zifan Wang, Seth Donoughe, Mantas Mazeika

机构 * Scale AI SecureBio Center for AI Safety(AI安全中心) Princeton University(普林斯顿大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出BioRiskEval框架,用于评估开放权重生物基础模型的鲁棒性,揭示现有数据过滤方法的局限性,并强调需进一步研究安全策略。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13290 2025-11-24 cs.PL cs.AI 57%

Towards Formal Verification of LLM-Generated Code from Natural Language Prompts

向自然语言提示生成的LLM代码形式验证

Aaron Councilman, David Jiahao Fu, Aryan Gupta, Chengxiao Wang, David Grove, Yu-Xiong Wang, Vikram Adve

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Astrogator通过形式查询语言和知识库实现对LLM生成代码的正确性验证,验证准确率达83%。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08636 2025-11-24 cs.LG cs.CV 57%

Birds look like cars: Adversarial analysis of intrinsically interpretable deep learning

鸟类看起来像汽车:对内在可解释深度学习的对抗分析

Hubert Baniecki, Przemyslaw Biecek

机构 * University of Warsaw(华沙大学) Warsaw University of Technology(华沙技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了内在可解释深度学习模型的对抗性风险,通过原型操纵和后门攻击揭示其不可解释性,并探讨了提升模型鲁棒性和对齐性的必要性。

Comments Accepted by Machine Learning

Journal ref Machine Learning (2025) 114:284

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17448 2025-11-24 cs.CV 50%

MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models

MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型

Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong

机构 * The City University of New York, CUNY(纽约城市大学) Nanyang Technological University(南洋理工大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Technology Sydney(悉尼技术大学) Data61, CSIRO(CSIRO数据61研究所) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 安全评测 :safety(abstract)

AI总结 MMT-ARD通过多教师对抗蒸馏提升视觉-语言模型的对抗鲁棒性,实验显示鲁棒精度提升4.32%,训练效率提高2.3倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18267 2025-11-24 cs.HC 50%

From Checking to Sensemaking: A Caregiver-in-the-Loop Framework for AI-Assisted Task Verification in Dementia Care

从验证到理解:一种护理人员在循环框架中的AI辅助任务验证方法用于痴呆症护理

Joy Lai, Kelly Beaton, David Black, Bing Ye, Alex Mihailidis

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种护理人员在循环框架中的AI辅助任务验证方法,通过生成式AI支持照护者主导的任务验证,提升痴呆症护理中的信任与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏