arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-15 至 2025-10-15 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2502.00757 2025-10-15 cs.CR cs.AI cs.NE 86%

AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement

J Rosser, Jakob Foerster

机构 * University of Oxford(牛津大学) FLAIR University of Oxford(牛津大学FLAIR)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12133 2025-10-15 cs.CL cs.AI 84%

SafeMT: Multi-turn Safety for Multimodal Language Models

Han Zhu, Juntao Dai, Jiaming Ji, Haoran Li, Chengkun Cai, Pengcheng Wen, Chi-Min Chan, Boyuan Chen, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Peking University(北京大学) University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12713 2025-10-15 cs.AI 57%

Towards Robust Artificial Intelligence: Self-Supervised Learning Approach for Out-of-Distribution Detection

Wissam Salhab, Darine Ameyed, Hamid Mcheick, Fehmi Jaafar

机构 * University of Quebec at Chicoutimi(魁北克大学恰普蒂米分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12704 2025-10-15 cs.CV cs.AI 57%

Hybrid Explanation-Guided Learning for Transformer-Based Chest X-Ray Diagnosis

Shelley Zixin Shu, Haozhe Luo, Alexander Poellinger, Mauricio Reyes

机构 * ARTORG Center for Biomedical Engineering Research, University of Bern(ARTORG生物医学工程研究中心,伯恩大学) Inselspital (Bern University Hospital)(Inselspital(伯恩大学医院)) Insel Gruppe Bern Universitätsinstitut für Diagnostische, Interventionelle und Pädiatrische Radiologie(Bern大学诊断、介入和儿科放射学研究所) Department of Radiation Oncology, Inselspital, Bern University Hospital(放射肿瘤科,Inselspital,伯恩大学医院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by iMIMIC at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12316 2025-10-15 cs.CL 57%

Beating Harmful Stereotypes Through Facts: RAG-based Counter-speech Generation

Greta Damo, Elena Cabrio, Serena Villata

机构 * Université Côte d’Azur, CNRS, Inria, I3S, France(法国大学-科蒂-阿祖尔大学、国家科学研究中心、法国国家信息与自动化研究所、I3S研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12287 2025-10-15 cs.CV cs.CL 57%

Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector

Sifan Li, Hongkai Chen, Yujun Cai, Qingwen Ye, Liyang Chen, Junsong Yuan, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) University of Queensland(昆士兰大学) UCLA(加州大学洛杉矶分校) University at Buffalo(布法罗大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12224 2025-10-15 cs.AI 57%

MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs

Yuechun Yu, Han Ying, Haoan Jin, Wenjian Jiang, Dong Xian, Binghao Wang, Zhou Yang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11745 2025-10-15 cs.LG 57%

Think as a Doctor: An Interpretable AI Approach for ICU Mortality Prediction

Qingwen Li, Xiaohang Zhao, Xiao Han, Hailiang Huang, Lanjuan Liu

机构 * School of Information Management & Engineering, Shanghai University of Finance and Economics(上海金融学院信息管理与工程学院) Key Laboratory of Data Intelligence and Management (Beihang University), Ministry of Industry and Information Technology, School of Economics and Management, Beihang University(北京航空航天大学数据智能与管理重点实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12190 2025-10-15 cs.CV 50%

Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos

Shingo Yokoi, Kento Sasaki, Yu Yamaguchi

机构 * Turing Inc.(图灵公司)

专题命中 安全评测 :safety(abstract)

Comments 2nd Place Winner, ICCV 2025 2COOOL Competition

详情

展开后加载摘要…

URL PDF HTML 收藏