arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-19 至 2025-11-19 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2511.11590 2025-11-19 cs.CY cs.AI cs.HC 84%

Embedding Explainable AI in NHS Clinical Safety: The Explainability-Enabled Clinical Safety Framework (ECSF)

Robert Gigiu

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02175 2025-11-19 cs.SD cs.CL eess.AS 79%

Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers

Liang Lin, Miao Yu, Kaiwen Luo, Yibo Zhang, Lilan Peng, Dexian Wang, Xuehai Tang, Yuanhe Zhang, Xikang Yang, Zhenhong Zhou, Kun Wang, Yang Liu

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09904 2025-11-19 cs.AI 70%

CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D

Francis Rhys Ward, Teun van der Weij, Hanna Gábor, Sam Martin, Raja Mehta Moreno, Harel Lidar, Louis Makower, Thomas Jodrell, Lauren Robson

机构 * LawZero Apollo Research Imperial College London(帝国理工学院伦敦校区)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 53 pages, 21 figures, 8 tables. Accepted as a spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21359 2025-11-19 cs.CL cs.AI cs.CY cs.LG econ.GN q-fin.EC 70%

Can Machines Think Like Humans? A Behavioral Evaluation of LLM Agents in Dictator Games

Ji Ma

机构 * Gradel Institute of Charity, New College, University of Oxford(格拉德学院,牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23982 2025-11-19 cs.CV cs.RO 67%

StyleDrive: Towards Driving-Style Aware Benchmarking of End-To-End Autonomous Driving

Ruiyang Hao, Bowen Jing, Haibao Yu, Zaiqing Nie

机构 * AIR, Tsinghua University(空气动力学研究所,清华大学) King’s College London(伦敦国王学院) The University of Manchester(曼彻斯特大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(abstract);safety(abstract)

Comments 25 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23229 2025-11-19 cs.CL cs.AI cs.CY 67%

MCTSr-Zero: Self-Reflective Psychological Counseling Dialogues Generation via Principles and Adaptive Exploration

Hao Lu, Yanchi Gu, Haoyuan Huang, Yulin Zhou, Ningxin Zhu, Chen Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 48 pages, 3 figures. Accepted in AAAI-2026 (Main Technical Track). For code and model, see this https://github.com/JianChengXingYun/Mctsr-Zero

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14166 2025-11-19 cs.CL cs.AI 66%

Selective Weak-to-Strong Generalization

Hao Lang, Fei Huang, Yongbin Li

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.AI

Comments AAAI2025 Special Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13948 2025-11-19 cs.CV cs.CL cs.LG 62%

EchoAgent: Guideline-Centric Reasoning Agent for Echocardiography Measurement and Interpretation

Matin Daghyani, Lyuyang Wang, Nima Hashemi, Bassant Medhat, Baraa Abdelsamad, Eros Rojas Velez, XiaoXiao Li, Michael Y. C. Tsang, Christina Luong, Teresa S. M. Tsang, Purang Abolmaesumi

机构 * University of British Columbia(不列颠哥伦比亚大学) Vancouver General Hospital(温哥华总医院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments 12 pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13809 2025-11-19 cs.LG cs.AI 62%

ScoresActivation: A New Activation Function for Model Agnostic Global Explainability by Design

Emanuel Covaci, Fabian Galis, Radu Balan, Daniela Zaharie, Darian Onchis

机构 * West University of Timișoara, Romania(蒂米șоara西大学) University of Maryland, United States(马里兰大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Paper submitted to ECAI 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13753 2025-11-19 cs.LG cs.AI cs.CR 62%

Robustness of LLM-enabled vehicle trajectory prediction under data security threats

Feilong Wang, Fuqiang Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 2 figures, 11 tables, working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14245 2025-11-19 cs.CL 57%

MuCPT: Music-related Natural Language Model Continued Pretraining

Kai Tian, Yirong Mao, Wendong Bi, Hanjie Wang, Que Wenhui

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14120 2025-11-19 cs.CV cs.AI 57%

Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models

Hao Zhen, Yunxiang Yang, Jidong J. Yang

机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 23 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13970 2025-11-19 cs.AI cs.CV 57%

Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios

Sanjay Acharjee, Abir Khan Ratul, Diego Patino, Md Nazmus Sakib

机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13771 2025-11-19 cs.CR cs.AI 57%

ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning

Shaowei Guan, Yu Zhai, Zhengyu Zhang, Yanze Wang, Hin Chi Kwok

机构 * Centre for Smart Health, School of Nursing, The Hong Kong Polytechnic University(智能健康研究中心、护理学院、香港理工大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系、香港理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系、香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10819 2025-11-19 cs.CL 57%

LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation

Grace Byun, Swati Rajwal, Jinho D. Choi

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14391 2025-11-19 cs.CV 50%

Enhancing LLM-based Autonomous Driving with Modular Traffic Light and Sign Recognition

Fabian Schmidt, Noushiq Mohammed Kayilan Abdul Nazar, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems(智能系统研究所) Esslingen University of Applied Sciences(应用科学大学埃斯林根) Department of Computer Science(计算机科学系) University of Freiburg(弗赖堡大学)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09611 2025-11-19 cs.CV 50%

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

Ye Tian, Ling Yang, Jiongfan Yang, Anran Wang, Yu Tian, Jiani Zheng, Haochen Wang, Zhiyang Teng, Zhuochen Wang, Yinjie Wang, Yunhai Tong, Mengdi Wang, Xiangtai Li

机构 * Peking University(北京大学) ByteDance(字节跳动) Princeton University(普林斯顿大学) CASIA(中国科学院自动化研究所) The University of Chicago(芝加哥大学)

专题命中 安全评测 :alignment(abstract)

Comments Project Page: https://tyfeld.github.io/mmadaparellel.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏