arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-19 至 2025-11-19 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2511.14245 2025-11-19 cs.CL 57%

MuCPT: Music-related Natural Language Model Continued Pretraining

Kai Tian, Yirong Mao, Wendong Bi, Hanjie Wang, Que Wenhui

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14120 2025-11-19 cs.CV cs.AI 57%

Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models

Hao Zhen, Yunxiang Yang, Jidong J. Yang

机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 23 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13970 2025-11-19 cs.AI cs.CV 57%

Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios

Sanjay Acharjee, Abir Khan Ratul, Diego Patino, Md Nazmus Sakib

机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13771 2025-11-19 cs.CR cs.AI 57%

ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning

Shaowei Guan, Yu Zhai, Zhengyu Zhang, Yanze Wang, Hin Chi Kwok

机构 * Centre for Smart Health, School of Nursing, The Hong Kong Polytechnic University(智能健康研究中心、护理学院、香港理工大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系、香港理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系、香港理工大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10819 2025-11-19 cs.CL 57%

LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation

Grace Byun, Swati Rajwal, Jinho D. Choi

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14391 2025-11-19 cs.CV 50%

Enhancing LLM-based Autonomous Driving with Modular Traffic Light and Sign Recognition

Fabian Schmidt, Noushiq Mohammed Kayilan Abdul Nazar, Markus Enzweiler, Abhinav Valada

机构 * Institute for Intelligent Systems(智能系统研究所) Esslingen University of Applied Sciences(应用科学大学埃斯林根) Department of Computer Science(计算机科学系) University of Freiburg(弗赖堡大学)

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09611 2025-11-19 cs.CV 50%

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

Ye Tian, Ling Yang, Jiongfan Yang, Anran Wang, Yu Tian, Jiani Zheng, Haochen Wang, Zhiyang Teng, Zhuochen Wang, Yinjie Wang, Yunhai Tong, Mengdi Wang, Xiangtai Li

机构 * Peking University(北京大学) ByteDance(字节跳动) Princeton University(普林斯顿大学) CASIA(中国科学院自动化研究所) The University of Chicago(芝加哥大学)

专题命中 安全评测 :alignment(abstract)

Comments Project Page: https://tyfeld.github.io/mmadaparellel.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 8 篇

2511.14017 2025-11-19 cs.LG cs.AI 73%

From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs

Erum Mushtaq, Anil Ramakrishna, Satyapriya Krishna, Sattvik Sahai, Prasoon Goyal, Kai-Wei Chang, Tao Zhang, Rahul Gupta

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03858 2025-11-19 cs.AI cs.ET cs.MA 70%

MI9: An Integrated Runtime Governance Framework for Agentic AI

Charles L. Wang, Trisha Singhal, Ameya Kelkar, Jason Tuo

机构 * Barclays, Model Risk Management(巴克莱银行,模型风险管理部门) Columbia University(哥伦比亚大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20606 2025-11-19 cs.CL 70%

Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm

Baixiang Huang, Zhen Tan, Haoran Wang, Zijie Liu, Dawei Li, Ali Payani, Huan Liu, Tianlong Chen, Kai Shu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

Comments AAAI 2026 Oral. 14 pages (including appendix), 11 figures. Code, data, results, and additional resources are available at: https://model-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10704 2025-11-19 cs.AI 70%

The Second Law of Intelligence: Controlling Ethical Entropy in Autonomous Systems

Samih Fadli

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

Comments 12 pages, 4 figures, 1 table, includes Supplementary Materials, simulation code on GitHub (https://github.com/AerisSpace/SecondLawIntelligence )

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14606 2025-11-19 cs.CL cs.LG 62%

Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News Media Using Large Language Models

Shreya Adrita Banik, Niaz Nafi Rahman, Tahsina Moiukh, Farig Sadeque

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18708 2025-11-19 cs.MA cs.AI cs.LG 62%

Skill-Aligned Fairness in Multi-Agent Learning for Collaboration in Healthcare

Promise Osaine Ekpo, Brian La, Thomas Wiener, Saesha Agarwal, Arshia Agrawal, Gonzalo Gonzalez-Pumariega, Lekan P. Molu, Angelique Taylor

机构 * Cornell Tech(康奈尔科技) Microsoft Research(微软研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14693 2025-11-19 cs.CL 57%

Talk, Snap, Complain: Validation-Aware Multimodal Expert Framework for Fine-Grained Customer Grievances

Rishu Kumar Singh, Navneet Shreya, Sarmistha Das, Apoorva Singh, Sriparna Saha

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments To be published in the Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026 Special Track on AI for Social Impact )

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13865 2025-11-19 econ.GN cs.AI q-fin.EC 57%

Randomized Controlled Trials for Conditional Access Optimization Agent

James Bono, Beibei Cheng, Joaquin Lozano

机构 * Microsoft Corporation(微软公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 9 篇

2511.13909 2025-11-19 cs.CV 78%

Mind the Gap: Evaluating LLM Understanding of Human-Taught Road Safety Principles

Chalamalasetti Kranti

机构 * uni-potsdam(波恩大学)

专题命中 其他安全 :safety(title,abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06009 2025-11-19 cs.CV 78%

Continual Learning for Image Captioning through Improved Image-Text Alignment

Bertram Taetz, Gal Bordelius

机构 * IT & Engineering International University of Applied Sciences(IT与工程国际应用科学大学)

专题命中 其他安全 :alignment(title,abstract)

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13761 2025-11-19 cs.DC cs.AI cs.LG 62%

What happens when nanochat meets DiLoCo?

Alexander Acker, Soeren Becker, Sasho Nedelkoski, Dominik Scheinert, Odej Kao, Philipp Wiesner

机构 * Team exalsius(exalsius团队) Technische Universität Berlin(柏林技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments 8pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01293 2025-11-19 cs.CV cs.AI 57%

GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification

Ngoc Bui Lam Quang, Nam Le Nguyen Binh, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Quan Nguyen, Ulas Bagci

机构 * AI VIETNAM(AI越南) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) PTIT Northwestern University(西北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Acccepted in MICCAI Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01916 2025-11-19 cs.RO cs.LG 57%

Generalizable and Fast Surrogates: Model Predictive Control of Articulated Soft Robots using Physics-Informed Neural Networks

Tim-Lukas Habich, Aran Mohammad, Simon F. G. Ehlers, Martin Bensch, Thomas Seel, Moritz Schappler

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments Accepted for publication in IEEE Transactions on Robotics (T-RO) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12511 2025-11-19 cs.CV cs.LG 57%

DINO-Detect: A Simple yet Effective Framework for Blur-Robust AI-Generated Image Detection

Jialiang Shen, Jiyang Zheng, Yunqi Xue, Huajie Chen, Yu Yao, Hui Kang, Ruiqi Liu, Helin Gong, Yang Yang, Dadong Wang, Tongliang Liu

机构 * Sydney AI Center, The University of Sydney(悉尼人工智能中心,悉尼大学) CSIRO, Data61(澳大利亚联邦科学与工业研究组织、Data61) Shanghai Jiao Tong University(上海交通大学) City University of Macau(澳门城市大学) CASIA(中国科学院自动化研究所)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07991 2025-11-19 cs.AI 57%

VSPO: Validating Semantic Pitfalls in Ontology via LLM-Based CQ Generation

Hyojun Choi, Seokju Hwang, Kyong-Ho Lee

专题命中 其他安全 :alignment(abstract);分类 cs.AI

Comments Accepted at AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13918 2025-11-19 cs.HC 50%

Human-centric Maintenance Process Through Integration of AI, Speech, and AR

Parul Khanna, Ravdeep Kour, Ramin Karim

专题命中 其他安全 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13876 2025-11-19 cs.CV 50%

QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning

Xiaoyang Wei, Camille Kurtz, Florence Cloppet

机构 * Laboratoire d'Informatique Paris Descartes (LIPADE), Université Paris Cité (France)(巴黎笛卡尔大学信息学实验室(LIPADE),巴黎城市大学(法国))

专题命中 其他安全 :alignment(abstract)

Comments This work has been submitted to the IEEE ISBI for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏