arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-17 至 2025-11-17 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2511.10810 2025-11-17 cs.AI 79%

HARNESS: Human-Agent Risk Navigation and Event Safety System for Proactive Hazard Forecasting in High-Risk DOE Environments

Ran Elgedawy, Sanjay Das, Ethan Seefried, Gavin Wiggins, Ryan Burchfield, Dana Hewit, Sudarshan Srinivasan, Todd Thomas, Prasanna Balaprakash, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10770 2025-11-17 cs.RO 75%

From Framework to Reliable Practice: End-User Perspectives on Social Robots in Public Spaces

Samson Oruma, Ricardo Colomo-Palacios, Vasileios Gkioulos

机构 * Department of Computer Science and Communication(计算机科学与通信系) Østfold University College(奥斯Fold大学学院) Escuela Técnica Superior de Ingenieros Informáticos(信息工程高级技术学院) Universidad Politécnica de Madrid(马德里理工大学) Department of Information Security and Communication Technology(信息安全与通信技术系) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17418 2025-11-17 cs.HC cs.SE 75%

What Needs Attention? Prioritizing Drivers of Developers' Trust and Adoption of Generative AI

Rudrajit Choudhuri, Bianca Trinkenreich, Rahul Pandita, Eirini Kalliamvakou, Igor Steinmacher, Marco Gerosa, Christopher Sanchez, Anita Sarma

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments Journal extension of ICSE 2025 paper (arXiv:2409.04099)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10665 2025-11-17 cs.CL cs.AI cs.LG 67%

Guarding the Meaning: Self-Supervised Training for Semantic Robustness in Guard Models

Cristina Pinneri, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11066 2025-11-17 cs.CV cs.AI cs.CL 62%

S2D-ALIGN: Shallow-to-Deep Auxiliary Learning for Anatomically-Grounded Radiology Report Generation

Jiechao Gao, Chang Liu, Yuangang Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10067 2025-11-17 cs.AI cs.CL 62%

Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning

Yuxuan Zhou, Yubin Wang, Bin Wang, Chen Ning, Xien Liu, Ji Wu, Jianye Hao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Huawei Noah’s Ark Lab(华为诺亚实验室) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10002 2025-11-17 cs.CL cs.AI 62%

PustakAI: Curriculum-Aligned and Interactive Textbooks Using Large Language Models

Shivam Sharma, Riya Naik, Tejas Gawas, Heramb Patil, Kunal Korgaonkar

机构 * Department of Computer Science and Information Systems(计算机科学与信息系统系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19238 2025-11-17 cs.AI cs.CY 62%

Designing AI-Agents with Personalities: A Psychometric Approach

Muhua Huang, Xijuan Zhang, Christopher Soto, James Evans

机构 * Stanford University(斯坦福大学) University of Chicago Knowledge Lab(芝加哥大学知识实验室) Chicago Center for Computational Social Science(芝加哥计算社会科学中心) York University(约克大学) Colby College(科尔比学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11252 2025-11-17 cs.AI 57%

UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14720 2025-11-17 cs.LG cs.CV 57%

SGLP: A Similarity Guided Fast Layer Partition Pruning for Compressing Large Deep Models

Yuqi Li, Yao Lu, Junhao Dong, Zeyu Dong, Chuanguang Yang, Xin Yin, Yihao Chen, Jianping Gou, Yingli Tian, Tingwen Huang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Zhejiang University of Technology(浙江工业大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Southwest University(西南大学) The City College of New York(纽约城市学院) Shenzhen University of Advanced Technology(深圳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10925 2025-11-17 cs.AI 57%

Multi-Agent Legal Verifier Systems for Data Transfer Planning

Ha-Thanh Nguyen, Wachara Fungwacharakorn, Ken Satoh

机构 * Center of Juris-Informatics, Joint Support-Center for Data Science Research, ROIS, Tokyo, Japan(司法信息中心、数据科学研究联合支持中心、ROIS、东京、日本) Research and Development Center for Large Language Models, NII, ROIS, Tokyo, Japan(大语言模型研究与开发中心、日本信息机构、ROIS、东京、日本)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08464 2025-11-17 cs.CV cs.AI 57%

Contrastive Integrated Gradients: A Feature Attribution-Based Method for Explaining Whole Slide Image Classification

Anh Mai Vu, Tuan L. Vo, Ngoc Lam Quang Bui, Nam Nguyen Le Binh, Akash Awasthi, Huy Quoc Vo, Thanh-Huy Nguyen, Zhu Han, Chandra Mohan, Hien Van Nguyen

机构 * ECE Department, University of Houston(德克萨斯大学休斯顿分校电子与计算机工程系) Information Technology, HCMC University of Technology and Education(胡志明市技术与教育大学信息技术系) VN-UK Institute for Research and Executive Education, The University of Da Nang(越南-英国研究与管理教育研究所,丹那大学) Ho Chi Minh City University of Science, Vietnam National University(胡志明市科学大学,越南国家大学) Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学计算生物学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08954 2025-11-17 cs.CY cs.HC 57%

Should you use LLMs to simulate opinions? Quality checks for early-stage deliberation

Terrence Neumann, Maria De-Arteaga, Sina Fazelpour

专题命中 安全评测 :alignment(abstract);分类 cs.CY

Comments Accepted to AAAI AI for Social Impact (AISI), 2026. This version includes Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11356 2025-11-17 cs.CR 50%

SEAL: Subspace-Anchored Watermarks for LLM Ownership

Yanbo Dai, Zongjie Li, Zhenlan Ji, Shuai Wang

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10668 2025-11-17 cs.CV 50%

A Mathematical Framework for AI Singularity: Conditions, Bounds, and Control of Recursive Improvement

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) Loughborough University London(洛桑大学伦敦分校) Estonian Business School(爱沙尼亚商业学院)

专题命中 安全评测 :safety(abstract)

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00290 2025-11-17 cs.DB 50%

NOMAD -- Navigating Optimal Model Application to Datastreams

Ashwin Gerard Colaco, Sharad Mehrotra, Michael J De Lucia, Kevin Hamlen, Murat Kantarcioglu, Latifur Khan, Ananthram Swami, Bhavani Thuraisingham

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏