arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-17 至 2025-11-17 共收录 44 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2511.10656 2025-11-17 cs.CL cs.AI 81%

Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models

Biao Liu, Ning Xu, Junming Yang, Xin Geng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用关键实验室) Ministry of Education(教育部)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10686 2025-11-17 cs.CL 77%

A methodological analysis of prompt perturbations and their effect on attack success rates

Tiago Machado, Maysa Malfiza Garcia de Macedo, Rogerio Abreu de Paula, Marcelo Carpinette Grave, Aminat Adebiyi, Luan Soares de Souza, Enrico Santarelli, Claudio Pinhanez

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11370 2025-11-17 cs.IR 50%

SRLF: An Agent-Driven Set-Wise Reflective Learning Framework for Sequential Recommendation

Jiahao Wang, Bokang Fu, Yu Zhu, Yuli Liu

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2511.10913 2025-11-17 cs.SD cs.AI cs.CR cs.MM eess.AS 77%

Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio

Guangke Chen, Yuhui Wang, Shouling Ji, Xiapu Luo, Ting Wang

机构 * Stony Brook University(石英布鲁克大学) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08136 2025-11-17 cs.LG cs.AI stat.ML 62%

SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories

Returaj Burnwal, Nirav Pravinbhai Bhatt, Balaraman Ravindran

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11402 2025-11-17 cs.LG 57%

Multi-Phase Spacecraft Trajectory Optimization via Transformer-Based Reinforcement Learning

Amit Jain, Victor Rodriguez-Fernandez, Richard Linares

机构 * Aeronautics & Astronautics, Massachusetts Institute of Technology(航空与宇航科学系,麻省理工学院) Department of Computer Systems Engineering, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11014 2025-11-17 cs.CV cs.CY 57%

SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation

Sumin Yu, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气与计算机工程系,首尔国立大学,首尔,韩国) IPAI / ASRI / INMC, Seoul National University, Seoul, South Korea(IPAI/ASRI/INMC,首尔国立大学,首尔,韩国)

专题命中 安全训练 :safety(abstract);分类 cs.CY

Comments Accepted for presentation at TRUST-AI Workshop, ECAI 2025. Proceedings to appear in CEUR-WS

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2511.10692 2025-11-17 cs.SD 88%

StyleBreak: Revealing Alignment Vulnerabilities in Large Audio-Language Models via Style-Aware Audio Jailbreak

Hongyi Li, Chengxuan Zhou, Chu Wang, Sicheng Liang, Yanting Chen, Qinlin Xie, Jiawei Ye, Jie Wu

机构 * Hongyi Li, Chengxuan Zhou, Chu Wang, Sicheng Liang, Yanting Chen, Qinlin Xie, Jiawei Ye, Jie Wu(作者团队)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2511.10720 2025-11-17 cs.CR cs.AI cs.CL cs.LG 82%

PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization

Runpeng Geng, Yanting Wang, Chenlong Yin, Minhao Cheng, Ying Chen, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The code is available at https://github.com/sleeepeer/PISanitizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24967 2025-11-17 cs.CR cs.AI 79%

SecInfer: Preventing Prompt Injection via Inference-time Scaling

Yupei Liu, Yanting Wang, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2511.10837 2025-11-17 cs.LG cs.AI cs.CL 67%

The Map of Misbelief: Tracing Intrinsic and Extrinsic Hallucinations Through Attention Patterns

Elyes Hajji, Aymen Bouguerra, Fabio Arnez

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2025-FS-ATRACC

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15901 2025-11-17 cs.CL cs.AI 62%

Re-FRAME the Meeting Summarization SCOPE: Fact-Based Summarization and Personalization via Questions

Frederic Kirstein, Sonu Kumar, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11106 2025-11-17 cs.MM cs.CV cs.SD 50%

AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization

Zhonghua Jiang, Kui Chen, Kunxi Li, Keting Yin, Yiyun Zhou, Zhaode Wang, Chengfei Lv, Shengyu Zhang

专题命中 幻觉与事实性 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10974 2025-11-17 cs.CV 50%

Preserving Cross-Modal Consistency for CLIP-based Class-Incremental Learning

Haoran Chen, Houze Xu, Micah Goldblum, Daoguo Dong, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 16 篇

2511.10810 2025-11-17 cs.AI 79%

HARNESS: Human-Agent Risk Navigation and Event Safety System for Proactive Hazard Forecasting in High-Risk DOE Environments

Ran Elgedawy, Sanjay Das, Ethan Seefried, Gavin Wiggins, Ryan Burchfield, Dana Hewit, Sudarshan Srinivasan, Todd Thomas, Prasanna Balaprakash, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10770 2025-11-17 cs.RO 75%

From Framework to Reliable Practice: End-User Perspectives on Social Robots in Public Spaces

Samson Oruma, Ricardo Colomo-Palacios, Vasileios Gkioulos

机构 * Department of Computer Science and Communication(计算机科学与通信系) Østfold University College(奥斯Fold大学学院) Escuela Técnica Superior de Ingenieros Informáticos(信息工程高级技术学院) Universidad Politécnica de Madrid(马德里理工大学) Department of Information Security and Communication Technology(信息安全与通信技术系) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17418 2025-11-17 cs.HC cs.SE 75%

What Needs Attention? Prioritizing Drivers of Developers' Trust and Adoption of Generative AI

Rudrajit Choudhuri, Bianca Trinkenreich, Rahul Pandita, Eirini Kalliamvakou, Igor Steinmacher, Marco Gerosa, Christopher Sanchez, Anita Sarma

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

Comments Journal extension of ICSE 2025 paper (arXiv:2409.04099)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10665 2025-11-17 cs.CL cs.AI cs.LG 67%

Guarding the Meaning: Self-Supervised Training for Semantic Robustness in Guard Models

Cristina Pinneri, Christos Louizos

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11066 2025-11-17 cs.CV cs.AI cs.CL 62%

S2D-ALIGN: Shallow-to-Deep Auxiliary Learning for Anatomically-Grounded Radiology Report Generation

Jiechao Gao, Chang Liu, Yuangang Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10067 2025-11-17 cs.AI cs.CL 62%

Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning

Yuxuan Zhou, Yubin Wang, Bin Wang, Chen Ning, Xien Liu, Ji Wu, Jianye Hao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Huawei Noah’s Ark Lab(华为诺亚实验室) College of AI, Tsinghua University(清华大学人工智能学院) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10002 2025-11-17 cs.CL cs.AI 62%

PustakAI: Curriculum-Aligned and Interactive Textbooks Using Large Language Models

Shivam Sharma, Riya Naik, Tejas Gawas, Heramb Patil, Kunal Korgaonkar

机构 * Department of Computer Science and Information Systems(计算机科学与信息系统系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19238 2025-11-17 cs.AI cs.CY 62%

Designing AI-Agents with Personalities: A Psychometric Approach

Muhua Huang, Xijuan Zhang, Christopher Soto, James Evans

机构 * Stanford University(斯坦福大学) University of Chicago Knowledge Lab(芝加哥大学知识实验室) Chicago Center for Computational Social Science(芝加哥计算社会科学中心) York University(约克大学) Colby College(科尔比学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11252 2025-11-17 cs.AI 57%

UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14720 2025-11-17 cs.LG cs.CV 57%

SGLP: A Similarity Guided Fast Layer Partition Pruning for Compressing Large Deep Models

Yuqi Li, Yao Lu, Junhao Dong, Zeyu Dong, Chuanguang Yang, Xin Yin, Yihao Chen, Jianping Gou, Yingli Tian, Tingwen Huang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Zhejiang University of Technology(浙江工业大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Southwest University(西南大学) The City College of New York(纽约城市学院) Shenzhen University of Advanced Technology(深圳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10925 2025-11-17 cs.AI 57%

Multi-Agent Legal Verifier Systems for Data Transfer Planning

Ha-Thanh Nguyen, Wachara Fungwacharakorn, Ken Satoh

机构 * Center of Juris-Informatics, Joint Support-Center for Data Science Research, ROIS, Tokyo, Japan(司法信息中心、数据科学研究联合支持中心、ROIS、东京、日本) Research and Development Center for Large Language Models, NII, ROIS, Tokyo, Japan(大语言模型研究与开发中心、日本信息机构、ROIS、东京、日本)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08464 2025-11-17 cs.CV cs.AI 57%

Contrastive Integrated Gradients: A Feature Attribution-Based Method for Explaining Whole Slide Image Classification

Anh Mai Vu, Tuan L. Vo, Ngoc Lam Quang Bui, Nam Nguyen Le Binh, Akash Awasthi, Huy Quoc Vo, Thanh-Huy Nguyen, Zhu Han, Chandra Mohan, Hien Van Nguyen

机构 * ECE Department, University of Houston(德克萨斯大学休斯顿分校电子与计算机工程系) Information Technology, HCMC University of Technology and Education(胡志明市技术与教育大学信息技术系) VN-UK Institute for Research and Executive Education, The University of Da Nang(越南-英国研究与管理教育研究所,丹那大学) Ho Chi Minh City University of Science, Vietnam National University(胡志明市科学大学,越南国家大学) Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学计算生物学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08954 2025-11-17 cs.CY cs.HC 57%

Should you use LLMs to simulate opinions? Quality checks for early-stage deliberation

Terrence Neumann, Maria De-Arteaga, Sina Fazelpour

专题命中 安全评测 :alignment(abstract);分类 cs.CY

Comments Accepted to AAAI AI for Social Impact (AISI), 2026. This version includes Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11356 2025-11-17 cs.CR 50%

SEAL: Subspace-Anchored Watermarks for LLM Ownership

Yanbo Dai, Zongjie Li, Zhenlan Ji, Shuai Wang

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10668 2025-11-17 cs.CV 50%

A Mathematical Framework for AI Singularity: Conditions, Bounds, and Control of Recursive Improvement

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) Loughborough University London(洛桑大学伦敦分校) Estonian Business School(爱沙尼亚商业学院)

专题命中 安全评测 :safety(abstract)

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00290 2025-11-17 cs.DB 50%

NOMAD -- Navigating Optimal Model Application to Datastreams

Ashwin Gerard Colaco, Sharad Mehrotra, Michael J De Lucia, Kevin Hamlen, Murat Kantarcioglu, Latifur Khan, Ananthram Swami, Bhavani Thuraisingham

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏