arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-11 至 2025-11-11 共收录 94 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2511.06222 2025-11-11 cs.CL cs.CY 88%

SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization

Yue Huang, Xiangqi Wang, Xiangliang Zhang

机构 * University of Notre Dame(诺特大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01894 2025-11-11 cs.CV cs.AI cs.HC 85%

LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces

Rashid Mushkani, Shravan Nayak, Hugo Berard, Allison Cohen, Shin Koseki, Hadrien Bertrand

机构 * Mila–Quebec AI Institute(魁北克AI研究所)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15483 2025-11-11 cs.LG cs.AI cs.CL math.OC stat.ML 75%

Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective

Heshan Fernando, Han Shen, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20916 2025-11-11 cs.CL 57%

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

Yuan Ge, Junxiang Zhang, Xiaoqian Liu, Bei Li, Xiangnan Ma, Chenglong Wang, Kaiyang Ye, Yangfan Du, Linfeng Zhang, Yuxin Huang, Tong Xiao, Zhengtao Yu, JingBo Zhu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09039 2025-11-11 cs.CL 57%

Atomic Consistency Preference Optimization for Long-Form Question Answering

Jingfeng Chen, Raghuveer Thirukovalluru, Junlin Wang, Kaiwei Luo, Bhuwan Dhingra

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2501.13677 2025-11-11 cs.LG cs.CR 83%

HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor

Zihui Wu, Haichang Gao, Jiacheng Luo, Zhaoxiang Liu

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06262 2025-11-11 cs.AI cs.CY 62%

GAIA: A General Agency Interaction Architecture for LLM-Human B2B Negotiation & Screening

Siming Zhao, Qi Li

机构 * Alibaba.com US E-Commerce(阿里巴巴美国电子商务) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06111 2025-11-11 cs.LG 57%

Guardian-regularized Safe Offline Reinforcement Learning for Smart Weaning of Mechanical Circulatory Devices

Aysin Tumay, Sophia Sun, Sonia Fereidooni, Aaron Dumas, Elise Jortberg, Rose Yu

机构 * University of California(加州大学) California Institute of Technology(加州理工学院) Abiomed(阿比omed)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06094 2025-11-11 cs.LG 57%

Approximating Shapley Explanations in Reinforcement Learning

Daniel Beechey, Özgür Şimşek

机构 * University of Bath(巴斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Camera-ready version. Published at the Conference on Neural Information Processing Systems (NeurIPS 2025)

Journal ref Proceedings of the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05532 2025-11-11 cs.CL 57%

Beyond One-Size-Fits-All: Personalized Harmful Content Detection with In-Context Learning

Rufan Zhang, Lin Zhang, Xianghang Mi

机构 * University of Science and Technology of China(科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01739 2025-11-11 cs.AI cs.LG 54%

Conceptual Belief-Informed Reinforcement Learning

Xingrui Gu, Chuyi Jiang, Laixi Shi

机构 * University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment

Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2511.06512 2025-11-11 cs.CR cs.LG 89%

EASE: Practical and Efficient Safety Alignment for Small Language Models

Haonan Shi, Guoli Wang, Tu Ouyang, An Wang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01599 2025-11-11 cs.CL cs.CR cs.CV cs.LG 73%

JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models

Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学) Boise State University(博伊西州立大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06212 2025-11-11 cs.CR cs.AI 57%

RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework

Seif Ikbarieh, Kshitiz Aryal, Maanak Gupta

机构 * Department of Computer Science(计算机科学系) Tennessee Tech University(田纳西科技大学) School of Interdisciplinary Informatics(跨学科信息学学院) University of Nebraska Omaha(内布拉斯加大学奥马哈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07315 2025-11-11 cs.CR 50%

JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework

Yuxuan Zhou, Yang Bai, Kuofeng Gao, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2511.05797 2025-11-11 cs.CR cs.AI 79%

When AI Meets the Web: Prompt Injection Risks in Third-Party AI Chatbot Plugins

Yigitcan Kaya, Anton Landerer, Stijn Pletinckx, Michelle Zimmermann, Christopher Kruegel, Giovanni Vigna

机构 * University of California, Santa Barbara(加州大学圣巴bara分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

Comments At IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 8 篇

2502.12767 2025-11-11 cs.CL cs.AI 62%

R2-KG: General-Purpose Dual-Agent Framework for Reliable Reasoning on Knowledge Graphs

Sumin Jo, Junseong Choi, Jiho Kim, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06607 2025-11-11 cs.LG 57%

Explainable Probabilistic Machine Learning for Predicting Drilling Fluid Loss of Circulation in Marun Oil Field

Seshu Kumar Damarla, Xiuli Zhu

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 5 pages, 3 tables, 4 figrues

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07863 2025-11-11 cs.LG 57%

Robust Hallucination Detection in LLMs via Adaptive Token Selection

Mengjia Niu, Hamed Haddadi, Guansong Pang

机构 * Imperial College London, UK(伦敦帝国学院) Singapore Management University(新加坡管理大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05804 2025-11-11 cs.LG cs.SY eess.SP eess.SY stat.ML 57%

Catching Contamination Before Generation: Spectral Kill Switches for Agents

Valentin Noël

机构 * Devoteam

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11196 2025-11-11 cs.CL cs.CV 57%

Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations

Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM University Hospital(慕尼黑技术大学医院) German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心) Department of Radiology(放射科) Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所) Uniklinik RWTH Aachen(亚琛工业大学医院) HOPPR IL USA(HOPPR美国) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted to ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 57%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06649 2025-11-11 cs.CE 50%

Differentiable Semantic Meta-Learning Framework for Long-Tail Motion Forecasting in Autonomous Driving

Bin Rao, Chengyue Wang, Haicheng Liao, Qianfang Wang, Yanchen Guan, Jiaxun Zhang, Xingcheng Liu, Meixin Zhu, Kanye Ye Wang, Zhenning Li

专题命中 幻觉与事实性 :safety(abstract)

Comments Accepted at AAAI-26 (AAAI 2026), Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06475 2025-11-11 cs.CV 50%

NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models

Kyuho Lee, Euntae Kim, Jinwoo Choi, Buru Chang

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

Comments 18 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 3 篇

2505.20354 2025-11-11 cs.CL cs.AI 62%

Rethinking Text-based Protein Understanding: Retrieval or LLM?

Juntong Wu, Zijing Liu, He Cao, Hao Li, Bin Feng, Zishan Shu, Ke Yu, Li Yuan, Yu Li

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by Empirical Methods in Natural Language Processing 2025 (EMNLP 2025) Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05518 2025-11-11 cs.CL cs.AI 62%

Retracing the Past: LLMs Emit Training Data When They Get Lost

Myeongseob Ko, Nikhil Reddy Billa, Adam Nguyen, Charles Fleming, Ming Jin, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Cisco Research(思科研究)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI

Comments The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02001 2025-11-11 cs.DC 50%

EcoLoRA: Communication-Efficient Federated Fine-Tuning of Large Language Models

Han Liu, Ruoyao Wen, Srijith Nair, Jia Liu, Wenjing Lou, Chongjie Zhang, William Yeoh, Yevgeniy Vorobeychik, Ning Zhang

专题命中 隐私与版权 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 30 篇

2511.06890 2025-11-11 cs.CL 87%

EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers

Yilin Jiang, Mingzi Zhang, Xuanyu Yin, Sheng Jin, Suyu Lu, Zuocan Ying, Zengyi Yu, Xiangjie Kong

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);AI safety(abstract)

Comments 22 pages, 9 figures, accepted by AAAI2026 as oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05889 2025-11-11 cs.RO 82%

From Words to Safety: Language-Conditioned Safety Filtering for Robot Navigation

Zeyuan Feng, Haimingyue Zhang, Somil Bansal

机构 * department of Aeronautics and Astronautics, Stanford University(航空与宇航系,斯坦福大学) School of Vehicle and Mobility at Tsinghua University(清华大学车辆与移动系统学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01710 2025-11-11 cs.CL cs.LG 81%

CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications

Raviraj Joshi, Rakesh Paul, Kanishk Singla, Anusha Kamath, Michael Evans, Katherine Luna, Shaona Ghosh, Utkarsh Vaidya, Eileen Long, Sanjay Singh Chauhan, Niranjan Wartikar

机构 * NVIDIA(英伟达)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏