arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 101 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2509.23558 2025-09-30 cs.AI cs.CR 70%

Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning

Zhaoqi Wang, Daqing He, Zijian Zhang, Xin Li, Liehuang Zhu, Meng Li, Jiamou Liu

机构 * Beijing Institute of Technology(北京理工大学) Hefei University of Technology(合肥工业大学) The University of Auckland(奥克兰大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23281 2025-09-30 cs.RO 67%

Preventing Robotic Jailbreaking via Multimodal Domain Adaptation

Francesco Marchiori, Rohan Sinha, Christopher Agia, Alexander Robey, George J. Pappas, Mauro Conti, Marco Pavone

机构 * University of Padova(帕多瓦大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Örebro University(奥雷布罗大学) NVIDIA Research(NVIDIA研究)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17881 2025-09-30 cs.CL cs.AI 62%

GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication

Hua Tang, Lingyong Yan, Yukun Zhao, Shuaiqiang Wang, Jizhou Huang, Dawei Yin

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) Baidu Inc.(百度公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13899 2025-09-30 cs.LG 57%

Causes and Consequences of Representational Similarity in Machine Learning Models

Zeyu Michael Li, Hung Anh Vu, Damilola Awofisayo, Emily Wenger

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23594 2025-09-30 cs.CR cs.CV 50%

StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data

Yixu Wang, Yan Teng, Yingchun Wang, Xingjun Ma

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 3 篇

2509.22757 2025-09-30 cs.CR cs.AI cs.NI cs.SY eess.SY 79%

Red Teaming Quantum-Resistant Cryptographic Standards: A Penetration Testing Framework Integrating AI and Quantum Security

Petar Radanliev

专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI

Journal ref The Journal of Defense Modeling and Simulation. 2025;0(0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23006 2025-09-30 cs.AI 57%

Creative Adversarial Testing (CAT): A Novel Framework for Evaluating Goal-Oriented Agentic AI Systems

Hassen Dhrif

机构 * Amazon(亚马逊)

专题命中 红队测试 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15213 2025-09-30 cs.CR 50%

Evil Vizier: Vulnerabilities of LLM-Integrated XR Systems

Yicheng Zhang, Zijian Huang, Sophie Chen, Erfan Shayegani, Jiasi Chen, Nael Abu-Ghazaleh

专题命中 红队测试 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 10 篇

2509.23109 2025-09-30 cs.AI cs.CV 79%

AttAnchor: Guiding Cross-Modal Token Alignment in VLMs with Attention Anchors

Junyang Zhang, Tianyi Zhu, Thierry Tambe

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

Comments 31 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23002 2025-09-30 stat.ML cs.LG 79%

Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty

Lingyou Pang, Lei Huang, Jianyu Lin, Tianyu Wang, Akira Horiguchi, Alexander Aue, Carey E. Priebe

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG

Comments 26 pages including appendix; 3 figures and 5 tables. Under review for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23665 2025-09-30 cs.LG cs.AI cs.IT math.IT math.PR 76%

Calibration Meets Reality: Making Machine Learning Predictions Trustworthy

Kristina P. Sinaga, Arjun S. Nair

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.AI、cs.LG

Comments 30 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09598 2025-09-30 cs.CL cs.AI cs.CY 67%

How to Protect Yourself from 5G Radiation? Investigating LLM Responses to Implicit Misinformation

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23497 2025-09-30 cs.AI cs.HC cs.LG 62%

Dynamic Trust Calibration Using Contextual Bandits

Bruno M. Henrique, Eugene Santos

机构 * Thayer School of Engineering(泰勒工程学院) Dartmouth College(达特茅斯学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23146 2025-09-30 cs.CL cs.LG 62%

Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models

Zichao Yu, Ming Li, Wenyi Zhang, Weiguo Gao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23088 2025-09-30 cs.CL 57%

The Geometry of Creative Variability: How Credal Sets Expose Calibration Gaps in Language Models

Esteban Garces Arias, Julian Rodemann, Christian Heumann

机构 * Department of Statistics, LMU Munich(统计系,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹研究中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted at the 2nd UncertaiNLP Workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07618 2025-09-30 cs.IR 50%

KAQG: A Knowledge-Graph-Enhanced RAG for Difficulty-Controlled Question Generation

Ching Han Chen, Ming Fang Shiu

专题命中 幻觉与事实性 :alignment(abstract)

Comments 10 pages, 4 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23457 2025-09-30 cs.CV 50%

No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation

Mohammad Hossein Sameti, Amir M. Mansourian, Arash Marioriyad, Soheil Fadaee Oshyani, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙里夫技术大学)

专题命中 幻觉与事实性 :alignment(abstract)

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23425 2025-09-30 cs.MA 50%

Situational Awareness for Safe and Robust Multi-Agent Interactions Under Uncertainty

Benjamin Alcorn, Eman Hammad

专题命中 幻觉与事实性 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 5 篇

2503.22948 2025-09-30 cs.CL cs.AI cs.CY cs.LG 70%

SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning

Tianyang Xu, Xiaoze Liu, Feijie Wu, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学)

专题命中 隐私与版权 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24488 2025-09-30 cs.CL cs.CR cs.LG 62%

Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models

Wenjie Fu, Huandong Wang, Junyao Gao, Guoan Wan, Tao Jiang

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10171 2025-09-30 cs.CR cs.AI cs.CL 62%

Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents

Saswat Das, Jameson Sandler, Ferdinando Fioretto

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04117 2025-09-30 cs.CL 57%

Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks

Zhiwen Ruan, Yun Chen, Yutao Hou, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24043 2025-09-30 cs.CR 50%

An Ensemble Framework for Unbiased Language Model Watermarking

Yihan Wu, Ruibo Chen, Georgios Milis, Heng Huang

专题命中 隐私与版权 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 26 篇

2509.25086 2025-09-30 cs.CL 86%

Towards Trustworthy Lexical Simplification: Exploring Safety and Efficiency with Small LLMs

Akio Hayakawa, Stefan Bott, Horacio Saggion

机构 * Department of Engineering, Universitat Pompeu Fabra(工程系,庞培法布拉大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12482 2025-09-30 cs.AI 83%

Tiered Agentic Oversight: A Hierarchical Multi-Agent System for Healthcare Safety

Yubin Kim, Hyewon Jeong, Chanwoo Park, Eugene Park, Haipeng Zhang, Xin Liu, Hyeonhoon Lee, Daniel McDuff, Marzyeh Ghassemi, Cynthia Breazeal, Samir Tulebaev, Hae Won Park

机构 * Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究) Harvard Medical School(哈佛医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23783 2025-09-30 cs.AI 79%

Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception

Qi Xue, Minrui Jiang, Runjia Zhang, Xiurui Xie, Pei Ke, Guisong Liu

机构 * Laboratory of Intelligent Collaborative Computing University of Electronic Science and Technology of China(智能协同计算实验室 电子科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23760 2025-09-30 cs.CV 78%

UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception

Xinyang Song, Libin Wang, Weining Wang, Shaozhen Liu, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21943 2025-09-30 cs.AI cs.LG 73%

Outlier Detection in Plantar Pressure: Human-Centered Comparison of Statistical Parametric Mapping and Explainable Machine Learning

Carlo Dindorf, Jonas Dully, Steven Simon, Dennis Perchthaler, Stephan Becker, Hannah Ehmann, Kjell Heitmann, Bernd Stetter, Christian Diers, Michael Fröhlich

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13068 2025-09-30 cs.CL cs.AI 73%

Accuracy is Not Agreement: Expert-Aligned Evaluation of Crash Narrative Classification Models

Sudesh Ramesh Bhagat, Ibne Farabi Shihab, Anuj Sharma

机构 * Institute for Transportation(交通研究所) Iowa State University(爱荷华州立大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22376 2025-09-30 cs.LG cs.AI cs.CL cs.CV 67%

Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance

Dongmin Park, Sebin Kim, Taehong Moon, Minkyu Kim, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏