arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-17 至 2025-10-17 共收录 49 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2510.01545 2025-10-17 cs.LG cs.AI cs.RO 62%

Predictive Preference Learning from Human Interventions

Haoyuan Cai, Zhenghao Peng, Bolei Zhou

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025 Spotlight. Project page: https://metadriverse.github.io/ppl

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14526 2025-10-17 cs.CV cs.LG 57%

Noise Projection: Closing the Prompt-Agnostic Gap Behind Text-to-Image Misalignment in Diffusion Models

Yunze Tong, Didi Zhu, Zijing Hu, Jinluan Yang, Ziyu Zhao

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Appendix will be appended soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14200 2025-10-17 cs.CL 57%

RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following

Zhichao Wang, Andy Wong, Ruslan Belkin

机构 * Inflection AI

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14374 2025-10-17 cs.CV 50%

Spatial Preference Rewarding for MLLMs Spatial Understanding

Han Qiu, Peng Gao, Lewei Lu, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院) Zhejiang University of Technology(浙江工业大学) UCAS-Terminus AI Lab,University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室)

专题命中 偏好对齐 :alignment(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14257 2025-10-17 cs.IR 50%

Synergistic Integration and Discrepancy Resolution of Contextualized Knowledge for Personalized Recommendation

Lingyu Mu, Hao Deng, Haibo Xing, Kaican Lin, Zhitong Zhu, Yu Zhang, Xiaoyi Zeng, Zhengxiao Liu, Zheng Lin, Jinxin Hu

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2510.14968 2025-10-17 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 76%

RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks

Mingxuan Yan, Yuping Wang, Zechun Liu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Meta AI

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05179 2025-10-17 cs.CR cs.AI cs.LG 73%

Agentic Misalignment: How LLMs Could Be Insider Threats

Aengus Lynch, Benjamin Wright, Caleb Larson, Stuart J. Ritchie, Soren Mindermann, Evan Hubinger, Ethan Perez, Kevin Troy

机构 * University College London(伦敦大学学院) Anthropic MATS Mila

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 12 figures. Code available at https://github.com/anthropic-experimental/agentic-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14276 2025-10-17 cs.CL 57%

Qwen3Guard Technical Report

Haiquan Zhao, Chenhan Yuan, Fei Huang, Xiaomeng Hu, Yichang Zhang, An Yang, Bowen Yu, Dayiheng Liu, Jingren Zhou, Junyang Lin, Baosong Yang, Chen Cheng, Jialong Tang, Jiandong Jiang, Jianwei Zhang, Jijie Xu, Ming Yan, Minmin Sun, Pei Zhang, Pengjun Xie, Qiaoyu Tang, Qin Zhu, Rong Zhang, Shibin Wu, Shuo Zhang, Tao He, Tianyi Tang, Tingyu Xia, Wei Liao, Weizhou Shen, Wenbiao Yin, Wenmeng Zhou, Wenyuan Yu, Xiaobin Wang, Xiaodong Deng, Xiaodong Xu, Xinyu Zhang, Yang Liu, Yeqiu Li, Yi Zhang, Yong Jiang, Yu Wan, Yuxin Zhou

机构 * Qwen Team(通义实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2506.10597 2025-10-17 cs.CR cs.AI 83%

SoK: Evaluating Jailbreak Guardrails for Large Language Models

Xunguang Wang, Zhenlan Ji, Wenxuan Wang, Zongjie Li, Daoyuan Wu, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) Lingnan University(岭南大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

Comments Accepted by IEEE S&P 2026 Cycle 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13541 2025-10-17 eess.AS cs.LG 83%

SPIRIT: Patching Speech Language Models against Jailbreak Attacks

Amirbek Djanibekov, Nurdaulet Mukhituly, Kentaro Inui, Hanan Aldarmaki, Nils Lukas

机构 * MBZUAI Tohoku University(东北大学) RIKEN(日本科学技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14845 2025-10-17 cs.LG cs.CV 57%

Backdoor Unlearning by Linear Task Decomposition

Amel Abdelraheem, Alessandro Favero, Gerome Bovet, Pascal Frossard

机构 * EPFL(苏黎世联邦理工学院) Cyber-Defence Campus, armasuisse(网络安全校园,armasuisse)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2505.15738 2025-10-17 cs.CR cs.AI cs.CL cs.LG 82%

Checkpoint-GCG: Auditing and Attacking Fine-Tuning-Based Prompt Injection Defenses

Xiaoxue Yang, Bozhidar Stevanoski, Matthieu Meeus, Yves-Alexandre de Montjoye

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2510.14318 2025-10-17 cs.CL cs.AI cs.LG 75%

Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL

Marwa Abdulhai, Ryan Cheng, Aryansh Shrivastava, Natasha Jaques, Yarin Gal, Sergey Levine

机构 * UC Berkeley(伯克利大学) University of Oxford(牛津大学) University of Washington(华盛顿大学) UK AI Security Institute(英国人工智能安全研究所) Google DeepMind(谷歌DeepMind)

专题命中 幻觉与事实性 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01997 2025-10-17 cs.LG cs.AI stat.ML 62%

Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach

Jiancong Xiao, Bojian Hou, Zhanliang Wang, Ruochen Jin, Qi Long, Weijie J. Su, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13750 2025-10-17 cs.CL 57%

Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation

Zhiqi Huang, Vivek Datla, Chenyang Zhu, Alfy Samuel, Daben Liu, Anoop Kumar, Ritesh Soni

机构 * Capital One

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments UncertaiNLP at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25373 2025-10-17 cs.AI 57%

From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models

Chenyue Zhou, Mingxuan Wang, Yanbiao Ma, Chenxu Wu, Wanyi Chen, Zhe Qian, Xinyu Liu, Yiwei Zhang, Junhao Wang, Hengbo Xu, Fei Luo, Xiaohua Chen, Xiaoshuai Hao, Hehan Li, Andi Zhang, Wenxuan Wang, Kaiyan Zhang, Guoli Jia, Lingling Li, Zhiwu Lu, Yang Lu, Yike Guo

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2510.14312 2025-10-17 cs.AI cs.CL cs.CR 84%

Terrarium: Revisiting the Blackboard for Multi-Agent Safety, Privacy, and Security Studies

Mason Nakamura, Abhinav Kumar, Saaduddin Mahmud, Sahar Abdelnabi, Shlomo Zilberstein, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ELLIS Institute(ELLIS研究所) MPI for Intelligent Systems(智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 隐私与版权 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14698 2025-10-17 cs.LG cs.AI 81%

FedPPA: Progressive Parameter Alignment for Personalized Federated Learning

Maulidi Adi Prasetia, Muhamad Risqi U. Saputra, Guntur Dharma Putra

机构 * Universitas Gadjah Mada, Indonesia(加雅玛大学) Monash University, Indonesia(墨尔本大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages, TrustCom 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 11 篇

2510.11278 2025-10-17 cs.LG cs.AI cs.CL 82%

ENIGMA: The Geometry of Reasoning and Alignment in Large-Language Models

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Ariel Kuperman, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 52 pages, 10 figures, author typo corrected, abstract typo corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03550 2025-10-17 cs.CL 79%

Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations

Peng Lai, Jianjie Zheng, Sijie Cheng, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19179 2025-10-17 cs.AI 79%

A Design Framework for operationalizing Trustworthy Artificial Intelligence in Healthcare: Requirements, Tradeoffs and Challenges for its Clinical Adoption

Pedro A. Moreno-Sánchez, Javier Del Ser, Mark van Gils, Jussi Hernesniemi

机构 * organization= Faculty of Medicine Health Technology, Tampere University , city= Tampere , postcode= 33100 , country= Finland organization= TECNALIA, Basque Research \& Technology Alliance (BRTA) , city= Derio , postcode= 48160 , country= Spain organization= Department of Mathematics, University of the Basque Country (UPV/EHU) , city= Leioa , postcode= 48940 , country= Spain organization= Tampere Heart Hospital, Tampere University Hospital , city= Tampere , postcode= 33520 , country= Finland

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04426 2025-10-17 cs.CL cs.AI cs.CY 67%

The simulation of judgment in LLMs

Edoardo Loru, Jacopo Nudo, Niccolò Di Marco, Alessandro Santirocchi, Roberto Atzeni, Matteo Cinelli, Vincenzo Cestari, Clelia Rossi-Arnaud, Walter Quattrociocchi

机构 * Department of Computer, Control and Management Engineering, Sapienza University of Rome(计算机、控制与管理工程系,罗马萨皮恩扎大学) Department of Computer Science, Sapienza University of Rome(计算机科学系,罗马萨皮恩扎大学) Department of Legal, Social, and Educational Sciences, Tuscia University(法律、社会与教育科学系,图斯西亚大学) Department of Psychology, Sapienza University of Rome(心理学系,罗马萨皮恩扎大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Please refer to published version: https://doi.org/10.1073/pnas.2518443122

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (42) e2518443122, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14242 2025-10-17 cs.CL cs.LG 62%

Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs

Parsa Hejabi, Elnaz Rahmati, Alireza S. Ziabari, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

Comments 14 pages, 6 figures, 3 tables, and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12210 2025-10-17 eess.AS cs.CL cs.LG 62%

DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation

Yakun Song, Xiaobin Zhuang, Jiawei Chen, Zhikang Niu, Guanrou Yang, Chenpeng Du, Dongya Jia, Zhuo Chen, Yuping Wang, Yuxuan Wang, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,上海交通大学) ByteDance Inc.(字节跳动公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14525 2025-10-17 cs.CV cs.AI 57%

Real-Time Surgical Instrument Defect Detection via Non-Destructive Testing

Qurrat Ul Ain, Atif Aftab Ahmed Jilani, Zunaira Shafqat, Nigar Azhar Butt

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14503 2025-10-17 cs.LG 57%

Learning to Undo: Rollback-Augmented Reinforcement Learning with Reversibility Signals

Andrejs Sorstkins, Omer Tariq, Muhammad Bilal

机构 * School of Computing and Communications, Lancaster University, Lancaster LA1 4WA, United Kingdom(1 计算与通信学院,兰卡斯特大学,英国兰卡斯特 LA1 4WA) Neubility, 2F 115 (04768) Wangsimni-ro, Seongdong-gu, Seoul, South Korea(2 Neubility,韩国首尔松江区 Wangsimni-ro 2F 115 (04768))

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Submitted PLOS ONE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14194 2025-10-17 cs.AI 57%

Implementation of AI in Precision Medicine

Göktuğ Bender, Samer Faraj, Anand Bhardwaj

机构 * Desautels Faculty of Management(德萨尔斯管理学院) McGill University(麦吉尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted to SMASH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14058 2025-10-17 physics.optics cs.AI eess.IV 57%

Optical Computation-in-Communication enables low-latency, high-fidelity perception in telesurgery

Rui Yang, Jiaming Hu, Jian-Qing Zheng, Yue-Zhen Lu, Jian-Wei Cui, Qun Ren, Yi-Jie Yu, John Edward Wu, Zhao-Yu Wang, Xiao-Li Lin, Dandan Zhang, Mingchu Tang, Christos Masouros, Huiyun Liu, Chin-Pang Liu

机构 * University College London(伦敦大学学院) University of Oxford(牛津大学) CAMS Oxford Institute(牛津大学癌症医学学院) Nuffield Department of Medicine(医学系) Imperial College London(帝国理工学院) Department of Bioengineering(生物工程系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13828 2025-10-17 cs.CL 57%

From Explainability to Action: A Generative Operational Framework for Integrating XAI in Clinical Mental Health Screening

Ratna Kandala, Akshata Kishore Moharir, Divya Arvinda Nayak

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 9 篇

2509.24065 2025-10-17 cs.CY 90%

AI Safety, Alignment, and Ethics (AI SAE)

Dylan Waldner

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.CY

Comments 46 pages, 9 figures (including appendix), 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏