arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-10 至 2025-10-10 共收录 67 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2510.08256 2025-10-10 cs.LG cs.AI cs.CL 87%

Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization

Jason Bohne, Pawel Polak, David Rosenberg, Brian Bloniarz, Gary Kazantsev

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Stony Brook University(石溪大学) Institute for Advanced Computational Science(先进计算科学研究所) Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) AI Innovation Institute(人工智能创新研究院) Bloomberg(彭博) Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) San Francisco, CA 94105(旧金山,CA 94105) Bloomberg New York, NY 10022(纽约,NY 10022)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11143 2025-10-10 cs.AI cs.CL cs.LG 85%

OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework

Jian Hu, Xibin Wu, Wei Shen, Jason Klein Liu, Zilin Zhu, Weixun Wang, Songlin Jiang, Haoran Wang, Hao Chen, Bin Chen, Weikai Fang, Xianyu, Yu Cao, Haotian Xu, Yiming Liu

机构 * Team Project Leader(团队项目负责人)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments update template

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06871 2025-10-10 cs.LG cs.CV 79%

SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models

Huahui Yi, Kun Wang, Qiankun Li, Miao Yu, Liang Lin, Gongli Xi, Hao Wu, Xuming Hu, Kang Li, Yang Liu

机构 * West China Biomedical Big Data Center, West China Hospital, SCU(西昌生物医学大数据中心、西昌医院、SCU) NTU USTC TeleAI, China Telecom(TeleAI、中国电信) BUPT Tsinghua University(清华大学) HKUST(Guangzhou)(HKUST(广州))

专题命中 偏好对齐 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07557 2025-10-10 cs.LG cs.AI cs.CY cs.HC 67%

Investigating Thematic Patterns and User Preferences in LLM Interactions using BERTopic

Abhay Bhandarkar, Gaurav Mishra, Khushi Juchani, Harsh Singhal

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) Ecofy Finance Private Limited(Ecofy金融私人有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08022 2025-10-10 cs.LG cs.AI cs.CL cs.CV 67%

Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining

Chenxi Liu, Tianyi Xiong, Yanshuo Chen, Ruibo Chen, Yihan Wu, Junfeng Guo, Tianyi Zhou, Heng Huang

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16567 2025-10-10 cs.LG cs.AI cs.CR 62%

Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning

Thibaud Gloaguen, Mark Vero, Robin Staab, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07497 2025-10-10 cs.CL cs.AI eess.AS 62%

Can Speech LLMs Think while Listening?

Yi-Jen Shih, Desh Raj, Chunyang Wu, Wei Zhou, SK Bong, Yashesh Gaur, Jay Mahadeokar, Ozlem Kalinli, Mike Seltzer

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03438 2025-10-10 cs.AI 57%

BFS-Prover: Scalable Best-First Tree Search for LLM-based Automatic Theorem Proving

Ran Xin, Chenguang Xi, Jie Yang, Feng Chen, Hang Wu, Xia Xiao, Yifan Sun, Shen Zheng, Kai Shen

机构 * ByteDance Seed(字节跳动种子) ByteDance Applied Machine Learning(字节跳动应用机器学习) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06870 2025-10-10 cs.CL 57%

$λ$-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences

Yining Wang, Jinman Zhao, Chuangxin Zhao, Shuhao Guan, Gerald Penn, Shinan Liu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2509.22745 2025-10-10 cs.CR cs.AI 86%

Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment

Jaehan Kim, Minkyoo Song, Seungwon Shin, Sooel Son

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08046 2025-10-10 cs.AI 70%

LinguaSim: Interactive Multi-Vehicle Testing Scenario Generation via Natural Language Instruction Based on Large Language Models

Qingyuan Shi, Qingwen Meng, Hao Cheng, Qing Xu, Jianqiang Wang

机构 * National Key R&D Program of China(中华人民共和国国家重点研发计划)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15799 2025-10-10 eess.SY cs.AI cs.RO cs.SY math.OC 57%

Hierarchical Reinforcement Learning with Low-Level MPC for Multi-Agent Control

Max Studt, Georg Schildbach

机构 * Max Studt 1 Georg Schildbach 1

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07642 2025-10-10 cs.CL 57%

Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models

Đorđe Klisura, Joseph Khoury, Ashish Kundu, Ram Krishnan, Anthony Rios

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Louisiana State University(路易斯安那州立大学) Cisco Research(思科研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07604 2025-10-10 cs.SE 50%

RustAssure: Differential Symbolic Testing for LLM-Transpiled C-to-Rust Code

Yubo Bai, Tapti Palit

专题命中 安全训练 :safety(abstract)

Comments 13 pages to appear in Proceedings of ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2510.07835 2025-10-10 cs.LG cs.AI cs.CL cs.CR 82%

MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation

Weisen Jiang, Sinno Jialin Pan

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted By NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08729 2025-10-10 cs.CL cs.AI 76%

X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates

Hyunjun Kim, Junwoo Ha, Sangyoon Yu, Haon Park

机构 * AIM Intelligence(AIM智能)

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01342 2025-10-10 cs.CR 67%

Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach

Xiangfang Li, Yu Wang, Bo Li

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00218 2025-10-10 cs.MA cs.AI cs.CL cs.LG 67%

$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks

Rana Muhammad Shahroz Khan, Zhen Tan, Sukwon Yun, Charles Fleming, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Cisco(思科)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 57%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2510.08329 2025-10-10 cs.CL 85%

AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming

Muxi Diao, Yutao Mou, Keqing He, Hanbo Song, Lulu Zhao, Shikun Zhang, Wei Ye, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2509.00088 2025-10-10 cs.CR cs.AI cs.LG 81%

AEGIS : Automated Co-Evolutionary Framework for Guarding Prompt Injections Schema

Ting-Chun Liu, Ching-Yu Hsu, Kuan-Yi Lee, Chi-An Fu, Hung-yi Lee

机构 * Electrical Engineering, National Taiwan University(国家台湾大学电子工程系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05106 2025-10-10 cs.AI 70%

Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis

Joachim Diederich

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 3 篇

2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 85%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08389 2025-10-10 cs.AI 57%

Revisiting Hallucination Detection with Effective Rank-based Uncertainty

Rui Wang, Zeming Wei, Guanzhang Yue, Meng Sun

机构 * Peking University(北京大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16922 2025-10-10 cs.CL 57%

UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Dong Yu, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) City University of Hong Kong(香港城市大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 5 篇

2410.17933 2025-10-10 cs.LG cs.AI cs.CR 62%

Multi-Continental Healthcare Modelling Using Blockchain-Enabled Federated Learning

Rui Sun, Zhipeng Wang, Hengrui Zhang, Ming Jiang, Yizhe Wen, Jiahao Sun, Erwu Liu, Kezhi Li

机构 * School of Computing, Newcastle University(新castle大学计算机学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究所,同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院) University College London Hospital(伦敦大学学院医院)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by IEEE Global Blockchain Conference, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07822 2025-10-10 cs.LG cs.AI 62%

SIMU: Selective Influence Machine Unlearning

Anu Agarwal, Mihir Pamnani, Dilek Hakkani-Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2025 Workshop: Constrained Optimization for Machine Learning (COML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12263 2025-10-10 cs.LG cs.AI cs.SY eess.SY 62%

A Survey of Foundation Models for IoT: Taxonomy and Criteria-Based Analysis

Hui Wei, Dong Yoon Lee, Shubham Rohal, Zhizhang Hu, Ryan Rossi, Shiwei Fang, Shijia Pan

机构 * Adobe Research(Adobe研究院) Augusta University(奥古斯塔大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by CCF Transactions on Pervasive Computing and Interaction (CCF TPCI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06223 2025-10-10 cs.HC cs.AI 57%

A Multimodal GUI Architecture for Interfacing with LLM-Based Conversational Assistants

Hans G. W. van Dam

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

Comments 24 pages, 19 figures, code available at https://github.com/hansvdam/langbar

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07762 2025-10-10 cs.AI 57%

From Noisy to Native: LLM-driven Graph Restoration for Test-Time Graph Domain Adaptation

Xiangwei Lv, JinLuan Yang, Wang Lin, Jingyuan Chen, Beishui Liao

机构 * Zhejiang University(浙江大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏