arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-14 至 2025-08-14 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2502.18862 2025-08-14 cs.LG cs.AI 84%

One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs

Jacob Dunefsky, Arman Cohan

机构 * Department of Computer Science(计算机科学系) Yale University(耶鲁大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments Published at COLM 2025. 30 pages, 7 figures. Code is available at https://github.com/jacobdunefsky/one-shot-steering-repro and https://github.com/jacobdunefsky/one-shot-steering-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09224 2025-08-14 cs.CY cs.AI cs.CL 82%

From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training

Yuan Yuan, Tina Sriskandarajah, Anna-Luisa Brakman, Alec Helyar, Alex Beutel, Andrea Vallone, Saachi Jain

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16608 2025-08-14 cs.RO cs.SY eess.SY 50%

Barriers on the EDGE: A scalable CBF architecture over EDGE for safe aerial-ground multi-agent coordination

Viswa Narayanan Sankaranarayanan, Achilleas Santi Seisa, Akshit Saradagi, Sumeet Satpute, George Nikolakopoulos

机构 * Robotics and Artificial Intelligence Group of the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology(鲁内斯大学机器人与人工智能小组)

专题命中 安全训练 :safety(abstract)

Comments 6 pages, 2 figures, first draft of a paper currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 越狱攻击 2 篇

2506.22557 2025-08-14 cs.CR cs.LG 85%

MetaCipher: A Time-Persistent and Universal Multi-Agent Framework for Cipher-Based Jailbreak Attacks for LLMs

Boyuan Chen, Minghao Shao, Abdul Basit, Siddharth Garg, Muhammad Shafique

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09218 2025-08-14 cs.CV cs.AI 70%

Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity

Zuoou Li, Weitong Zhang, Jingyuan Wang, Shuyuan Zhang, Wenjia Bai, Bernhard Kainz, Mengyun Qiao

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2508.09815 2025-08-14 cs.MA cs.CR cs.SE 50%

Extending the OWASP Multi-Agentic System Threat Modeling Guide: Insights from Multi-Agent Security Research

Klaudia Krawiecka, Christian Schroeder de Witt

专题命中 红队测试 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2508.09561 2025-08-14 cs.LG 57%

Edge General Intelligence Through World Models and Agentic AI: Fundamentals, Solutions, and Challenges

Changyuan Zhao, Guangyuan Liu, Ruichen Zhang, Yinqiu Liu, Jiacheng Wang, Jiawen Kang, Dusit Niyato, Zan Li, Xuemin, Shen, Zhu Han, Sumei Sun, Chau Yuen, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学集成服务网络国家重点实验室) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) Department of Computer Science and Engineering, Kyung Hee University(韩国庆熙大学计算机科学与工程系) Institute for Infocomm Research, Agency for Science, Technology and Research(科技研究局信息通信研究所) Department of Electrical and Computer Engineering, Sungkyunkwan University(庆熙大学电气与计算机工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 21 pages. 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2508.09174 2025-08-14 cs.LG cs.AI 62%

FedMP: Tackling Medical Feature Heterogeneity in Federated Learning from a Manifold Perspective

Zhekai Zhou, Shudong Liu, Zhaokun Zhou, Yang Liu, Qiang Yang, Yuesheng Zhu, Guibo Luo

机构 * Peking University(北京大学) the Hong Kong Polytechnic University(香港理工大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 11 篇

2508.09762 2025-08-14 cs.AI cs.CY cs.HC 86%

The PacifAIst Benchmark:Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety?

Manuel Herrador

机构 * Polytechnic School of Jaen, University of Jaen(耶尼大学多技术学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05148 2025-08-14 cs.RO cs.AI 79%

Chemist Eye: A Visual Language Model-Powered System for Safety Monitoring and Robot Decision-Making in Self-Driving Laboratories

Francisco Munguia-Galeano, Zhengxue Zhou, Satheeshkumar Veeramani, Hatem Fakhruldeen, Louis Longley, Rob Clowes, Andrew I. Cooper

机构 * Cooper Group, Department of Chemistry, University of Liverpool(Cooper集团,化学系,利物浦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23486 2025-08-14 cs.CL 79%

A Novel Evaluation Benchmark for Medical LLMs: Illuminating Safety and Effectiveness in Clinical Domains

Shirui Wang, Zhihui Tang, Huaxia Yang, Qiuhong Gong, Tiantian Gu, Hongyang Ma, Yongxin Wang, Wubin Sun, Zeliang Lian, Kehang Mao, Yinan Jiang, Zhicheng Huang, Lingyun Ma, Wenjie Shen, Yajie Ji, Yunhui Tan, Chunbo Wang, Yunlu Gao, Qianling Ye, Rui Lin, Mingyu Chen, Lijuan Niu, Zhihao Wang, Peng Yu, Mengran Lang, Yue Liu, Huimin Zhang, Haitao Shen, Long Chen, Qiguang Zhao, Si-Xuan Liu, Lina Zhou, Hua Gao, Dongqiang Ye, Lingmin Meng, Youtao Yu, Naixin Liang, Jianxiong Wu

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07866 2025-08-14 cs.AI 79%

System 2 Reasoning for Human-AI Alignment: Generality and Adaptivity via ARC-AGI

Sejin Kim, Sundong Kim

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 75%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06296 2025-08-14 cs.AI cs.LG 73%

LLM Robustness Leaderboard v1 --Technical report

Pierre Peigné - Lefebvre, Quentin Feuillade-Montixi, Tom David, Nicolas Miailhe

机构 * PRISM Eval(PRISM评估)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09987 2025-08-14 cs.CV cs.AI cs.CL 62%

Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation

Junyan Ye, Dongzhi Jiang, Zihao Wang, Leqi Zhu, Zhenghao Hu, Zilong Huang, Jun He, Zhiyuan Yan, Jinghua Yu, Hongsheng Li, Conghui He, Weijia Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学多模态实验室) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12867 2025-08-14 eess.AS cs.AI cs.CL 62%

EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting

Guanrou Yang, Chen Yang, Qian Chen, Ziyang Ma, Wenxi Chen, Wen Wang, Tianrui Wang, Yifan Yang, Zhikang Niu, Wenrui Liu, Fan Yu, Zhihao Du, Zhifu Gao, ShiLiang Zhang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Speech Lab(通义语音实验室) Tianjin University(天津大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University, Shanghai Innovation Institute(上海交通大学上海创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09893 2025-08-14 cs.AI 57%

RAGulating Compliance: A Multi-Agent Knowledge Graph for Regulatory QA

Bhavik Agarwal, Hemant Sunil Jomraj, Simone Kaplunov, Jack Krolick, Viktoria Rojkova

机构 * MasterControl AI Research(MasterControl AI研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17609 2025-08-14 cs.AI 57%

Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving

Zixian Guo, Ming Liu, Qilong Wang, Zhilong Ji, Jinfeng Bai, Lei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨理工大学) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学) Tomorrow Advancing Life(明天进步生命) Pazhou Lab, Guangzhou(广州琶洲实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09566 2025-08-14 cs.CV 50%

A Chain of Diagnosis Framework for Accurate and Explainable Radiology Report Generation

Haibo Jin, Haoxuan Che, Sunan He, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学理工大学)

专题命中 安全评测 :trustworthy(abstract)

Comments Accepted to IEEE TMI

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 7 篇

2508.09203 2025-08-14 cs.LG 79%

Building Safer Sites: A Large-Scale Multi-Level Dataset for Construction Safety Research

Zhenhui Ou, Dawei Li, Zhen Tan, Wenlin Li, Huan Liu, Siyuan Song

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

Comments The paper was accepted on the CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09963 2025-08-14 eess.SY cs.MA cs.RO cs.SY 78%

Online Safety under Multiple Constraints and Input Bounds using gatekeeper: Theory and Applications

Devansh R. Agrawal, Dimitra Panagou

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 其他安全 :safety(title,abstract)

Comments 6 pages, 2 figures. Accepted for publication in IEEE L-CSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03012 2025-08-14 cs.AI cs.CL cs.CV 62%

Analyzing Finetuning Representation Shift for Multimodal LLMs Steering

Pegah Khayatan, Mustafa Shukor, Jayneel Parekh, Arnaud Dapogny, Matthieu Cord

机构 * ISIR, Sorbonne Université(ISIR,索邦大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

Comments ICCV 2025. The first three authors contributed equally. Project page and code: https://pegah- kh.github.io/projects/lmm-finetuning-analysis-and-steering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09199 2025-08-14 cs.CV cs.AI cs.CL 62%

$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation

Jucheng Hu, Suorong Yang, Dongzhan Zhou

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09919 2025-08-14 eess.IV cs.AI cs.CV 57%

T-CACE: A Time-Conditioned Autoregressive Contrast Enhancement Multi-Task Framework for Contrast-Free Liver MRI Synthesis, Segmentation, and Diagnosis

Xiaojiao Xiao, Jianfeng Zhao, Qinmin Vivian Hu, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(计算机科学系,多伦多 Metropolitan 大学) School of Biomedical Engineering, Western University(生物医学工程学院,西部大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

Comments IEEE Journal of Biomedical and Health Informatics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23077 2025-08-14 cs.CL 57%

Efficient Inference for Large Reasoning Models: A Survey

Yue Liu, Jiaying Wu, Yufei He, Ruihan Gong, Jun Xia, Liang Li, Hongcheng Gao, Hongyu Chen, Baolong Bi, Jiaheng Zhang, Zhiqi Huang, Bryan Hooi, Stan Z. Li, Keqin Li

专题命中 其他安全 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09453 2025-08-14 cs.CV cs.LG 57%

HyperKD: Distilling Cross-Spectral Knowledge in Masked Autoencoders via Inverse Domain Shift with Spatial-Aware Masking and Specialized Loss

Abdul Matin, Tanjim Bin Faruk, Shrideep Pallickara, Sangmi Lee Pallickara

机构 * Colorado State University(科罗拉多州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏