arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2506.21017 2025-06-27 cs.CV cs.AI 79%

Multimodal Prompt Alignment for Facial Expression Recognition

Fuyan Ma, Yiran He, Bin Sun, Shutao Li

机构 * Chinese Academy of Military Science(中国军事科学院) Changchun University of Science and Technology(长春理工大学) Hunan University(湖南大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

Comments To appear in ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19702 2025-06-25 cs.AI 79%

LLM-Driven Medical Document Analysis: Enhancing Trustworthy Pathology and Differential Diagnosis

Lei Kang, Xuanshuo Fu, Oriol Ramos Terrades, Javier Vazquez-Corral, Ernest Valveny, Dimosthenis Karatzas

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

Comments Accepted at ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15035 2025-06-24 cs.CL 79%

LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies

Felix Friedrich, Simone Tedeschi, Patrick Schramowski, Manuel Brack, Roberto Navigli, Huu Nguyen, Bo Li, Kristian Kersting

机构 * TU Darmstadt(图宾根大学) Sapienza University of Rome(罗马萨皮恩扎大学) DFKI(德意志联邦防务研究院) CERTAIN(CERTAIN公司) University of Chicago(芝加哥大学) UIUC(伊利诺伊大学香槟分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16322 2025-06-23 cs.CL 79%

PL-Guard: Benchmarking Language Model Safety for Polish

Aleksandra Krasnodębska, Karolina Seweryn, Szymon Łukasik, Wojciech Kusa

机构 * NASK – National Research Institute(国家研究 institute)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted to the 10th Workshop on Slavic Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15699 2025-06-23 cs.AI 79%

Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation

Ning Wang, Zihan Yan, Weiyang Li, Chuan Ma, He Chen, Tao Xiang

机构 * College of computer science, Chongqing University(重庆大学计算机学院) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06809 2025-06-19 cs.CL cs.CR 79%

Root Defence Strategies: Ensuring Safety of LLM at the Decoding Level

Xinyi Zeng, Yuying Shang, Jiawei Chen, Jingyuan Zhang, Yu Tian

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Shanghai Key Laboratory of Multi. Info. Processing, East China Normal University(上海多信息处理重点实验室,华东师范大学) Kuaishou-Inc(快手公司)

专题命中 安全评测 :safety(title);jailbreak(abstract);分类 cs.CL

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02958 2025-06-18 cs.CL 79%

Position: Editing Large Language Models Poses Serious Safety Risks

Paul Youssef, Zhixue Zhao, Daniel Braun, Jörg Schlötterer, Christin Seifert

机构 * Marburg University(马尔堡大学) University of Sheffield(谢菲尔德大学) University of Mannheim(曼海姆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00840 2025-06-11 cs.CR cs.AI 79%

Activation Approximations Can Incur Safety Vulnerabilities Even in Aligned LLMs: Comprehensive Analysis and Defense

Jiawen Zhang, Kejia Chen, Lipeng He, Jian Lou, Dan Li, Zunlei Feng, Mingli Song, Jian Liu, Kui Ren, Xiaohu Yang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10903 2025-06-10 cs.CL cs.HC 79%

BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language Model

Yeyong Yu, Runsheng Yu, Haojie Wei, Zhanqiu Zhang, Quan Qian

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08469 2025-06-10 cs.AI cs.ET 79%

Building Trustworthy AI: Transparent AI Systems via Large Language Models, Ontologies, and Logical Reasoning (TranspNet)

Fadi Al Machot, Martin Thomas Horsch, Habib Ullah

机构 * Department of Data Science, Faculty of Science and Technology, Norwegian University of Life Sciences(数据科学系,科学与技术学院,挪威生命科学大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04142 2025-06-05 cs.CL 79%

Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis

Kejian Zhu, Shangqing Tu, Zhuoran Jin, Lei Hou, Juanzi Li, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09295 2025-06-05 cs.CL cs.CV 79%

AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models

Yuhang Wu, Wenmeng Yu, Yean Cheng, Yan Wang, Xiaohan Zhang, Jiazheng Xu, Ming Ding, Yuxiao Dong

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI) Peking University(北京大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02573 2025-06-04 cs.CL 79%

IndoSafety: Culturally Grounded Safety for LLMs in Indonesian Languages

Muhammad Falensi Azmi, Muhammad Dehan Al Kautsar, Alfan Farizki Wicaksono, Fajri Koto

机构 * Faculty of Computer Science, Universitas Indonesia(印度尼西亚大学计算机科学学院) Department of Natural Language Processing, MBZUAI(自然语言处理部门,MBZUAI)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02372 2025-06-04 cs.CL 79%

AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output

Hisami Suzuki, Satoru Katsumata, Takashi Kodama, Tetsuro Takahashi, Kouta Nakayama, Satoshi Sekine

机构 * NII-LLMC(日本国立信息与通信技术研究所语言模型中心) Retrieva, Inc.(Retrieva公司) Kagoshima University(鹿儿岛大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10930 2025-06-03 cs.LG 79%

Physics-informed Temporal Alignment for Auto-regressive PDE Foundation Models

Congcong Zhu, Xiaoyan Xu, Jiayue Han, Jingrun Chen

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments Accepted as a conference paper in ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23793 2025-06-02 cs.CR cs.AI 79%

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Baolin Zheng, Guanlin Chen, Hongqiong Zhong, Qingyang Teng, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22967 2025-05-30 cs.LG cs.MA 79%

MermaidFlow: Redefining Agentic Workflow Generation via Safety-Constrained Evolutionary Programming

Chengqi Zheng, Jianda Chen, Yueming Lyu, Wen Zheng Terence Ng, Haopeng Zhang, Yew-Soon Ong, Ivor Tsang, Haiyan Yin

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21828 2025-05-29 cs.AI 79%

SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts

Chen Yueh-Han, Guy Davidson, Brenden M. Lake

机构 * New York Univeristy(纽约大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20824 2025-05-28 cs.MA cs.AI 79%

MedSentry: Understanding and Mitigating Safety Risks in Medical LLM Multi-Agent Systems

Kai Chen, Taihang Zhen, Hewei Wang, Kailai Liu, Xinfeng Li, Jing Huo, Tianpei Yang, Jinfeng Xu, Wei Dong, Yang Gao

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19933 2025-05-27 cs.AI 79%

Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Making

Yejin Son, Minseo Kim, Sungwoong Kim, Seungju Han, Jian Kim, Dongju Jang, Youngjae Yu, Chanyoung Park

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington, Seattle WA(华盛顿大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

Comments 37 pages, 13 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19502 2025-05-27 cs.SE cs.AI 79%

CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation

Guang Yang, Yu Zhou, Xiang Chen, Wei Zheng, Xing Hu, Xin Zhou, David Lo, Taolue Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) School of Software(软件学院) School of Software Technology(软件技术学院) School of Computing and Information Systems(计算与信息系统学院) School of Computing and Mathematical Sciences(计算与数学科学学院)

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12464 2025-05-23 cs.CL 79%

SafeRoute: Adaptive Model Selection for Efficient and Accurate Safety Guardrails in Large Language Models

Seanie Lee, Dong Bok Lee, Dominik Wagner, Minki Kang, Haebin Seong, Tobias Bocklet, Juho Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) Technische Hochschule Nürnberg Georg Simon Ohm(图林根工业大学诺伊堡分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14470 2025-05-21 cs.CL 79%

Agent-SafetyBench: Evaluating the Safety of LLM Agents

Zhexin Zhang, Shiyao Cui, Yida Lu, Jingzhuo Zhou, Junxiao Yang, Hongning Wang, Minlie Huang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12762 2025-05-20 cs.AI 79%

IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment

Chenlin Ming, Chendi Qu, Mengzhang Cai, Qizhi Pei, Zhuoshi Pan, Yu Li, Xiaoming Duan, Lijun Wu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08844 2025-05-15 q-bio.GN cs.AI 79%

CellTypeAgent: Trustworthy cell type annotation with Large Language Models

Jiawen Chen, Jianghao Zhang, Huaxiu Yao, Yun Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07772 2025-05-13 cs.CY 79%

The Value of Disagreement in AI Design, Evaluation, and Alignment

Sina Fazelpour, Will Fleisher

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

Comments Accepted to ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04251 2025-05-08 cs.SE cs.AI cs.MA 79%

Facilitating Trustworthy Human-Agent Collaboration in LLM-based Multi-Agent System oriented Software Engineering

Krishna Ronanki

机构 * Chalmers University of Technology — University of Gothenburg(查尔姆斯理工大学——戈尔达堡大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03196 2025-05-07 cs.NI cs.AI 79%

A Trustworthy Multi-LLM Network: Challenges,Solutions, and A Use Case

Haoxiang Luo, Gang Sun, Yinqiu Liu, Dusit Niyato, Hongfang Yu, Mohammed Atiquzzaman, Schahram Dustdar

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) University of Oklahoma(俄克拉荷马大学) TU Wien(维也纳技术大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02056 2025-05-06 cs.CV cs.LG 79%

Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin

Yuchen Wang, Xuefeng Bai, Xiucheng Li, Weili Guan, Liqiang Nie, Xinyang Chen

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00843 2025-05-05 cs.CR cs.AI 79%

OET: Optimization-based prompt injection Evaluation Toolkit

Jinsheng Pan, Xiaogeng Liu, Chaowei Xiao

机构 * University of Rochester(罗切斯特大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :prompt injection(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏