arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2506.00169 2025-06-03 cs.AI 57%

Utilizing AI for Aviation Post-Accident Analysis Classification

Aziida Nanyonga, Graham Wild

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24787 2025-06-02 cs.CV cs.CL 57%

Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation

Yucheng Zhou, Jiahao Yuan, Qianning Wang

机构 * University of Macau China(澳门大学) East China Normal University China(华东师范大学) Auckland University of Technology New Zealand(技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24442 2025-06-02 cs.AI 57%

RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual Compensation

Zhentao Xie, Chengcheng Han, Jinxin Shi, Wenjun Cui, Xin Zhao, Xingjiao Wu, Jiabao Zhao

机构 * East China Normal University(华东师范大学) Meituan Inc.(美团公司) Donghua University(东华大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24182 2025-06-02 cs.CV cs.AI 57%

Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT

Zhuobai Dong, Junchao Yi, Ziyuan Zheng, Haochen Han, Xiangxi Zheng, Alex Jinpeng Wang, Fangming Liu, Linjie Li

机构 * Central South University(中南大学) University of Electronic Science and Technology of China(电子科技大学) Peng Cheng Laboratory(鹏城实验室) Nanjing University(南京大学) Microsoft(微软公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24143 2025-06-02 cs.CL 57%

CrossICL: Cross-Task In-Context Learning via Unsupervised Demonstration Transfer

Jinglong Gao, Xiao Ding, Lingxiao Zou, Bing Qin, Ting Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04042 2025-06-02 cs.CL 57%

An Explicit Syllogistic Legal Reasoning Framework for Large Language Models

Kepu Zhang, Weijie Yu, Zhongxiang Sun, Jun Xu

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) School of Information Technology and Management(信息科技与管理学院) University of International Business and Economics(国际经济贸易大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13757 2025-06-02 stat.ML cs.LG 57%

Identifying Metric Structures of Deep Latent Variable Models

Stas Syrota, Yevgen Zainchkovskyy, Johnny Xi, Benjamin Bloem-Reddy, Søren Hauberg

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Journal ref Forty-second International Conference on Machine Learning. ICML 2025. Vancouver, Canada. July 13-19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23846 2025-06-02 cs.CL cs.MA 57%

Scalable, Symbiotic, AI and Non-AI Agent Based Parallel Discrete Event Simulations

Atanu Barai, Stephan Eidenbenz, Nandakishore Santhi

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11867 2025-06-02 cs.LG 57%

Targeted Unlearning with Single Layer Unlearning Gradient

Zikui Cai, Yaoteng Tan, M. Salman Asif

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23598 2025-05-30 cs.LG cs.SE 57%

LLM Performance for Code Generation on Noisy Tasks

Radzim Sendyka, Christian Cabrera, Andrei Paleyes, Diana Robinson, Neil Lawrence

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22959 2025-05-30 cs.CL 57%

LLM-based HSE Compliance Assessment: Benchmark, Performance, and Advancements

Jianwei Wang, Mengqi Wang, Yinsi Zhou, Zhenchang Xing, Qing Liu, Xiwei Xu, Wenjie Zhang, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04947 2025-05-30 cs.CL 57%

C$^2$LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluation

Yanyang Li, Tin Long Wong, Cheung To Hung, Jianqiao Zhao, Duo Zheng, Ka Wai Liu, Michael R. Lyu, Liwei Wang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Findings of ACL 2025; Project Page: https://github.com/LaVi-Lab/C2LEVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00175 2025-05-30 cs.CV cs.LG cs.SD eess.AS eess.IV 57%

Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning

Stefan Smeu, Dragos-Alexandru Boldisor, Dan Oneata, Elisabeta Oneata

机构 * Bitdefender Politehnica Bucharest(巴尔干理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted as a highlight paper at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22430 2025-05-29 cs.CL 57%

RAG-Zeval: Towards Robust and Interpretable Evaluation on RAG Responses through End-to-End Rule-Guided Reasoning

Kun Li, Yunxiang Li, Tianhua Zhang, Hongyin Luo, Xixin Wu, James Glass, Helen Meng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22067 2025-05-29 cs.CV cs.AI cs.RO 57%

From Failures to Fixes: LLM-Driven Scenario Repair for Self-Evolving Autonomous Driving

Xinyu Xia, Xingjun Ma, Yunfeng Hu, Ting Qu, Hong Chen, Xun Gong

机构 * Jilin University(吉林大学) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20201 2025-05-29 cs.CL 57%

Reasoning Is Not All You Need: Examining LLMs for Multi-Turn Mental Health Conversations

Mohit Chandra, Siddharth Sriraman, Harneet Singh Khanuja, Yiqiao Jin, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 34 pages, 5 figures, 30 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05928 2025-05-29 cs.LG 57%

Evaluation of the impact of expert knowledge: How decision support scores impact the effectiveness of automatic knowledge-driven feature engineering (aKDFE)

Olof Björneld, Tora Hammar, Daniel Nilsson, Alisa Lincke, Welf Löwe

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 43 pages, including the Appendix, 19 tables and 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15626 2025-05-28 cs.AI 57%

Aligning Generalisation Between Humans and Machines

Filip Ilievski, Barbara Hammer, Frank van Harmelen, Benjamin Paassen, Sascha Saralajew, Ute Schmid, Michael Biehl, Marianna Bolognesi, Xin Luna Dong, Kiril Gashteovski, Pascal Hitzler, Giuseppe Marra, Pasquale Minervini, Martin Mundt, Axel-Cyrille Ngonga Ngomo, Alessandro Oltramari, Gabriella Pasi, Zeynep G. Saribatur, Luciano Serafini, John Shawe-Taylor, Vered Shwartz, Gabriella Skitalinskaya, Clemens Stachl, Gido M. van de Ven, Thomas Villmann

机构 * Vrije Universiteit Amsterdam(瓦赫宁海姆大学) University of Bielefeld(比勒菲尔德大学) NEC Laboratories Europe(NEC欧洲实验室) University of Bamberg(巴明翰大学) University of Groningen(格罗宁根大学) Università di Bologna(博洛尼亚大学) Meta Reality Labs(Meta现实实验室) CAIR, Ss. Cyril and Methodius University of Skopje(斯科普里塞尔维亚·克里尔和方法ius大学) Kansas State University(堪萨斯州立大学) KU Leuven(根特大学) University of Edinburgh(爱丁堡大学) University of Bremen(不莱梅大学) Paderborn University(帕德博恩大学) Carnegie Bosch Institute(卡内基·博施研究所) Università degli Studi di Milano Bicocca(米兰Bicocca大学) TU Wien(维也纳技术大学) Fondazione Bruno Kessler(布鲁诺·凯撒基金会) University College London(伦敦大学学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Duolingo(多邻国) University of St. Gallen, Institute of Behavioral Science and Technology(圣加尔文大学行为科学与技术研究所) University of Applied Sciences Mittweida(梅特维达应用科学大学) Technical University Freiberg(弗赖贝格技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20630 2025-05-28 cs.SE cs.CL 57%

SV-TrustEval-C: Evaluating Structure and Semantic Reasoning in Large Language Models for Source Code Vulnerability Analysis

Yansong Li, Paula Branco, Alexander M. Hoole, Manish Marwah, Hari Manassery Koduvely, Guy-Vincent Jourdan, Stephan Jou

机构 * University of Ottawa(渥太华大学) OpenText(OpenText公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Journal ref 2025 IEEE Symposium on Security and Privacy (SP), 2025, pp. 2791-2809

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20313 2025-05-28 cs.AI cs.LO 57%

Reasoning in Neurosymbolic AI

Son Tran, Edjard Mota, Artur d'Avila Garcez

机构 * School of Information Technology, Deakin University(信息科技学院,德堪大学) Instituto de Computação, Universidade Federal do Amazonas(计算学院,亚马逊联邦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 50 pages, 13 figures, 56 references. Keywords: Neurosymbolic AI, Restricted Boltzmann Machines, Logical Reasoning, SAT solving, MaxSAT, Energy-based Learning, Constrained Optimization, Modular Deep Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06775 2025-05-28 cs.LG 57%

Enhancing Performance of Explainable AI Models with Constrained Concept Refinement

Geyu Liang, Senne Michielssen, Salar Fattahi

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02138 2025-05-28 stat.ML cs.LG 57%

Generalizable and Robust Spectral Method for Multi-view Representation Learning

Amitai Yacobi, Ofir Lindenbaum, Uri Shaham

机构 * Department of Computer Science(计算机科学系) Bar-Ilan University(巴伊兰大学) Faculty of Engineering(工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01963 2025-05-28 cs.RO cs.AI 57%

V-CAS: A Realtime Vehicle Anti Collision System Using Vision Transformer on Multi-Camera Streams

Muhammad Waqas Ashraf, Ali Hassan, Imad Ali Shah

机构 * College of EME, NUST(电子工程学院,纳沃伊大学) University of Galway(Galway大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at ICMLA 2024

Journal ref In 2024 International Conference on Machine Learning and Applications (ICMLA), pp.939-944

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07275 2025-05-28 cs.AI 57%

DCA-Bench: A Benchmark for Dataset Curation Agents

Benhao Huang, Yingzhuo Yu, Jin Huang, Xingjian Zhang, Jiaqi Ma

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan - Ann Arbor(密歇根大学安娜堡分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08103 2025-05-27 cs.CL cs.SD eess.AS 57%

The Faetar Benchmark: Speech Recognition in a Very Under-Resourced Language

Michael Ong, Sean Robertson, Leo Peckham, Alba Jorquera Jimenez de Aberasturi, Paula Arkhangorodsky, Robin Huo, Aman Sakhardande, Mark Hallap, Naomi Nagy, Ewan Dunbar

机构 * University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments To appear in INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13984 2025-05-27 cs.CL cs.MM 57%

Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation

Dimitris Gkoumas, Maria Liakata

机构 * Queen Mary University of London(伦敦女王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ACL25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19624 2025-05-27 cs.CV cs.AI 57%

Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat

Pusheng Xu, Xia Gong, Xiaolan Chen, Weiyi Zhang, Jiancheng Yang, Bingjie Yan, Meng Yuan, Yalin Zheng, Mingguang He, Danli Shi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19333 2025-05-27 cs.AI 57%

Evaluating Steering Techniques using Human Similarity Judgments

Zach Studdiford, Timothy T. Rogers, Siddharth Suresh, Kushin Mukherjee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18775 2025-05-27 cs.CV cs.AI 57%

OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks

Jiayu Wang, Yang Jiao, Yue Yu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, Fudan University(上海智能信息处理关键实验室,复旦大学) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18644 2025-05-27 eess.AS cs.CL cs.SD 57%

Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving

Jingran Xie, Xiang Li, Hui Wang, Yue Yu, Yang Xiang, Xixin Wu, Zhiyong Wu

机构 * Shenzhen International Graduate School(深圳国际研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏