arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2506.06556 2025-06-10 cs.LG cs.CR 57%

SDN-Based False Data Detection With Its Mitigation and Machine Learning Robustness for In-Vehicle Networks

Long Dang, Thushari Hapuarachchi, Kaiqi Xiong, Yi Li

机构 * University of South Florida(佛罗里达州立大学) ICNS Lab and Cyber Florida(ICNS实验室和Cyber Florida)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments The 34th International Conference on Computer Communications and Networks (ICCCN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06330 2025-06-10 cs.LG 57%

ExplainBench: A Benchmark Framework for Local Model Explanations in Fairness-Critical Applications

James Afful

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15850 2025-06-10 cs.LG cs.CV cs.RO 57%

LLM-attacker: Enhancing Closed-loop Adversarial Scenario Generation for Autonomous Driving with Large Language Models

Yuewen Mei, Tong Nie, Jian Sun, Ye Tian

机构 * Department of Traffic Engineering and Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(交通工程系和道路与交通工程重点实验室、教育部长江大学) Department of Civil & Environmental Engineering, The Hong Kong Polytechnic University(土木及环境工程系、香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted as a regular paper at IEEE TITS 2025

Journal ref IEEE Transactions on Intelligent Transportation Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04548 2025-06-10 cs.LG cs.IR cs.SI 57%

GNNAnatomy: Rethinking Model-Level Explanations for Graph Neural Networks

Hsiao-Ying Lu, Yiran Li, Ujwal Pratap Krishna Kaluvakolanu Thyagarajan, Kwan-Liu Ma

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05899 2025-06-09 cs.SD cs.AI eess.AS 57%

WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction

Jakaria Islam Emon, Kazi Tamanna Alam, Md. Abu Salek

机构 * Hokkaido Denshikiki Co., Ltd.(Hokkaido Denshikiki公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05877 2025-06-09 cs.LG 57%

Interpretable Clustering Ensemble

Hang Lv, Lianyu Hu, Mudi Jiang, Xinying Liu, Zengyou He

机构 * School of Software, Dalian University of Technology(大连理工大学软件学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05449 2025-06-09 cs.GR cs.CV cs.LG 57%

AI-powered Contextual 3D Environment Generation: A Systematic Review

Miguel Silva, Alexandre Valle de Carvalho

机构 * Faculty of Engineering, University of Porto(葡萄牙波尔图大学工程学院) INESC TEC(葡萄牙INESC TEC)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05203 2025-06-06 cs.LO cs.LG 57%

Trustworthiness Preservation by Copies of Machine Learning Systems

Leonardo Ceragioli, Giuseppe Primiero

机构 * LUCI Lab, Department of Philosophy, Università degli Studi di Milano(米兰大学哲学系LUCI实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04516 2025-06-06 cs.CL 57%

DRE: An Effective Dual-Refined Method for Integrating Small and Large Language Models in Open-Domain Dialogue Evaluation

Kun Zhao, Bohao Yang, Chen Tang, Siyuan Dai, Haoteng Tang, Chenghua Lin, Liang Zhan

机构 * Department of Electrical and Computer Engineering, University of Pittsburgh(匹兹堡大学电气与计算机工程系) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Computer Science, University of Texas Rio Grande Valley(德克萨斯理工大学里奥格兰德谷分校计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2405.15924

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19145 2025-06-06 cs.AI cs.MA 57%

Multi-Agent Security Tax: Trading Off Security and Collaboration Capabilities in Multi-Agent Systems

Pierre Peigne-Lefebvre, Mikolaj Kniejski, Filip Sondej, Matthieu David, Jason Hoelscher-Obermaier, Christian Schroeder de Witt, Esben Kran

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted to AAAI 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04032 2025-06-05 cs.CL 57%

AI Agents for Conversational Patient Triage: Preliminary Simulation-Based Evaluation with Real-World EHR Data

Sina Rashidian, Nan Li, Jonathan Amar, Jong Ha Lee, Sam Pugh, Eric Yang, Geoff Masterson, Myoung Cha, Yugang Jia, Akhil Vaid

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03817 2025-06-05 cs.LG 57%

Survey of Active Learning Hyperparameters: Insights from a Large-Scale Experimental Grid

Julius Gonsior, Tim Rieß, Anja Reusch, Claudio Hartmann, Maik Thiele, Wolfgang Lehner

机构 * Technische Universität Dresden(德累斯顿技术大学) Technion - Israeli Institute of Technology(技术ion-以色列理工学院) Hochschule für Technik und Wirtschaft Dresden(德累斯顿技术与经济高等学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03301 2025-06-05 cs.CL 57%

From Instructions to ODRL Usage Policies: An Ontology Guided Approach

Daham M. Mustafa, Abhishek Nadgeri, Diego Collarana, Benedikt T. Arnold, Christoph Quix, Christoph Lange, Stefan Decker

机构 * Fraunhofer FIT(弗劳恩霍夫研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments The paper is accepted at LLM+KG: International Workshop on Data Management Opportunities in Unifying Large Language Models + Knowledge Graphs, VLDB 2024, August 26, 2024, Guangzhou, China. https://vldb.org/workshops/2024/proceedings/LLM+KG/LLM+KG-15.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20645 2025-06-05 cs.CL 57%

STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models

Kai Chen, Zihao He, Taiwei Shi, Kristina Lerman

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04670 2025-06-05 cs.SE cs.AI 57%

LLM Code Customization with Visual Results: A Benchmark on TikZ

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Olivier Barais, Clément Quinton

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国工业与应用科学学院) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ Rennes, Inria, CNRS, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ. Lille, CNRS, Inria(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所) Univ. Rennes, IRISA, Inria(里昂大学、法国国家信息与自动化研究所、法国国家信息与自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Journal ref EASE 2025 - Evaluation and Assessment in Software Engineering, Jun 2025, Istanbul, Turkey. pp.1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02769 2025-06-05 cs.SD cs.CL cs.HC eess.AS 57%

InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training

Dingdong Wang, Jin Xu, Ruihang Chu, Zhifang Guo, Xiong Wang, Jincenzi Wu, Dongchao Yang, Shengpeng Ji, Junyang Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to ACL 2025; Data is available at: https://huggingface.co/datasets/ddwang2000/SpeechInstructBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10490 2025-06-05 cs.HC cs.AI 57%

AI-Spectra: A Visual Dashboard for Model Multiplicity to Enhance Informed and Transparent Decision-Making

Gilles Eerlings, Sebe Vanbrabant, Jori Liesenborgs, Gustavo Rovelo Ruiz, Davy Vanacken, Kris Luyten

机构 * Hasselt University - Flanders Make(哈瑟尔特大学-佛兰德斯制造)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted for publication in an LNCS Volume "Engineering Interactive Computer Systems - EICS 2024 - International Workshops and Doctoral Consortium, Selected Papers"

Journal ref Engineering Interactive Computer Systems. EICS 2024 International Workshops. EICS 2024. Lecture Notes in Computer Science, vol 15518. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02167 2025-06-04 cs.CV cs.AI 57%

Fire360: A Benchmark for Robust Perception and Episodic Memory in Degraded 360-Degree Firefighting Videos

Aditi Tiwari, Farzaneh Masoud, Dac Trong Nguyen, Jill Kraft, Heng Ji, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Illinois Fire Service Institute(伊利诺伊州消防服务研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01615 2025-06-04 cs.CL 57%

IndicRAGSuite: Large-Scale Datasets and a Benchmark for Indian Language RAG Systems

Pasunuti Prasanjith, Prathmesh B More, Anoop Kunchukuttan, Raj Dabre

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14376 2025-06-04 cs.CL cs.CV 57%

A Similarity Paradigm Through Textual Regularization Without Forgetting

Fangming Cui, Jan Fong, Rongfei Zeng, Xinmei Tian, Jun Yu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19146 2025-06-04 cs.LG 57%

Puzzle: Distillation-Based NAS for Inference-Optimized LLMs

Akhiad Bercovich, Tomer Ronen, Talor Abramovich, Nir Ailon, Nave Assaf, Mohammad Dabbah, Ido Galil, Amnon Geifman, Yonatan Geifman, Izhak Golan, Netanel Haber, Ehud Karpas, Roi Koren, Itay Levy, Pavlo Molchanov, Shahar Mor, Zach Moshe, Najeeb Nabwani, Omri Puny, Ran Rubin, Itamar Schen, Ido Shahaf, Oren Tropp, Omer Ullman Argov, Ran Zilberstein, Ran El-Yaniv

机构 * NVIDIA(英伟达)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13948 2025-06-04 cs.AI 57%

Assurance of AI Systems From a Dependability Perspective

Robin Bloomfield, John Rushby

机构 * City Univ. of London(伦敦城市大学) SRI(SRI研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01920 2025-06-03 cs.CL 57%

From Guidelines to Practice: A New Paradigm for Arabic Language Model Evaluation

Serry Sibaee, Omer Nacar, Adel Ammar, Yasser Al-Habashi, Abdulrahman Al-Batati, Wadii Boulila

机构 * Prince Sultan University(普森大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16727 2025-06-03 cs.CV cs.AI 57%

Unveiling the Lack of LVLM Robustness to Fundamental Visual Variations: Why and Path Forward

Zhiyuan Fan, Yumeng Wang, Sandeep Polisetty, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01520 2025-06-03 cs.CL 57%

FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents

Bobo Li, Yuheng Wang, Hao Fei, Juncheng Li, Wei Ji, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00726 2025-06-03 cs.CL 57%

Structured Gradient Guidance for Few-Shot Adaptation in Large Language Models

Hongye Zheng, Yichen Wang, Ray Pan, Guiran Liu, Binrong Zhu, Hanlu Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22627 2025-06-03 cs.CL cs.CV 57%

Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions

Yijun Shen, Delong Chen, Fan Liu, Xingyu Wang, Chuanyi Zhang, Liang Yao, Yuhui Zheng

机构 * Hohai University(河海大学) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13031 2025-06-03 cs.CL 57%

HPSS: Heuristic Prompting Strategy Search for LLM Evaluators

Bosi Wen, Pei Ke, Yufei Sun, Cunxiang Wang, Xiaotao Gu, Jinfeng Zhou, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) University of Electronic Science and Technology of China(电子科技大学) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00386 2025-06-03 cs.CL cs.HC 57%

Adaptive-VP: A Framework for LLM-Based Virtual Patients that Adapts to Trainees' Dialogue to Facilitate Nurse Communication Training

Keyeun Lee, Seolhee Lee, Esther Hehsun Kim, Yena Ko, Jinsu Eun, Dahee Kim, Hyewon Cho, Haiyi Zhu, Robert E. Kraut, Eunyoung Suh, Eun-mee Kim, Hajin Lim

机构 * hci+d Lab(hci+d实验室) Department of Communication(通信系) Department of Nursing(护理系) Human-Computer Interaction Institute(人机交互研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments ACL 2025 Findings, 34 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00281 2025-06-03 cs.CR cs.AI 57%

Adversarial Threat Vectors and Risk Mitigation for Retrieval-Augmented Generation Systems

Chris M. Ward, Josh Harguess

机构 * Fire Mountain Labs

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

Comments SPIE DCS: Proceedings Volume Assurance and Security for AI-enabled Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏