arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2505.08389 2025-05-14 cs.CL 57%

Towards Contamination Resistant Benchmarks

Rahmatullah Musawi, Sheng Lu

机构 * Master’s thesis(硕士论文)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07609 2025-05-13 eess.AS cs.LG cs.SD 57%

TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining

Paul Primus, Florian Schmid, Gerhard Widmer

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments submitted to the IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2025. Dataset (Zenodo): https://zenodo.org/records/15379789, Implementation (GitHub): https://github.com/OptimusPrimus/tacos

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06527 2025-05-13 cs.CV cs.AI 57%

Improving Generalization of Medical Image Registration Foundation Model

Jing Hu, Kaiwei Yu, Hongjiang Xian, Shu Hu, Xin Wang

机构 * Chengdu University of Information Technology(成都信息学院) Purdue University(普渡大学) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments IJCNN

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06291 2025-05-13 eess.SP cs.CE cs.HC cs.LG 57%

ALFEE: Adaptive Large Foundation Model for EEG Representation

Wei Xiong, Junming Lin, Jiangtong Li, Jie Li, Changjun Jiang

机构 * Department of Computer Science and Technology, Tongji University(计算机科学与技术系,同济大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 17pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09712 2025-05-13 stat.ML cs.LG 57%

Investigating the Impact of Balancing, Filtering, and Complexity on Predictive Multiplicity: A Data-Centric Perspective

Mustafa Cavus, Przemyslaw Biecek

机构 * Eskisehir Technical University, Department of Statistics(埃斯克谢希大学统计系) Warsaw University of Technology, Faculty of Mathematics and Information Science(华沙技术大学数学与信息科学学院) University of Warsaw, Faculty of Mathematics, Informatics and Mechanics(华沙大学数学、信息学与力学学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 38 pages, 7 figures

Journal ref Information Fusion (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10297 2025-05-13 cs.CV cs.AI 57%

On Synthetic Texture Datasets: Challenges, Creation, and Curation

Blaine Hoak, Patrick McDaniel

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04845 2025-05-09 eess.SP cs.LG 57%

Comparative Study of Generative Models for Early Detection of Failures in Medical Devices

Binesh Sadanandan, Bahareh Arghavani Nobar, Vahid Behzadan

机构 * University of New Haven(新罕布什尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03985 2025-05-09 cs.AI cs.SE 57%

LogiDebrief: A Signal-Temporal Logic based Automated Debriefing Approach with Large Language Models Integration

Zirong Chen, Ziyan An, Jennifer Reynolds, Kristin Mullen, Stephen Martini, Meiyi Ma

机构 * Department of Computer Science, Vanderbilt University(维斯尼尔大学计算机科学系) Metro Nashville Department of Emergency Communications(孟菲斯市紧急通讯部门)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted at IJCAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03796 2025-05-08 cs.CR cs.AI 57%

AI-Driven IRM: Transforming insider risk management with adaptive scoring and LLM-based threat detection

Lokesh Koli, Shubham Kalra, Rohan Thakur, Anas Saifi, Karanpreet Singh

机构 * Vectoredge

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03746 2025-05-08 cs.SI cs.AI 57%

Promoting Security and Trust on Social Networks: Explainable Cyberbullying Detection Using Large Language Models in a Stream-Based Machine Learning Framework

Silvia García-Méndez, Francisco De Arriba-Pérez

机构 * Information Technologies Group - atlanTTic University of Vigo(信息科技组 - atlanTTic大学维戈分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Journal ref In 11th International Conference on SNAMS (pp. 25-32). IEEE (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03293 2025-05-07 cs.CL 57%

Ψ-Arena: Interactive Assessment and Optimization of LLM-based Psychological Counselors with Tripartite Feedback

Shijing Zhu, Zhuang Chen, Guanqun Bi, Binghang Li, Yaxi Deng, Dazhen Wan, Libiao Peng, Xiyao Xiao, Rongsheng Zhang, Tangjie Lv, Zhipeng Hu, FangFang Li, Minlie Huang

机构 * Central South University(中南大学) CoAI Group(CoAI小组) DCST(国防科学技术大学) IAI(人工智能院) BNRIST(北京航空航天大学) Tsinghua University(清华大学) Lingxin AI(灵犀AI) Fuxi AI Lab(伏羲AI实验室) NetEase Inc.(网易公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03132 2025-05-07 cs.CV cs.AI cs.HC 57%

VISLIX: An XAI Framework for Validating Vision Models with Slice Discovery and Analysis

Xinyuan Yan, Xiwei Xuan, Jorge Piazentin Ono, Jiajing Guo, Vikram Mohanty, Shekar Arvind Kumar, Liang Gou, Bei Wang, Liu Ren

机构 * Scientific Computing and Imaging Institute, University of Utah, USA(美国犹他大学科学计算与成像研究所) University of California, Davis, USA(美国加州大学戴维斯分校) Bosch Research North America and Bosch Center for Artificial Intelligence (BCAI), USA(美国博世北美研究部及博世人工智能中心) Robert Bosch GmbH, Germany(德国博世集团) Splunk Technology, USA(美国Splunk技术公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02966 2025-05-07 cs.CV cs.AI 57%

Generating Narrated Lecture Videos from Slides with Synchronized Highlights

Alexander Holmberg

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18565 2025-05-07 cs.CR cs.AI 57%

RepliBench: Evaluating the Autonomous Replication Capabilities of Language Model Agents

Sid Black, Asa Cooper Stickland, Jake Pencharz, Oliver Sourbut, Michael Schmatz, Jay Bailey, Ollie Matthews, Ben Millwood, Alex Remedios, Alan Cooney

机构 * UK AI Security Institute (AISI)(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01694 2025-05-06 cs.CV cs.AI 57%

Topology-Aware CLIP Few-Shot Learning

Dazhi Huang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00989 2025-05-05 cs.CL 57%

VTS-LLM: Domain-Adaptive LLM Agent for Enhancing Awareness in Vessel Traffic Services through Natural Language

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR IHPC)(高性能计算研究所,科技研究局(A*STAR IHPC)) National University of Singapore(国立新加坡大学) Shanghai University(上海大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 8 pages, 5 figures, 7 tablels, submitted to ITSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00853 2025-05-05 cs.CY 57%

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen, David Atkinson, Amit Dhurandhar

专题命中 安全评测 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13565 2025-05-05 cs.LG stat.ML 57%

Learning Against Distributional Uncertainty: On the Trade-off Between Robustness and Specificity

Shixiong Wang, Haowei Wang, Xinke Li, Jean Honorio

机构 * Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) Rice-Rick Digitalization(Rice-Rick数字化) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算机与信息系统学院) ARC Training Centre in Optimisation Technologies, Integrated Methodologies, and Applications (OPTIMA)(优化技术、集成方法与应用(OPTIMA)培训中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Supplementary materials (i.e., the proofs to Theorems 1, 2, 3, and 5) are appended at the end of the main body of the paper

Journal ref IEEE Journal of Selected Topics in Signal Processing, May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21276 2025-05-01 cs.SE cs.AI 57%

Assessing LLM code generation quality through path planning tasks

Wanyi Chen, Meng-Wen Su, Mary L. Cummings

机构 * Duke University(杜克大学) George Mason University(乔治·玛莎姆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04907 2025-04-30 cs.CV cs.AI 57%

Video-Bench: Human-Aligned Video Generation Benchmark

Hui Han, Siyuan Li, Jiaqi Chen, Yiwen Yuan, Yuling Wu, Chak Tou Leong, Hanwen Du, Junchen Fu, Youhua Li, Jie Zhang, Chi Zhang, Li-jia Li, Yongxin Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) Fellou AI(Fellou人工智能) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) University of Glasgow(格拉斯哥大学) City University of Hong Kong(香港城市大学) Westlake University(西湖大学) LiveX AI(LiveX人工智能) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted by CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19759 2025-04-29 cs.CL 57%

Moral Reasoning Across Languages: The Critical Role of Low-Resource Languages in LLMs

Huichi Zhou, Zehao Xu, Munan Zhao, Kaihong Li, Yiqiang Li, Hongtao Wang

机构 * Imperial College London(伦敦帝国学院) North China Electric Power University(华北电力大学) Sun Yat-sen University(中山大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18838 2025-04-29 cs.CL 57%

Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks

Yixin Cao, Shibo Hong, Xinze Li, Jiahao Ying, Yubo Ma, Haiyuan Liang, Yantao Liu, Zijun Yao, Xiaozhi Wang, Dan Huang, Wenxuan Zhang, Lifu Huang, Muhao Chen, Lei Hou, Qianru Sun, Xingjun Ma, Zuxuan Wu, Min-Yen Kan, David Lo, Qi Zhang, Heng Ji, Jing Jiang, Juanzi Li, Aixin Sun, Xuanjing Huang, Tat-Seng Chua, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Tsinghua University(清华大学) Singapore University of Technology and Design(新加坡科技设计大学) University of California Davis(加州大学戴维斯分校) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Australian National University(澳大利亚国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17967 2025-04-28 cs.AI 57%

LLM Agent Swarm for Hypothesis-Driven Drug Discovery

Kevin Song, Andrew Trotter, Jake Y. Chen

机构 * Systems Pharmacology AI Research Center, The University of Alabama at Birmingham(系统药理学人工智能研究中心,阿拉巴马大学伯明翰分校) Department of Biomedical Engineering, The University of Alabama at Birmingham(生物医学工程系,阿拉巴马大学伯明翰分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15903 2025-04-25 cs.AI 57%

Impact of Noise on LLM-Models Performance in Abstraction and Reasoning Corpus (ARC) Tasks with Model Temperature Considerations

Nikhil Khandalkar, Pavan Yadav, Krishna Shinde, Lokesh B. Ramegowda, Rajarshi Das

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 60 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16117 2025-04-24 cs.CV cs.AI cs.HC 57%

Context-Awareness and Interpretability of Rare Occurrences for Discovery and Formalization of Critical Failure Modes

Sridevi Polavaram, Xin Zhou, Meenu Ravi, Mohammad Zarei, Anmol Srivastava

机构 * MITRE Corporation(MITRE公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Accepted to IEEE Conference for Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09385 2025-04-23 cs.AI 57%

AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities

Fabrizio Davide, Pietro Torre, Leonardo Ercolani, Andrea Gaggioli

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 47 pages, 8 figures, 17 tables, appendix with data and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15541 2025-04-23 cs.RO cs.LG 57%

RiskNet: Interaction-Aware Risk Forecasting for Autonomous Driving in Long-Tail Scenarios

Qichao Liu, Heye Huang, Shiyue Zhao, Lei Shi, Soyoung Ahn, Xiaopeng Li

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15521 2025-04-23 cs.CL 57%

The Bitter Lesson Learned from 2,000+ Multilingual Benchmarks

Minghao Wu, Weixuan Wang, Sinuo Liu, Huifeng Yin, Xintong Wang, Yu Zhao, Chenyang Lyu, Longyue Wang, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团) Monash University(墨尔本大学) The University of Edinburgh(爱丁堡大学) Tsinghua University(清华大学) Universität Hamburg(汉堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments work in progress; 22 pages, 8 figures, 3 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14891 2025-04-22 cs.CL 57%

Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey

Aoran Gan, Hao Yu, Kai Zhang, Qi Liu, Wenyu Yan, Zhenya Huang, Shiwei Tong, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) McGill University(麦吉尔大学) Tencent Company(腾讯公司) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14738 2025-04-22 cs.CL 57%

PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines

Reya Vir, Shreya Shankar, Harrison Chase, Will Fu-Hinthorn, Aditya Parameswaran

机构 * UC Berkeley(伯克利大学) LangChain

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏