arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2506.22808 2025-07-01 cs.CL cs.AI 73%

MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs

Jianhui Wei, Zijie Meng, Zikai Xiao, Tianxiang Hu, Yang Feng, Zhijie Zhou, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(Angelalign技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05489 2025-07-01 cs.CL cs.AI 73%

Mechanistic Interpretability of Emotion Inference in Large Language Models

Ala N. Tak, Amin Banayeeanzade, Anahita Bolourani, Mina Kian, Robin Jia, Jonathan Gratch

机构 * Institute for Creative Technologies, University of Southern California (USC)(创意技术研究所,南加州大学) Information Sciences Institute, University of Southern California (USC)(信息科学研究所,南加州大学) Department of Computer Science, University of Southern California (USC)(计算机科学系,南加州大学) Department of Statistics and Data Science, University of California, Los Angeles (UCLA)(统计与数据科学系,加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 camera-ready version. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09251 2025-06-23 cs.RO cs.AI cs.LG 73%

V2X-VLM: End-to-End V2X Cooperative Autonomous Driving Through Large Vision-Language Models

Junwei You, Haotian Shi, Zhuoyu Jiang, Zilin Huang, Rui Gan, Keshu Wu, Xi Cheng, Xiaopeng Li, Bin Ran

机构 * organization= Department of Civil Environmental Engineering, University of Wisconsin–Madison , city= Madison , state= WI , postcode= 53706 , country= USA organization= College of Computing Data Science, Nanyang Technological University , city= Singapore , postcode= 639798 , country= Singapore organization= College of Transportation, Tongji University , city= Shanghai , postcode= 201804 , country= China organization= Zachry Department of Civil Environmental Engineering, Texas A\&M University , city= College Station , state= TX , postcode= 77840 , country= USA organization= School of Civil Environmental Engineering, Cornell University , city= Ithaca , state= NY , postcode= 14853 , country= USA

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16645 2025-06-19 cs.CL cs.AI cs.SE 73%

CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at Scale

Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng, Xuyi Yang, Kaiyue Qiu, Yao Wan, Zhou Zhao, Xuanhua Shi, Dongping Chen

机构 * National Engineering Research Center for Big Data Technology and Systems(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学) Wuhuan University(吴奂大学) Zhejiang University(浙江大学)

专题命中 安全评测 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI

Journal ref International Conference of Machine Learning, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09408 2025-06-12 cs.CL cs.AI 73%

Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models

Jui-Ming Yao, Hao-Yuan Chen, Zi-Xian Tang, Bing-Jia Tan, Sheng-Wei Peng, Bing-Cheng Xie, Shun-Feng Su

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系) National Taiwan University of Science and Technology(台湾科技大学) Bachelor’s Program in Computer Science(计算机科学学士班) University of London(伦敦大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03381 2025-06-05 eess.SY cs.AI cs.LG cs.SY 73%

Automated Traffic Incident Response Plans using Generative Artificial Intelligence: Part 1 -- Building the Incident Response Benchmark

Artur Grigorev, Khaled Saleh, Jiwon Kim, Adriana-Simona Mihaita

机构 * University of Technology Sydney(技术学院悉尼大学) University of Newcastle(新castle大学) The University of Queensland(昆士兰大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11642 2025-05-28 cs.MA cs.AI cs.LG 73%

PeerGuard: Defending Multi-Agent Systems Against Backdoor Attacks Through Mutual Reasoning

Falong Fan, Xi Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted to IEEE IRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15114 2025-05-28 cs.LG cs.AI 73%

RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts

Hjalmar Wijk, Tao Lin, Joel Becker, Sami Jawhar, Neev Parikh, Thomas Broadley, Lawrence Chan, Michael Chen, Josh Clymer, Jai Dhyani, Elena Ericheva, Katharyn Garcia, Brian Goodrich, Nikola Jurkovic, Holden Karnofsky, Megan Kinniment, Aron Lajko, Seraphina Nix, Lucas Sato, William Saunders, Maksym Taran, Ben West, Elizabeth Barnes

机构 * METR AI R&D Evaluation(METR AI R&D评估)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19443 2025-05-27 cs.SE cs.AI cs.CL 73%

Vibe Coding vs. Agentic Coding: Fundamentals and Practical Implications of Agentic AI

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments 35 Pages, 8 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16100 2025-05-23 cs.AI cs.CL 73%

BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research

Zifeng Wang, Benjamin Danek, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14943 2025-05-22 cs.LG cs.AI 73%

Soft Prompts for Evaluation: Measuring Conditional Distance of Capabilities

Ross Nordby

机构 * Ross Nordby(独立研究者)

专题命中 安全评测 :alignment(abstract);red teaming(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12692 2025-05-20 cs.AI cs.CL 73%

Bullying the Machine: How Personas Increase LLM Vulnerability

Ziwei Xu, Udit Sanghi, Mohan Kankanhalli

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10670 2025-05-19 cs.AI cs.CY cs.GT 73%

Interpretable Risk Mitigation in LLM Agent Systems

Jan Chojnacki

机构 * Department of Physics, University of Warsaw(华沙大学物理系) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04994 2025-04-22 cs.CL cs.AI 73%

Following the Whispers of Values: Unraveling Neural Mechanisms Behind Value-Oriented Behaviors in LLMs

Ling Hu, Yuemei Xu, Xiaoyang Gu, Letao Han

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14520 2025-04-22 cs.AI cs.CL 73%

Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Muhammad Awais Khan Bangash, Muhammad Ali Jamshed

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) School of Electrical and Computer Engineering, Oklahoma State University(电气与计算机工程学院,俄克拉荷马州立大学) University of Glasgow(格拉斯哥大学)

专题命中 安全评测 :RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Submitted to IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14448 2025-04-22 cs.AI cs.LG math.OC stat.ME 73%

Seeing Through Risk: A Symbolic Approximation of Prospect Theory

Ali Arslan Yousaf, Umair Rehman, Muhammad Umair Danish

机构 * Tradeweb Markets Western University(西方大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07123 2025-04-21 cs.CY cs.LG 73%

Transforming disaster risk reduction with AI and big data: Legal and interdisciplinary perspectives

Kwok P Chun, Thanti Octavianti, Nilay Dogulu, Hristos Tyralis, Georgia Papacharalampous, Ryan Rowberry, Pingyu Fan, Mark Everard, Maria Francesch-Huidobro, Wellington Migliari, David M. Hannah, John Travis Marshall, Rafael Tolosana Calasanz, Chad Staddon, Ida Ansharyani, Bastien Dieppois, Todd R Lewis, Juli Ponce, Silvia Ibrean, Tiago Miguel Ferreira, Chinkie Peliño-Golle, Ye Mu, Manuel Delgado, Elizabeth Silvestre Espinoza, Martin Keulertz, Deepak Gopinath, Cheng Li

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG

Comments 20 pages, 2 figures

Journal ref Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery 15 (2025) e70011

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12491 2025-04-01 cs.AI cs.LG 73%

AI in radiological imaging of soft-tissue and bone tumours: a systematic review evaluating against CLAIM and FUTURE-AI guidelines

Douwe J. Spaanderman, Matthew Marzetti, Xinyi Wan, Andrew F. Scarsbrook, Philip Robinson, Edwin H. G. Oei, Jacob J. Visser, Robert Hemke, Kirsten van Langevelde, David F. Hanff, Geert J. L. H. van Leenders, Cornelis Verhoef, Dirk J. Gruühagen, Wiro J. Niessen, Stefan Klein, Martijn P. A. Starmans

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 6 figures, 8 supplementary figures

Journal ref eBioMedicine(2025), Volume 114, 105642

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18935 2025-02-27 cs.CL cs.AI 73%

JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models

Shuyi Liu, Simiao Cui, Haoran Bu, Yuming Shang, Xi Zhang

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures, accepted at PAKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06867 2025-02-12 cs.CL cs.AI 73%

Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests

David Noever, Forrest McKee

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00786 2025-01-24 cs.CY cs.AI cs.HC 73%

Whether to trust: the ML leap of faith

Tory Frame, Julian Padget, George Stothart, Elizabeth Coulthard

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04308 2025-01-07 cs.AI cs.CL cs.HC 73%

Personality testing of Large Language Models: Limited temporal stability, but highlighted prosociality

Bojana Bodroza, Bojana M. Dinic, Ljubisa Bojic

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03642 2024-12-17 cs.CL cs.AI cs.HC 73%

Aligning LLMs with Individual Preferences via Interaction

Shujin Wu, May Fung, Cheng Qian, Jeonghwan Kim, Dilek Hakkani-Tur, Heng Ji

专题命中 安全评测 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments Accepted to COLING 2025. The code and dataset are made public at https://github.com/ShujinWu-0814/ALOE

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01002 2024-12-17 cs.CL cs.AI 73%

Attribute Structuring Improves LLM-Based Evaluation of Clinical Text Summaries

Zelalem Gero, Chandan Singh, Yiqing Xie, Sheng Zhang, Praveen Subramanian, Paul Vozila, Tristan Naumann, Jianfeng Gao, Hoifung Poon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

Comments Published in ML4H Findings 2024, 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02512 2024-12-16 cs.CY cs.AI 73%

Pre-Deployment Information Sharing: A Zoning Taxonomy for Precursory Capabilities

Matteo Pistillo, Charlotte Stix

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02145 2024-12-04 cs.CY cs.AI 73%

Effective Mitigations for Systemic Risks from General-Purpose AI

Risto Uuk, Annemieke Brouwer, Tim Schreier, Noemi Dreksler, Valeria Pulignano, Rishi Bommasani

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 78 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15374 2024-10-22 cs.LG cs.AI cs.CV 73%

Explainability of Point Cloud Neural Networks Using SMILE: Statistical Model-Agnostic Interpretability with Local Explanations

Seyed Mohammad Ahmadi, Koorosh Aslansefat, Ruben Valcarce-Dineiro, Joshua Barnfather

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14281 2024-08-27 cs.LG cs.AI cs.CV 73%

Uncertainties of Latent Representations in Computer Vision

Michael Kirchhof

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

Comments Doctoral thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05919 2024-07-09 cs.LG cs.CY 73%

Fostering Trust and Quantifying Value of AI and ML

Dalmo Cirne, Veena Calambur

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17864 2024-06-27 cs.CY cs.AI 73%

AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies

Yi Zeng, Kevin Klyman, Andy Zhou, Yu Yang, Minzhou Pan, Ruoxi Jia, Dawn Song, Percy Liang, Bo Li

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏