arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2510.02334 2025-10-06 cs.CL cs.AI cs.LG 75%

Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing

Zhe Li, Wei Zhao, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01780 2025-10-03 cs.CR cs.AI cs.CY cs.LG 75%

Secure Multi-Modal Data Fusion in Federated Digital Health Systems via MCP

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉安吞国际技术学院,泰国 Thammasat 大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 6 pages, 8 figures, 7 equations, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15871 2025-09-18 cs.CY cs.AI cs.CL 75%

A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare

Manar Aljohani, Jun Hou, Sindhura Kommu, Xuan Wang

机构 * Virginia Tech(维吉尼亚理工大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08852 2025-09-12 cs.CY cs.AI cs.LG 75%

Safe and Certifiable AI Systems: Concepts, Challenges, and Lessons Learned

Kajetan Schweighofer, Barbara Brune, Lukas Gruber, Simon Schmid, Alexander Aufreiter, Andreas Gruber, Thomas Doms, Sebastian Eder, Florian Mayer, Xaver-Paul Stadlbauer, Christoph Schwald, Werner Zellinger, Bernhard Nessler, Sepp Hochreiter

机构 * TRUSTIFAI GMBH(TRUSTIFAI公司) TÜV AUSTRIA HOLDING AG(TÜV奥地利控股公司) Software Competence Center Hagenberg(哈根贝格软件竞争力中心) Johannes Kepler University Linz - Institute for Machine Learning(林茨约瑟夫·约瑟夫斯大学-机器学习研究所)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 63 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05042 2025-09-08 cs.RO 75%

Shared Autonomy through LLMs and Reinforcement Learning for Applications to Ship Hull Inspections

Cristiano Caissutti, Estelle Gerbier, Ehsan Khorrambakht, Paolo Marinelli, Andrea Munafo', Andrea Caiti

机构 * Dept. of Information Engineering University of Pisa, Italy Pisa, Italy(信息工程系 乌迪内大学 乌迪内,意大利)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09864 2025-08-14 cs.LG cs.AI cs.CL cs.CV 75%

LUMA: A Benchmark Dataset for Learning from Uncertain and Multimodal Data

Grigor Bezirganyan, Sana Sellami, Laure Berti-Équille, Sébastien Fournier

机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SIGIR 2025

Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00159 2025-08-06 cs.AI cs.CY cs.LG econ.TH math.OC 75%

Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power

Jobst Heitzig, Ram Potham

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13666 2025-07-28 cs.CL cs.AI cs.CY 75%

Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation

Aneta Zugecova, Dominik Macko, Ivan Srba, Robert Moro, Jakub Kopal, Katarina Marcincinova, Matus Mesarcik

机构 * Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所) University of Copenhagen(哥本哈根大学) Comenius University in Bratislava(布拉迪斯拉瓦科เมนius大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments ACL 2025 main

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025 Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10706 2025-07-23 cs.CL cs.AI cs.CY cs.HC cs.RO 75%

SciFi-Benchmark: Leveraging Science Fiction To Improve Robot Behavior

Pierre Sermanet, Anirudha Majumdar, Vikas Sindhwani

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Minor improvements over previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16804 2025-06-25 cs.LG cs.AI cs.CY cs.ET 75%

Multimodal Machine Learning in Mental Health: A Survey of Data, Algorithms, and Challenges

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London United Kingdom Queen Mary University of London \& Jo z ef Stefan Institute United Kingdom \& Slovenia Queen Mary University of London Queen Mary University of London \& Jo z ef Stefan Institute

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18213 2025-06-06 cs.LG cs.AI cs.CL cs.CR 75%

Scaling Trends in Language Model Robustness

Nikolaus Howe, Ian McKenzie, Oskar Hollinsworth, Michał Zajac, Tom Tseng, Aaron Tucker, Pierre-Luc Bacon, Adam Gleave

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 59 pages; updated to ICML version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18635 2025-05-09 cs.LG cs.AI cs.CL 75%

Faster, Cheaper, Better: Multi-Objective Hyperparameter Optimization for LLM and RAG Systems

Matthew Barker, Andrew Bell, Evan Thomas, James Carr, Thomas Andrews, Umang Bhatt

机构 * Trustwise AI New York University(纽约大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00049 2025-05-02 cs.CY cs.CL cs.HC cs.LG 75%

Humanizing LLMs: A Survey of Psychological Measurements with Tools, Datasets, and Human-Agent Applications

Wenhan Dong, Yuemeng Zhao, Zhen Sun, Yule Liu, Zifan Peng, Jingyi Zheng, Zongmin Zhang, Ziyi Zhang, Jun Wu, Ruiming Wang, Shengmin Xu, Xinyi Huang, Xinlei He

机构 * Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)信息中心) School of Psychology, South China Normal University(华南师范大学心理学学院) College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全学院) College of Cyber Security, Jinan University(济南大学网络安全学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG

Comments 26 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09024 2025-04-21 cs.LG cs.AI cs.CL 75%

AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents

Maksym Andriushchenko, Alexandra Souly, Mateusz Dziemian, Derek Duenas, Maxwell Lin, Justin Wang, Dan Hendrycks, Andy Zou, Zico Kolter, Matt Fredrikson, Eric Winsor, Jerome Wynne, Yarin Gal, Xander Davies

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23213 2025-04-01 cs.CL cs.AI cs.LG 75%

RECALL-MM: A Multimodal Dataset of Consumer Product Recalls for Risk Analysis using Computational Methods and Large Language Models

Diana Bolanos, Mohammadmehdi Ataei, Daniele Grandi, Kosa Goucher-Lambert

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05812 2025-03-11 cs.CY cs.AI cs.CR cs.HC cs.LG 75%

Intolerable Risk Threshold Recommendations for Artificial Intelligence

Deepika Raman, Nada Madkour, Evan R. Murphy, Krystal Jackson, Jessica Newman

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 79 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17710 2025-02-26 cs.AI cs.CL cs.CV cs.LG 75%

Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures

Akhila Yerukola, Saadia Gabriel, Nanyun Peng, Maarten Sap

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 40 pages, 49 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11120 2025-01-22 cs.CL cs.AI cs.CR cs.LG 75%

Tell me about yourself: LLMs are aware of their learned behaviors

Jan Betley, Xuchan Bao, Martín Soto, Anna Sztyber-Betley, James Chua, Owain Evans

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submitted to ICLR 2025. 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07836 2025-01-20 cs.CY cs.AI cs.LG 75%

Two Types of AI Existential Risk: Decisive and Accumulative

Atoosa Kasirzadeh

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Journal article for Philosophical Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09431 2025-01-17 cs.AI cs.CL cs.CR cs.CY 75%

A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy

Huandong Wang, Wenjie Fu, Yingzhou Tang, Zhilong Chen, Yuxi Huang, Jinghua Piao, Chen Gao, Fengli Xu, Tao Jiang, Yong Li

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01695 2024-09-06 cs.CL cs.AI cs.LG 75%

Language-Guided World Models: A Model-Based Approach to AI Control

Alex Zhang, Khanh Nguyen, Jens Tuyls, Albert Lin, Karthik Narasimhan

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments SpLU-RoboNLP workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04694 2024-07-08 cs.CL cs.AI cs.LG 75%

Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs

Rudolf Laine, Bilal Chughtai, Jan Betley, Kaivalya Hariharan, Jeremy Scheurer, Mikita Balesni, Marius Hobbhahn, Alexander Meinke, Owain Evans

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 page main body, 98 page appendix, 58 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17234 2024-06-11 cs.CL cs.CY cs.LG 75%

Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation

Sahar Abdelnabi, Amr Gomaa, Sarath Sivaprasad, Lea Schönherr, Mario Fritz

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG

Comments Updated version with major additions (new experiments, evaluation, and attacks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00062 2024-06-05 cs.CL cs.AI cs.CR cs.LG 75%

Unlocking the Potential of Large Language Models for Clinical Text Anonymization: A Comparative Study

David Pissarra, Isabel Curioso, João Alveira, Duarte Pereira, Bruno Ribeiro, Tomás Souper, Vasco Gomes, André V. Carreiro, Vitor Rolla

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16149 2023-10-02 cs.CL cs.AI cs.LG 75%

Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models

Neha Sengupta, Sunil Kumar Sahu, Bokang Jia, Satheesh Katipomu, Haonan Li, Fajri Koto, William Marshall, Gurpreet Gosal, Cynthia Liu, Zhiming Chen, Osama Mohammed Afzal, Samta Kamboj, Onkar Pandit, Rahul Pal, Lalit Pradhan, Zain Muhammad Mujahid, Massa Baali, Xudong Han, Sondos Mahmoud Bsharat, Alham Fikri Aji, Zhiqiang Shen, Zhengzhong Liu, Natalia Vassilieva, Joel Hestness, Andy Hock, Andrew Feldman, Jonathan Lee, Andrew Jackson, Hector Xuguang Ren, Preslav Nakov, Timothy Baldwin, Eric Xing

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.05375 2020-01-16 cs.AI cs.CY cs.LG 75%

AAAI FSS-19: Human-Centered AI: Trustworthiness of AI Models and Data Proceedings

Florian Buettner, John Piorkowski, Ian McCulloh, Ulli Waltinger

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Proceedings for AAAI 2019 Fall Symposium Series - Human-centered AI: Trustworthiness of AI Models & Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 74%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06874 2026-03-10 cs.AI cs.CL 74%

LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models

LieCraft:一种用于评估语言模型欺骗能力的多智能体框架

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Tri Nguyen, Vasudev Lal, Joseph Campbell, Simon Stepputtis, Shao-Yen Tseng

机构 * Intel Labs(英特尔实验室)

专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI

AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。

Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20825 2026-08-24 cs.AI 新提交 74%

Prediction certification cannot replace explanation certification: a competence envelope for trustworthy AI under compound stress

预测认证无法替代解释认证:复合压力下可信人工智能的能力边界

Nataliya Shakhovska, Ivan Izonin, Stergios-Aristoteles Mitoulis

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 研究表明仅预测侧认证无法确保AI可信,提出结合预测与解释认证的能力边界框架,可捕捉预测侧认证遗漏的失效模式,为可信AI认证提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 74%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 安全评测 :safety(title);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏