arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2406.11873 2024-06-19 cs.AI 70%

Logic-Based Explainability: Past, Present & Future

Joao Marques-Silva

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10091 2024-06-07 cs.AI 70%

Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges

Ziyuan Zhou, Guanjun Liu, Ying Tang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 43 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00018 2024-06-04 cs.CL cs.IR 70%

Large Language Models' Detection of Political Orientation in Newspapers

Alessio Buscemi, Daniele Proverbio

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08317 2024-05-15 cs.CL cs.SD eess.AS 70%

SpeechGuard: Exploring the Adversarial Robustness of Multimodal Large Language Models

Raghuveer Peri, Sai Muralidhar Jayanthi, Srikanth Ronanki, Anshu Bhatia, Karel Mundnich, Saket Dingliwal, Nilaksh Das, Zejiang Hou, Goeric Huybrechts, Srikanth Vishnubhotla, Daniel Garcia-Romero, Sundararajan Srinivasan, Kyu J Han, Katrin Kirchhoff

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 9+6 pages, Submitted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13161 2024-04-23 cs.CR cs.LG 70%

CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models

Manish Bhatt, Sahana Chennabasappa, Yue Li, Cyrus Nikolaidis, Daniel Song, Shengye Wan, Faizan Ahmad, Cornelius Aschermann, Yaohui Chen, Dhaval Kapil, David Molnar, Spencer Whitman, Joshua Saxe

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10354 2024-04-17 q-bio.QM cs.CE cs.LG 70%

Physical formula enhanced multi-task learning for pharmacokinetics prediction

Ruifeng Li, Dongzhan Zhou, Ancheng Shen, Ao Zhang, Mao Su, Mingqian Li, Hongyang Chen, Gang Chen, Yin Zhang, Shufei Zhang, Yuqiang Li, Wanli Ouyang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14988 2024-03-25 cs.CL 70%

Risk and Response in Large Language Models: Evaluating Key Threat Categories

Bahareh Harandizadeh, Abel Salinas, Fred Morstatter

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08984 2024-03-15 cs.RO cs.AI cs.MA 70%

Safe Road-Crossing by Autonomous Wheelchairs: a Novel Dataset and its Experimental Evaluation

Carlo Grigioni, Franca Corradini, Alessandro Antonucci, Jérôme Guzzi, Francesco Flammini

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10083 2024-02-16 cs.AI 70%

Fine-tuning Large Language Model (LLM) Artificial Intelligence Chatbots in Ophthalmology and LLM-based evaluation using GPT-4

Ting Fang Tan, Kabilan Elangovan, Liyuan Jin, Yao Jie, Li Yong, Joshua Lim, Stanley Poh, Wei Yan Ng, Daniel Lim, Yuhe Ke, Nan Liu, Daniel Shu Wei Ting

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

Comments 13 Pages, 1 Figure, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10534 2023-12-19 cs.LG cs.CR cs.CV 70%

Rethinking Robustness of Model Attributions

Sandesh Kamath, Sankalp Mittal, Amit Deshpande, Vineeth N Balasubramanian

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments Accepted AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10059 2023-12-19 cs.CY 70%

A collection of principles for guiding and evaluating large language models

Konstantin Hebenstreit, Robert Praas, Matthias Samwald

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY

Comments Accepted at Socially Responsible Language Modelling Research (SoLaR) workshop, NeurIPS 2023 (https://openreview.net/forum?id=8iXdNXW34d). Based on previous manuscript version: doi:10.2139/ssrn.4446991

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05392 2023-12-12 cs.AI 70%

The logic of NTQR evaluations of noisy AI agents: Complete postulates and logically consistent error correlations

Andrés Corrada-Emmanuel

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments 18 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15888 2023-11-28 cs.CR cs.AI 70%

Towards Adaptive RF Fingerprint-based Authentication of IIoT devices

Emmanuel Lomba, Ricardo Severino, Ana Fernández Vilas

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

Journal ref IEEE 27th International Conference on Emerging Technologies and Factory Automation (ETFA), Stuttgart, Germany, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12004 2023-11-21 cs.LG 70%

Risk-averse Batch Active Inverse Reward Design

Panagiotis Liampas

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04813 2023-11-09 cs.CV cs.LG 70%

Be Careful When Evaluating Explanations Regarding Ground Truth

Hubert Baniecki, Maciej Chrabaszcz, Andreas Holzinger, Bastian Pfeifer, Anna Saranti, Przemyslaw Biecek

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11835 2023-10-30 cs.LG math.AT stat.ML 70%

Topological Parallax: A Geometric Specification for Deep Perception Models

Abraham D. Smith, Michael J. Catanzaro, Gabrielle Angeloro, Nirav Patel, Paul Bendich

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments 18 pages, 6 figures. Preprint submitted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12945 2023-10-27 cs.CL 70%

ExplainCPE: A Free-text Explanation Benchmark of Chinese Pharmacist Examination

Dongfang Li, Jindi Yu, Baotian Hu, Zhenran Xu, Min Zhang

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13625 2023-10-23 cs.CY 70%

Oversight for Frontier AI through a Know-Your-Customer Scheme for Compute Providers

Janet Egan, Lennart Heim

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01269 2023-09-06 cs.RO cs.CY cs.HC 70%

Outlining the design space of eXplainable swarm (xSwarm): experts perspective

Mohammad Naiseh, Mohammad D. Soorati, Sarvapali Ramchurn

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY

Comments In the 16th International Symposium on Distributed Autonomous Robotic Systems 2022, November 28-30, 2022, Montbeliard, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01301 2023-07-07 cs.AI quant-ph 70%

Reliable AI: Does the Next Generation Require Quantum Computing?

Aras Bacho, Holger Boche, Gitta Kutyniok

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12173 2023-03-10 cs.CV cs.LG 70%

Towards Human-Interpretable Prototypes for Visual Assessment of Image Classification Models

Poulami Sinhamahapatra, Lena Heidemann, Maureen Monnet, Karsten Roscher

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Journal ref Proceedings of the 18th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications - Volume 5: VISAPP, 878-887, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.10729 2022-11-18 cs.LG cs.CV 70%

Fair Robust Active Learning by Joint Inconsistency

Tsung-Han Wu, Hung-Ting Su, Shang-Tse Chen, Winston H. Hsu

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.05459 2022-09-13 cs.CY 70%

How Do AI Timelines Affect Existential Risk?

Stephen McAleese

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01642 2022-09-07 cs.LG 70%

Fraud Detection Using Optimized Machine Learning Tools Under Imbalance Classes

Mary Isangediok, Kelum Gajamannage

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments 10 pages, 10 figures, submitted to IEEE BigData 2022 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14157 2022-07-29 cs.SE cs.AI 70%

A Hazard Analysis Framework for Code Synthesis Large Language Models

Heidy Khlaaf, Pamela Mishkin, Joshua Achiam, Gretchen Krueger, Miles Brundage

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.11471 2021-12-23 cs.AI cs.CL cs.CY cs.HC cs.LG 70%

Towards a Science of Human-AI Decision Making: A Survey of Empirical Studies

Vivian Lai, Chacha Chen, Q. Vera Liao, Alison Smith-Renner, Chenhao Tan

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 36 pages, 2 figures, see https://haidecisionmaking.github.io for website

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07445 2021-09-16 cs.CL cs.AI cs.CY cs.LG 70%

Challenges in Detoxifying Language Models

Johannes Welbl, Amelia Glaese, Jonathan Uesato, Sumanth Dathathri, John Mellor, Lisa Anne Hendricks, Kirsty Anderson, Pushmeet Kohli, Ben Coppin, Po-Sen Huang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 23 pages, 6 figures, published in Findings of EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09928 2026-08-11 cs.CV cs.AI cs.CL cs.LG 新提交 69%

Multimodal Model Diffing for Feature Discovery and Control

用于特征发现与控制的多模态模型差异分析

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

机构 * University of Oxford(牛津大学) Microsoft(微软公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。

Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26886 2026-07-30 cs.CV cs.AI cs.CL cs.CY 新提交 69%

Hearsay: Vision-Language Medical Diagnoses Without an Image

Hearsay:无需图像的视觉-语言医学诊断

Siddharth Vohra

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services AI Native(亚马逊网络服务AI原生部门)

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。

Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25258 2026-05-26 cs.IR cs.AI cs.CY cs.LG 69%

First, do no harm: Breaking suicidogenic echo chambers in media recommendation

首先,不伤害:打破媒体推荐中的自杀性回音室

Alberto Díaz-Álvarez, Raúl Lara-Cabrera, Fernando Ortega-Requena, Víctor Ramos-Osuna

机构 * E.T.S.I. Sistemas Informáticos (Universidad Politécnica de Madrid)(马德里理工大学信息系统工程系)

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG

AI总结 针对推荐系统在心理健康场景中可能加剧用户自杀倾向的问题,提出RankAid重排序方法,通过惩罚有害内容并提升治疗性内容,在保持推荐准确性的同时确保临床安全。

Comments 10 pages, 5 figures. Research on safety-aware recommender systems and algorithmic ethics

详情

展开后加载摘要…

URL PDF HTML 收藏