arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2309.04041 2024-01-17 cs.CV cs.CL 57%

Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models

Jiaying Lu, Jinmeng Rao, Kezhen Chen, Xiaoyuan Guo, Yawen Zhang, Baochen Sun, Carl Yang, Jie Yang

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments This paper has been accepted to the AAAI'24 Workshop on Responsible Language Models (ReLM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02426 2024-01-12 cs.LG stat.ML 57%

Resilient Constrained Learning

Ignacio Hounie, Alejandro Ribeiro, Luiz F. O. Chamon

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03188 2024-01-11 cs.AI 57%

A Survey on Verification and Validation, Testing and Evaluations of Neurosymbolic Artificial Intelligence

Justus Renkhoff, Ke Feng, Marc Meier-Doernberg, Alvaro Velasquez, Houbing Herbert Song

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03646 2024-01-09 cs.LG cs.NE 57%

Evaluating Brain-Inspired Modular Training in Automated Circuit Discovery for Mechanistic Interpretability

Jatin Nainani

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03587 2024-01-09 cs.CV cs.AI 57%

Big Data and Deep Learning in Smart Cities: A Comprehensive Dataset for AI-Driven Traffic Accident Detection and Computer Vision Systems

Victor Adewopo, Nelly Elsayed, Zag Elsayed, Murat Ozer, Constantinos Zekios, Ahmed Abdelgawad, Magdy Bayoumi

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01076 2024-01-04 cs.CL 57%

DialCLIP: Empowering CLIP as Multi-Modal Dialog Retriever

Zhichao Yin, Binyuan Hui, Min Yang, Fei Huang, Yongbin Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00690 2024-01-02 cs.CL 57%

Benchmarking Large Language Models on Controllable Generation under Diversified Instructions

Yihan Chen, Benfeng Xu, Quan Wang, Yi Liu, Zhendong Mao

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00678 2024-01-02 cs.RO cs.LG q-bio.TO 57%

General-purpose foundation models for increased autonomy in robot-assisted surgery

Samuel Schmidgall, Ji Woong Kim, Alan Kuntz, Ahmed Ezzat Ghazi, Axel Krieger

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17591 2024-01-01 cs.CL 57%

Towards Faithful Explanations for Text Classification with Robustness Improvement and Explanation Guided Training

Dongfang Li, Baotian Hu, Qingcai Chen, Shan He

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16364 2023-12-29 cs.AI 57%

Robustness Verification for Knowledge-Based Logic of Risky Driving Scenes

Xia Wang, Anda Liang, Jonathan Sprinkle, Taylor T. Johnson

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02225 2023-12-29 physics.med-ph cs.CV cs.LG eess.IV 57%

Digital Histopathology with Graph Neural Networks: Concepts and Explanations for Clinicians

Alessandro Farace di Villaforesta, Lucie Charlotte Magister, Pietro Barbiero, Pietro Liò

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11203 2023-12-29 cs.CV cs.LG 57%

AVOIDDS: Aircraft Vision-based Intruder Detection Dataset and Simulator

Elysia Q. Smyers, Sydney M. Katz, Anthony L. Corso, Mykel J. Kochenderfer

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted to and presented at NeurIPS 2023, Datasets and Benchmarks Track; fixed link formatting in the abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13191 2023-12-20 cs.SE cs.LG 57%

Navigating the challenges in creating complex data systems: a development philosophy

Sören Dittmer, Michael Roberts, Julian Gilbey, Ander Biguri, AIX-COVNET Collaboration, Jacobus Preller, James H. F. Rudd, John A. D. Aston, Carola-Bibiane Schönlieb

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06961 2023-12-19 cs.CV cs.AI 57%

Towards Reliable Dermatology Evaluation Benchmarks

Fabian Gröger, Simone Lionetti, Philippe Gottfrois, Alvaro Gonzalez-Jimenez, Matthew Groh, Roxana Daneshjou, Labelling Consortium, Alexander A. Navarini, Marc Pouly

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Link to the revised file lists: https://github.com/Digital-Dermatology/SelfClean-Revised-Benchmarks

Journal ref Proceedings of the 3rd Machine Learning for Health Symposium, PMLR 225:101-128, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15466 2023-12-19 cs.LG cs.GT stat.ML 57%

Data Banzhaf: A Robust Data Valuation Framework for Machine Learning

Jiachen T. Wang, Ruoxi Jia

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments AISTATS 2023 Oral

Journal ref AISTATS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00878 2023-12-15 cs.CV cs.AI 57%

Grounding Everything: Emerging Localization Properties in Vision-Language Transformers

Walid Bousselham, Felix Petersen, Vittorio Ferrari, Hilde Kuehne

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Code available at https://github.com/WalBouss/GEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06858 2023-12-13 cs.RO cs.AI cs.MA cs.SY eess.SY 57%

Scalable Decentralized Cooperative Platoon using Multi-Agent Deep Reinforcement Learning

Ahmed Abdelrahman, Omar M. Shehata, Yarah Basyoni, Elsayed I. Morgan

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06632 2023-12-12 cs.AI 57%

Control Risk for Potential Misuse of Artificial Intelligence in Science

Jiyan He, Weitao Feng, Yaosen Min, Jingwei Yi, Kunsheng Tang, Shuai Li, Jie Zhang, Kejiang Chen, Wenbo Zhou, Xing Xie, Weiming Zhang, Nenghai Yu, Shuxin Zheng

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05256 2023-12-12 eess.IV cs.AI 57%

Holistic Evaluation of GPT-4V for Biomedical Imaging

Zhengliang Liu, Hanqi Jiang, Tianyang Zhong, Zihao Wu, Chong Ma, Yiwei Li, Xiaowei Yu, Yutong Zhang, Yi Pan, Peng Shu, Yanjun Lyu, Lu Zhang, Junjie Yao, Peixin Dong, Chao Cao, Zhenxiang Xiao, Jiaqi Wang, Huan Zhao, Shaochen Xu, Yaonai Wei, Jingyuan Chen, Haixing Dai, Peilong Wang, Hao He, Zewei Wang, Xinyu Wang, Xu Zhang, Lin Zhao, Yiheng Liu, Kai Zhang, Liheng Yan, Lichao Sun, Jun Liu, Ning Qiang, Bao Ge, Xiaoyan Cai, Shijie Zhao, Xintao Hu, Yixuan Yuan, Gang Li, Shu Zhang, Xin Zhang, Xi Jiang, Tuo Zhang, Dinggang Shen, Quanzheng Li, Wei Liu, Xiang Li, Dajiang Zhu, Tianming Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04808 2023-12-11 cs.CV cs.AI 57%

A Review On Table Recognition Based On Deep Learning

Shi Jiyuan, Shi chunqi

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 12 figures,6 tables, in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04724 2023-12-11 cs.CR cs.LG 57%

Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models

Manish Bhatt, Sahana Chennabasappa, Cyrus Nikolaidis, Shengye Wan, Ivan Evtimov, Dominik Gabi, Daniel Song, Faizan Ahmad, Cornelius Aschermann, Lorenzo Fontana, Sasha Frolov, Ravi Prakash Giri, Dhaval Kapil, Yiannis Kozyrakis, David LeBlanc, James Milazzo, Aleksandar Straumann, Gabriel Synnaeve, Varun Vontimitta, Spencer Whitman, Joshua Saxe

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03891 2023-12-08 cs.HC cs.LG 57%

Evaluation of Infrastructure-based Warning System on Driving Behaviors-A Roundabout Study

Cong Zhang, Chi Tian, Tianfang Han, Hang Li, Yiheng Feng, Yunfeng Chen, Robert W. Proctor, Jiansong Zhang

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18040 2023-12-01 cs.CY 57%

Evaluating Trustworthiness of AI-Enabled Decision Support Systems: Validation of the Multisource AI Scorecard Table (MAST)

Pouria Salehi, Yang Ba, Nayoung Kim, Ahmadreza Mosallanezhad, Anna Pan, Myke C. Cohen, Yixuan Wang, Jieqiong Zhao, Shawaiz Bhatti, James Sung, Erik Blasch, Michelle V. Mancenido, Erin K. Chiou

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01870 2023-11-30 cs.LG 57%

DeepDecipher: Accessing and Investigating Neuron Activation in Large Language Models

Albert Garde, Esben Kran, Fazl Barez

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 5 pages (9 total), 1 figure, submitted to NeurIPS 2023 Workshop XAIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16654 2023-11-29 cs.LG 57%

Elucidating Discrepancy in Explanations of Predictive Models Developed using EMR

Aida Brankovic, Wenjie Huang, David Cook, Sankalp Khanna, Konstanty Bialkowski

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15800 2023-11-28 cs.CY 57%

Public sentiment analysis and topic modeling regarding ChatGPT in mental health on Reddit: Negative sentiments increase over time

Yunna Cai, Fan Wang, Haowei Wang, Qianwen Qian

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

Comments 11 pages.8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15736 2023-11-28 cs.RO cs.AI 57%

SceneDM: Scene-level Multi-agent Trajectory Generation with Consistent Diffusion Models

Zhiming Guo, Xing Gao, Jianlan Zhou, Xinyu Cai, Botian Shi

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14966 2023-11-28 cs.CL 57%

Walking a Tightrope -- Evaluating Large Language Models in High-Risk Domains

Chia-Chien Hung, Wiem Ben Rim, Lindsay Frost, Lars Bruckner, Carolin Lawrence

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments EMNLP 2023 Workshop on Benchmarking Generalisation in NLP (GenBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14057 2023-11-27 cs.AI 57%

Assessing the Impact of Noise on Quantum Neural Networks: An Experimental Analysis

Erik B. Terres Escudero, Danel Arias Alamo, Oier Mentxaka Gómez, Pablo García Bringas

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Journal ref Hybrid Artificial Intelligent Systems. HAIS 2023. Lecture Notes in Computer Science(), vol 14001. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14029 2023-11-27 cs.CV cs.LG 57%

Understanding the Vulnerability of CLIP to Image Compression

Cangxiong Chen, Vinay P. Namboodiri, Julian Padget

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏