arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2404.13660 2024-04-23 cs.CL 57%

Trojan Detection in Large Language Models: Insights from The Trojan Detection Challenge

Narek Maloyan, Ekansh Verma, Bulat Nutfullin, Bislan Ashinov

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16211 2024-04-02 cs.CV cs.AI 57%

VDC: Versatile Data Cleanser based on Visual-Linguistic Inconsistency by Multimodal Large Language Models

Zihao Zhu, Mingda Zhang, Shaokui Wei, Bingzhe Wu, Baoyuan Wu

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

Comments Accepted to ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14965 2024-03-28 cs.CL 57%

Tricking LLMs into Disobedience: Formalizing, Analyzing, and Detecting Jailbreaks

Abhinav Rao, Sachin Vashistha, Atharva Naik, Somak Aditya, Monojit Choudhury

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

Comments Accepted at LREC-COLING 2024 - The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10330 2024-03-18 cs.LG 57%

Towards Non-Adversarial Algorithmic Recourse

Tobias Leemann, Martin Pawelczyk, Bardh Prenkaj, Gjergji Kasneci

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15911 2024-02-27 cs.CR cs.CL 57%

PRP: Propagating Universal Perturbations to Attack Large Language Model Guard-Rails

Neal Mangaokar, Ashish Hooda, Jihye Choi, Shreyas Chandrashekaran, Kassem Fawaz, Somesh Jha, Atul Prakash

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11082 2024-02-20 cs.CR cs.AI 57%

The AI Security Pyramid of Pain

Chris M. Ward, Josh Harguess, Julia Tao, Daniel Christman, Paul Spicer, Mike Tan

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

Comments SPIE DCS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08767 2024-01-30 cs.CR cs.AI 57%

Masked Language Model Based Textual Adversarial Example Detection

Xiaomei Zhang, Zhaoxi Zhang, Qi Zhong, Xufei Zheng, Yanjun Zhang, Shengshan Hu, Leo Yu Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 13 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08565 2024-01-29 cs.RO cs.AI 57%

Security Considerations in AI-Robotics: A Survey of Current Methods, Challenges, and Opportunities

Subash Neupane, Shaswata Mitra, Ivan A. Fernandez, Swayamjit Saha, Sudip Mittal, Jingdao Chen, Nisha Pillai, Shahram Rahimi

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11030 2024-01-23 cs.CR cs.AR cs.LG cs.SY eess.SY 57%

Exploring Highly Quantised Neural Networks for Intrusion Detection in Automotive CAN

Shashwat Khandelwal, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 7 pages, 5 figures, 6 tables. arXiv admin note: substantial text overlap with arXiv:2401.10724

Journal ref 2023 33rd International Conference on Field-Programmable Logic and Applications (FPL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10689 2024-01-22 cs.CR cs.LG cs.SY eess.SY 57%

A Lightweight Multi-Attack CAN Intrusion Detection System on Hybrid FPGAs

Shashwat Khandelwal, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 5 pages, 2 figures, 6 tables

Journal ref 32nd International Conference on Field-Programmable Logic and Applications (FPL) FPL 2022, 425-429

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10674 2024-01-22 cs.CR cs.LG 57%

Deep Learning-based Embedded Intrusion Detection System for Automotive CAN

Shashwat Khandelwal, Eashan Wadhwa, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 5 pages, 1 figure, 8 tables

Journal ref IEEE 33rd International Conference on Application-specific Systems, Architectures and Processors (ASAP), Gothenburg, Sweden, 2022, pp. 88-92

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05509 2024-01-12 cs.CR cs.AI 57%

Optimized Ensemble Model Towards Secured Industrial IoT Devices

MohammadNoor Injadat

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Accepted and presented in 24th International Arab Conference on Information Technology (ACIT'2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04736 2024-01-11 eess.SY cs.AI cs.SY 57%

Exploring Attack Resilience in Distributed Platoon Controllers with Model Predictive Control

Tashfique Hasnine Choudhury

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01895 2024-01-05 cs.CR cs.LG 57%

A Robust Adversary Detection-Deactivation Method for Metaverse-oriented Collaborative Deep Learning

Pengfei Li, Zhibo Zhang, Ameena S. Al-Sumaiti, Naoufel Werghi, Chan Yeob Yeun

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04782 2023-12-11 cs.CR cs.LG 57%

Make Them Spill the Beans! Coercive Knowledge Extraction from (Production) LLMs

Zhuo Zhang, Guangyu Shen, Guanhong Tao, Siyuan Cheng, Xiangyu Zhang

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17391 2023-11-30 cs.CL 57%

Unveiling the Implicit Toxicity in Large Language Models

Jiaxin Wen, Pei Ke, Hao Sun, Zhexin Zhang, Chengfei Li, Jinfeng Bai, Minlie Huang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

Comments EMNLP 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05225 2023-11-03 cs.CV cs.CR cs.LG 57%

Boosting Adversarial Transferability by Achieving Flat Local Maxima

Zhijin Ge, Hongying Liu, Xiaosen Wang, Fanhua Shang, Yuanyuan Liu

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

Comments Accepted by the Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13131 2023-07-31 cs.CR cs.AI 57%

Why Don't You Clean Your Glasses? Perception Attacks with Dynamic Optical Perturbations

Yi Han, Matthew Chan, Eric Wengrowski, Zhuohuan Li, Nils Ole Tippenhauer, Mani Srivastava, Saman Zonouz, Luis Garcia

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14667 2022-11-29 cs.CR cs.AI 57%

Deep Fake Detection, Deterrence and Response: Challenges and Opportunities

Amin Azmoodeh, Ali Dehghantanha

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13618 2022-11-18 cs.CV cs.CR cs.LG 57%

Phantom Sponges: Exploiting Non-Maximum Suppression to Attack Deep Object Detectors

Avishag Shapira, Alon Zolfi, Luca Demetrio, Battista Biggio, Asaf Shabtai

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09405 2022-10-19 cs.LG cs.CR 57%

Towards Generating Adversarial Examples on Mixed-type Data

Han Xu, Menghai Pan, Zhimeng Jiang, Huiyuan Chen, Xiaoting Li, Mahashweta Das, Hao Yang

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07315 2022-09-21 cs.LG 57%

Learn2Weight: Parameter Adaptation against Similar-domain Adversarial Attacks

Siddhartha Datta

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted in COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13838 2022-08-31 cs.LG cs.CR 57%

Towards Adversarial Purification using Denoising AutoEncoders

Dvij Kalaria, Aritra Hazra, Partha Pratim Chakrabarti

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Submitted to AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08433 2022-08-18 cs.CR cs.HC cs.LG eess.SP 57%

Label Flipping Data Poisoning Attack Against Wearable Human Activity Recognition System

Abdur R. Shahid, Ahmed Imteaj, Peter Y. Wu, Diane A. Igoche, Tauhidul Alam

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Submitted to IEEE SSCI 2022 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.08578 2022-07-22 cs.LG stat.ML 57%

An Equivalence Between Data Poisoning and Byzantine Gradient Attacks

Sadegh Farhadkhani, Rachid Guerraoui, Lê-Nguyên Hoang, Oscar Villemaud

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2106.02398

Journal ref ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02764 2022-07-07 cs.LG 57%

Enhancing Adversarial Attacks on Single-Layer NVM Crossbar-Based Neural Networks with Power Consumption Information

Cory Merkel

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09975 2022-04-26 cs.LG 57%

Eliminating Backdoor Triggers for Deep Neural Networks Using Attention Relation Graph Distillation

Jun Xia, Ting Wang, Jiepin Ding, Xian Wei, Mingsong Chen

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10377 2022-02-22 cs.CR cs.AI 57%

A Tutorial on Adversarial Learning Attacks and Countermeasures

Cato Pauling, Michael Gimson, Muhammed Qaid, Ahmad Kida, Basel Halak

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10076 2022-01-25 cs.CR cs.AI 57%

MixDefense: A Defense-in-Depth Framework for Adversarial Example Detection Based on Statistical and Semantic Analysis

Yijun Yang, Ruiyuan Gao, Yu Li, Qiuxia Lai, Qiang Xu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05367 2021-12-13 cs.LG cs.CR math.OC stat.ML 57%

Efficient Action Poisoning Attacks on Linear Contextual Bandits

Guanlin Liu, Lifeng Lai

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏