arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2305.17197 2023-05-30 cs.CL 57%

Entailment as Robust Self-Learner

Jiaxin Ge, Hongyin Luo, Yoon Kim, James Glass

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments Accepted by ACL 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10843 2023-05-29 cs.CV cs.AI 57%

X-IQE: eXplainable Image Quality Evaluation for Text-to-Image Generation with Visual Large Language Models

Yixiong Chen, Li Liu, Chris Ding

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 18 pages, 6 tables, 11 figures, NeurIPS 2023 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02107 2023-05-29 cs.LG 57%

Interpretable Mixture of Experts

Aya Abdelsalam Ismail, Sercan Ö. Arik, Jinsung Yoon, Ankur Taly, Soheil Feizi, Tomas Pfister

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14314 2023-05-24 cs.LG 57%

QLoRA: Efficient Finetuning of Quantized LLMs

Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Extended NeurIPS submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12623 2023-05-23 cs.AI 57%

Strategy Extraction in Single-Agent Games

Archana Vadakattu, Michelle Blom, Adrian R. Pearce

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03899 2023-05-23 cs.LG cs.CV 57%

Big Learning

Yulai Cong, Miaoyun Zhao

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11262 2023-05-22 cs.CL 57%

CHBias: Bias Evaluation and Mitigation of Chinese Conversational Language Models

Jiaxu Zhao, Meng Fang, Zijing Shi, Yitong Li, Ling Chen, Mykola Pechenizkiy

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments Accepted by ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11116 2023-05-19 cs.CV cs.CL 57%

LLMScore: Unveiling the Power of Large Language Models in Text-to-Image Synthesis Evaluation

Yujie Lu, Xianjun Yang, Xiujun Li, Xin Eric Wang, William Yang Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10443 2023-05-19 cs.RO cs.AI 57%

SuperDriverAI: Towards Design and Implementation for End-to-End Learning-based Autonomous Driving

Shunsuke Aoki, Issei Yamamoto, Daiki Shiotsuka, Yuichi Inoue, Kento Tokuhiro, Keita Miwa

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08598 2023-05-16 cs.HC cs.AI 57%

Humans, AI, and Context: Understanding End-Users' Trust in a Real-World Computer Vision Application

Sunnie S. Y. Kim, Elizabeth Anne Watkins, Olga Russakovsky, Ruth Fong, Andrés Monroy-Hernández

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments FAccT 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02424 2023-05-05 cs.CL 57%

Backdoor Learning on Sequence to Sequence Models

Lichang Chen, Minhao Cheng, Heng Huang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07015 2023-05-02 cs.LG cs.SI 57%

Simplistic Collection and Labeling Practices Limit the Utility of Benchmark Datasets for Twitter Bot Detection

Chris Hays, Zachary Schutzman, Manish Raghavan, Erin Walk, Philipp Zimmer

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 10 pages, 6 figures; updated citation, clarified language

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14204 2023-04-28 cs.AI cs.CV 57%

Towards Medical Artificial General Intelligence via Knowledge-Enhanced Multimodal Pretraining

Bingqian Lin, Zicong Chen, Mingjie Li, Haokun Lin, Hang Xu, Yi Zhu, Jianzhuang Liu, Wenjia Cai, Lei Yang, Shen Zhao, Chenfei Wu, Ling Chen, Xiaojun Chang, Yi Yang, Lei Xing, Xiaodan Liang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Project page: https://github.com/chenzcv7/MOTOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10481 2023-04-25 cs.CV cs.AI cs.CR 57%

PatchCensor: Patch Robustness Certification for Transformers via Exhaustive Testing

Yuheng Huang, Lei Ma, Yuanchun Li

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments This paper has been accepted by ACM Transactions on Software Engineering and Methodology (TOSEM'23) in "Continuous Special Section: AI and SE." Please include TOSEM for any citations

Journal ref ACM Trans. Softw. Eng. Methodol. (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09957 2023-04-21 cs.CL 57%

Low-resource Bilingual Dialect Lexicon Induction with Large Language Models

Ekaterina Artemova, Barbara Plank

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted to NoDaLiDa 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08205 2023-04-18 cs.CL 57%

VECO 2.0: Cross-lingual Language Model Pre-training with Multi-granularity Contrastive Learning

Zhen-Ru Zhang, Chuanqi Tan, Songfang Huang, Fei Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Technical Report for AliceMind's VECO 2.0 (ranked 1st on the XTREME leaderboard on March 17, 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03454 2023-04-17 cs.CL 57%

DABERT: Dual Attention Enhanced BERT for Semantic Matching

Sirui Wang, Di Liang, Jian Song, Yuntao Li, Wei Wu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted by COLING 2022

Journal ref https://aclanthology.org/2022.coling-1.141/

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02807 2023-04-13 cs.SE cs.LG 57%

MDPFuzz: Testing Models Solving Markov Decision Processes

Qi Pang, Yuanyuan Yuan, Shuai Wang

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03318 2023-04-10 cs.HC cs.AI 57%

Explainable AI And Visual Reasoning: Insights From Radiology

Robert Kaufman, David Kirsh

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Comments Accepted to 2023 Conference on Computer-Human Interaction (CHI) Human-Centered Explainable AI Workshop, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00212 2023-04-04 cs.CV cs.LG 57%

Devil is in the Queries: Advancing Mask Transformers for Real-world Medical Image Segmentation and Out-of-Distribution Localization

Mingze Yuan, Yingda Xia, Hexin Dong, Zifan Chen, Jiawen Yao, Mingyan Qiu, Ke Yan, Xiaoli Yin, Yu Shi, Xin Chen, Zaiyi Liu, Bin Dong, Jingren Zhou, Le Lu, Ling Zhang, Li Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments CVPR 2023 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01747 2023-04-04 cs.RO cs.AI 57%

Learning from Demonstrations of Critical Driving Behaviours Using Driver's Risk Field

Yurui Du, Flavia Sofia Acerbo, Jens Kober, Tong Duy Son

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17010 2023-03-31 cs.LG cs.FL cs.RO 57%

Specification-Guided Data Aggregation for Semantically Aware Imitation Learning

Ameesh Shah, Jonathan DeCastro, John Gideon, Beyazit Yalcinkaya, Guy Rosman, Sanjit A. Seshia

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 8 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16149 2023-03-29 q-fin.ST cs.LG 57%

Explaining Exchange Rate Forecasts with Macroeconomic Fundamentals Using Interpretive Machine Learning

Davood Pirayesh Neghab, Mucahit Cevik, M. I. M. Wahab

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00896 2023-03-28 cs.CV cs.LG 57%

Efficient Robustness Assessment via Adversarial Spatial-Temporal Focus on Videos

Wei Xingxing, Wang Songping, Yan Huanqian

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments accepted by TPAMI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02814 2023-03-27 cs.CV cs.CR cs.HC cs.LG 57%

Visual Analytics of Neuron Vulnerability to Adversarial Attacks on Convolutional Neural Networks

Yiran Li, Junpeng Wang, Takanori Fujiwara, Kwan-Liu Ma

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Accepted by the Special Issue on Human-Centered Explainable AI, ACM Transactions on Interactive Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12316 2023-03-23 cs.LG 57%

TsSHAP: Robust model agnostic feature-based explainability for time series forecasting

Vikas C. Raykar, Arindam Jati, Sumanta Mukherjee, Nupur Aggarwal, Kanthi Sarpatwar, Giridhar Ganapavarapu, Roman Vaculin

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10476 2023-03-21 cs.CY 57%

Assessing Scientific Contributions in Data Sharing Spaces

Kacy Adams, Fernando Spadea, Conor Flynn, Oshani Seneviratne

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

Comments 3rd International Workshop on Scientific Knowledge: Representation, Discovery, and Assessment co-located with The Web Conference 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.12837 2023-03-21 cs.LG stat.ML 57%

Fooling Partial Dependence via Data Poisoning

Hubert Baniecki, Wojciech Kretowicz, Przemyslaw Biecek

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Accepted at ECML PKDD 2022

Journal ref Machine Learning and Knowledge Discovery in Databases, vol. 3, pp. 121-136, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10085 2023-03-20 stat.ME cs.LG stat.ML 57%

Robust probabilistic inference via a constrained transport metric

Abhisek Chakraborty, Anirban Bhattacharya, Debdeep Pati

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09322 2023-03-17 cs.LG cs.HC q-bio.QM 57%

Interpretability from a new lens: Integrating Stratification and Domain knowledge for Biomedical Applications

Anthony Onoja, Francesco Raimondi

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 10 pages concept paper

详情

展开后加载摘要…

URL PDF HTML 收藏