arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2210.12185 2022-10-25 cs.CV cs.AI cs.LG 62%

Attention-Based Scattering Network for Satellite Imagery

Jason Stock, Chuck Anderson

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2022 Workshop - Tackling Climate Change with Machine Learning, 4 page limit w/ appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.04829 2022-10-24 cs.LG cs.AI 62%

Target-aware Molecular Graph Generation

Cheng Tan, Zhangyang Gao, Stan Z. Li

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by the 2nd AI4Science Workshop at the 39th International Conference on Machine Learning (ICML), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09010 2022-10-18 cs.CY cs.AI 62%

Good AI for Good: How AI Strategies of the Nordic Countries Address the Sustainable Development Goals

Andreas Theodorou, Juan Carlos Nieves, Virginia Dignum

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments IJCAI-AIofAI 2022 : 2nd Workshop on Adverse Impacts and Collateral Effects of AI Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07242 2022-10-14 cs.CV cs.AI cs.LG 62%

OpenOOD: Benchmarking Generalized Out-of-Distribution Detection

Jingkang Yang, Pengyun Wang, Dejian Zou, Zitang Zhou, Kunyuan Ding, Wenxuan Peng, Haoqi Wang, Guangyao Chen, Bo Li, Yiyou Sun, Xuefeng Du, Kaiyang Zhou, Wayne Zhang, Dan Hendrycks, Yixuan Li, Ziwei Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS 2022 Datasets and Benchmarks Track. Codebase: https://github.com/Jingkang50/OpenOOD

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05359 2022-10-12 cs.CL cs.AI 62%

Mind's Eye: Grounded Language Model Reasoning through Simulation

Ruibo Liu, Jason Wei, Shixiang Shane Gu, Te-Yen Wu, Soroush Vosoughi, Claire Cui, Denny Zhou, Andrew M. Dai

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04533 2022-10-11 cs.LG cs.AI 62%

Local Interpretable Model Agnostic Shap Explanations for machine learning models

P. Sai Ram Aditya, Mayukha Pal

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04083 2022-10-11 cs.LG cs.AI 62%

Unified Probabilistic Neural Architecture and Weight Ensembling Improves Model Robustness

Sumegha Premchandar, Sandeep Madireddy, Sanket Jantre, Prasanna Balaprakash

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01007 2022-10-04 cs.LG cs.AI 62%

Reward Learning with Trees: Methods and Evaluation

Tom Bewley, Jonathan Lawry, Arthur Richards, Rachel Craddock, Ian Henderson

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

Comments 22 pages (9 main body). Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00608 2022-10-04 cs.AI cs.CY cs.LO cs.MA 62%

Establishing Meta-Decision-Making for AI: An Ontology of Relevance, Representation and Reasoning

Cosmin Badea, Leilani Gilpin

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

Comments This version was peer-reviewed, accepted and presented as part of the AAAI 2021 Fall Symposium FSS-21. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11282 2022-09-23 cs.CY cs.AI cs.MA 62%

Multi-AI Complex Systems in Humanitarian Response

Joseph Aylett-Bullock, Miguel Luengo-Oroz

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments 8 pages, 1 figure

Journal ref Proceedings of the 3rd KDD Workshop on Data-driven Humanitarian Mapping, 2022, Washington, DC USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15407 2022-09-16 cs.LG cs.AI stat.ML 62%

Shifts 2.0: Extending The Dataset of Real Distributional Shifts

Andrey Malinin, Andreas Athanasopoulos, Muhamed Barakovic, Meritxell Bach Cuadra, Mark J. F. Gales, Cristina Granziera, Mara Graziani, Nikolay Kartashev, Konstantinos Kyriakopoulos, Po-Jui Lu, Nataliia Molchanova, Antonis Nikitakis, Vatsal Raina, Francesco La Rosa, Eli Sivena, Vasileios Tsarsitalidis, Efi Tsompopoulou, Elena Volf

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.12120 2022-08-26 cs.AI cs.LG 62%

Towards Benchmarking Explainable Artificial Intelligence Methods

Lars Holmberg

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10733 2022-08-17 cs.LG cs.CY 62%

GreenDB -- A Dataset and Benchmark for Extraction of Sustainability Information of Consumer Goods

Sebastian Jäger, Alexander Flick, Jessica Adriana Sanchez Garcia, Kaspar von den Driesch, Karl Brendel, Felix Biessmann

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY、cs.LG

Comments Presented at DataPerf Workshop at the 39th International Conference on Machine Learning, Baltimore, Maryland, USA, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10696 2022-08-16 cs.LG cs.AI 62%

CC-Cert: A Probabilistic Approach to Certify General Robustness of Neural Networks

Mikhail Pautov, Nurislam Tursynbek, Marina Munkhoeva, Nikita Muravev, Aleksandr Petiushko, Ivan Oseledets

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments In Proceedings of AAAI-22, the Thirty-Sixth AAAI Conference on Artificial Intelligence

Journal ref 36 AAAI Conference on Artificial Intelligence AAAI-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.04969 2022-07-12 cs.CV cs.AI cs.LG 62%

From Correlation to Causation: Formalizing Interpretable Machine Learning as a Statistical Process

Lukas Klein, Mennatallah El-Assady, Paul F. Jäger

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at IJCAI 2022 Workshop on Explainable Artificial Intelligence (XAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02036 2022-07-06 cs.LG cs.AI cs.CV stat.ML 62%

PRoA: A Probabilistic Robustness Assessment against Functional Perturbations

Tianle Zhang, Wenjie Ruan, Jonathan E. Fieldsend

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments The short version of this work will appear in the Proceedings of the 2022 European Conference on Machine Learning and Data Mining (ECML-PKDD 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15363 2022-07-01 cs.HC cs.AI cs.LG 62%

Why we do need Explainable AI for Healthcare

Giovanni Cinà, Tabea Röber, Rob Goedhart, Ilker Birbil

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14571 2022-06-30 cs.RO cs.AI cs.CY 62%

Should Social Robots in Retail Manipulate Customers?

Oliver Bendel, Liliana Margarida Dos Santos Alves

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments Accepted paper of the AAAI 2022 Spring Symposium "How Fair is Fair? Achieving Wellbeing AI" (Stanford University)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13749 2022-06-29 cs.LG cs.CL 62%

Adaptive Multi-view Rule Discovery for Weakly-Supervised Compatible Products Prediction

Rongzhi Zhang, Rebecca West, Xiquan Cui, Chao Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments KDD 2022 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.14697 2022-05-31 cs.CR cs.AI cs.LG 62%

Evaluating Automated Driving Planner Robustness against Adversarial Influence

Andres Molina-Markham, Silvia G. Ionescu, Erin Lanus, Derek Ng, Sam Sommerer, Joseph J. Rushanan

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments To appear at the 2022 Workshop on Deception Against Planning Systems and Planning in Adversarial Conditions (DAPSPAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09712 2022-05-20 cs.AI cs.CL 62%

Selection-Inference: Exploiting Large Language Models for Interpretable Logical Reasoning

Antonia Creswell, Murray Shanahan, Irina Higgins

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07870 2022-05-18 cs.LG cs.AI 62%

Unsupervised Driving Behavior Analysis using Representation Learning and Exploiting Group-based Training

Soma Bandyopadhyay, Anish Datta, Shruti Sachan, Arpan Pal

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 7 figures, 8 pages , 7 tables, accepted and presented conference AAAI 2022 AI for Transportation Workshop (Prefinal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04887 2022-05-17 cs.LG cs.AI cs.SE 62%

Search-Based Testing of Reinforcement Learning

Martin Tappler, Filip Cano Córdoba, Bernhard K. Aichernig, Bettina Könighofer

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 15 figures, Accepted at IJCAI-ECAI 2022 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02340 2022-05-06 cs.CL cs.LG 62%

Knowledge Distillation of Russian Language Models with Reduction of Vocabulary

Alina Kolesnikova, Yuri Kuratov, Vasily Konovalov, Mikhail Burtsev

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01975 2022-05-06 cs.CL cs.AI 62%

Aligning to Social Norms and Values in Interactive Narratives

Prithviraj Ammanabrolu, Liwei Jiang, Maarten Sap, Hannaneh Hajishirzi, Yejin Choi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments In Proceedings of NAACL-2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09183 2022-05-04 cs.LG cs.AI 62%

Robustness Testing of Data and Knowledge Driven Anomaly Detection in Cyber-Physical Systems

Xugui Zhou, Maxfield Kouzel, Homa Alemzadeh

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 10 figures, to appear in the 5th IEEE/IFIP DSN Workshop on Dependable and Secure Machine Learning (DSN-DSML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.03543 2022-05-04 cs.CL cs.AI 62%

Extended Parallel Corpus for Amharic-English Machine Translation

Andargachew Mekonnen Gezmu, Andreas Nürnberger, Tesfaye Bayu Bati

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to LREC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00763 2022-05-03 cs.RO cs.AI cs.HC cs.LG 62%

Data-driven emotional body language generation for social robotics

Mina Marmpena, Fernando Garcia, Angelica Lim, Nikolas Hemion, Thomas Wennekers

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments For the associated video of the generated animations, see https://youtu.be/wmLT8FARSk0 and for a repository of the training data, see https://github.com/minamar/rebl-pepper-data

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07932 2022-04-19 cs.MA cs.AI cs.LG 62%

Towards Comprehensive Testing on the Robustness of Cooperative Multi-agent Reinforcement Learning

Jun Guo, Yonghong Chen, Yihang Hao, Zixin Yin, Yin Yu, Simin Li

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03959 2022-04-12 cs.AI cs.LG 62%

Blockchain as an Enabler for Transfer Learning in Smart Environments

Amin Anjomshoaa, Edward Curry

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏