arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

1910.02461 2019-10-08 cs.AI cs.RO 57%

Risk-Aware Reasoning for Autonomous Vehicles

Majid Khonji, Jorge Dias, Lakmal Seneviratne

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01380 2019-10-04 cs.AI 57%

GRAVITAS: A Model Checking Based Planning and Goal Reasoning Framework for Autonomous Systems

Hadrien Bride, Jin Song Dong, Ryan Green, Zhe Hou, Brendan Mahony, Martin Oxenham

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.11392 2019-09-24 math.OC cs.LG stat.ML 57%

From self-tuning regulators to reinforcement learning and back again

Nikolai Matni, Alexandre Proutiere, Anders Rantzer, Stephen Tu

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Tutorial paper, 2019 IEEE Conference on Decision and Control, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08864 2019-09-20 cs.CR cs.LG stat.ML 57%

Adversarial Vulnerability Bounds for Gaussian Process Classification

Michael Thomas Smith, Kathrin Grosse, Michael Backes, Mauricio A Alvarez

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 10 pages + 2 pages references + 7 pages of supplementary. 12 figures. Submitted to AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
1609.05625 2019-09-04 cs.CL 57%

The MGB-2 Challenge: Arabic Multi-Dialect Broadcast Media Recognition

Ahmed Ali, Peter Bell, James Glass, Yacine Messaoui, Hamdy Mubarak, Steve Renals, Yifan Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00001 2019-08-23 cs.SE cs.LG 57%

Engineering problems in machine learning systems

Hiroshi Kuwajima, Hirotoshi Yasuoka, Toshihiro Nakae

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments 20 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.00065 2019-07-30 cs.LG cs.CR stat.ML 57%

MULDEF: Multi-model-based Defense Against Adversarial Examples for Neural Networks

Siwakorn Srisakaokul, Yuhao Zhang, Zexuan Zhong, Wei Yang, Tao Xie, Bo Li

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01627 2019-07-04 cs.DB cs.AI 57%

Rule Applicability on RDF Triplestore Schemas

Paolo Pareti, George Konstantinidis, Timothy J. Norman, Murat Şensoy

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments AI for Internet of Things Workshop, co-located with the 28th International Joint Conference on Artificial Intelligence (IJCAI-19)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.07982 2019-06-20 cs.LG cs.CR stat.ML 57%

A unified view on differential privacy and robustness to adversarial examples

Rafael Pinot, Florian Yger, Cédric Gouy-Pailler, Jamal Atif

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.03922 2019-06-20 stat.ML cs.CR cs.LG 57%

Analyzing the Robustness of Nearest Neighbors to Adversarial Examples

Yizhen Wang, Somesh Jha, Kamalika Chaudhuri

专题命中 安全评测 :safety(abstract);分类 cs.LG

Journal ref International Conference on Machine Learning (ICML) 2018, Page 5133--5142

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13358 2019-06-03 cs.CL cs.CV 57%

Multi-modal Discriminative Model for Vision-and-Language Navigation

Haoshuo Huang, Vihan Jain, Harsh Mehta, Jason Baldridge, Eugene Ie

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments Accepted at SpLU-RoboNLP 2019 (workshop at NAACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.07679 2019-05-21 cs.LG stat.ML 57%

Predicting Model Failure using Saliency Maps in Autonomous Driving Systems

Sina Mohseni, Akshay Jagadeesh, Zhangyang Wang

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Presented at ICML 2019 Workshop on Uncertainty and Robustness in Deep Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.04172 2019-05-13 stat.ML cs.CV cs.LG 57%

On the Connection Between Adversarial Robustness and Saliency Map Interpretability

Christian Etmann, Sebastian Lunz, Peter Maass, Carola-Bibiane Schönlieb

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 12 pages, accepted for publication at the 36th International Conference on Machine Learning 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.07994 2019-03-20 cs.CR cs.LG stat.ML 57%

An Evaluation of Bitcoin Address Classification based on Transaction History Summarization

Yu-Jing Lin, Po-Wei Wu, Cheng-Han Hsu, I-Ping Tu, Shih-wei Liao

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 8 pages; accepted by ICBC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.01185 2019-02-19 cs.CV cs.CR cs.LG cs.NE 57%

Adversarial Examples - A Complete Characterisation of the Phenomenon

Alexandru Constantin Serban, Erik Poll, Joost Visser

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.07893 2019-02-07 cs.GT cs.AI 57%

Solving Large Extensive-Form Games with Strategy Constraints

Trevor Davis, Kevin Waugh, Michael Bowling

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments Appeared in AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01647 2018-12-06 cs.LG cs.CR stat.ML 57%

Rigorous Agent Evaluation: An Adversarial Approach to Uncover Catastrophic Failures

Jonathan Uesato, Ananya Kumar, Csaba Szepesvari, Tom Erez, Avraham Ruderman, Keith Anderson, Krishmamurthy, Dvijotham, Nicolas Heess, Pushmeet Kohli

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.08352 2018-09-25 stat.ML cs.CV cs.LG 57%

Unrestricted Adversarial Examples

Tom B. Brown, Nicholas Carlini, Chiyuan Zhang, Catherine Olsson, Paul Christiano, Ian Goodfellow

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00516 2018-08-03 cs.RO cs.LG stat.ML 57%

A Learning-Based Framework for Two-Dimensional Vehicle Maneuver Prediction over V2V Networks

Hossein Nourkhiz Mahjoub, Amin Tahmasbi-Sarvestani, Hadi Kazemi, Yaser P. Fallah

专题命中 安全评测 :safety(abstract);分类 cs.LG

Journal ref 2017 IEEE Cyber Science and Technology Congress(CyberSciTech), Orlando, FL, 2017, pp. 156-163

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.01619 2018-07-06 cs.LG stat.ML 57%

Ensemble learning with Conformal Predictors: Targeting credible predictions of conversion from Mild Cognitive Impairment to Alzheimer's Disease

Telma Pereira, Sandra Cardoso, Dina Silva, Manuela Guerreiro, Alexandre de Mendonça, Sara C. Madeira

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments 4 pages, 1 figure, accepted for presentation at the KDD Workshop on Machine Learning for Medicine and Healthcare, London, UK, August 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.02754 2018-05-09 cs.AI cs.RO 57%

Verisimilar Percept Sequences Tests for Autonomous Driving Intelligent Agent Assessment

Thomio Watanabe, Denis Wolf

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.04248 2018-02-19 stat.ML cs.CR cs.CV cs.LG cs.NE 57%

Decision-Based Adversarial Attacks: Reliable Attacks Against Black-Box Machine Learning Models

Wieland Brendel, Jonas Rauber, Matthias Bethge

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments Published as a conference paper at the Sixth International Conference on Learning Representations (ICLR 2018) https://openreview.net/forum?id=SyZI0GWCZ

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.08019 2018-01-25 cs.LG stat.ML 57%

Training Set Debugging Using Trusted Items

Xuezhou Zhang, Xiaojin Zhu, Stephen J. Wright

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments AAAI 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.01204 2018-01-08 cs.LG 57%

Predicting Chronic Disease Hospitalizations from Electronic Health Records: An Interpretable Classification Approach

Theodora S. Brisimi, Tingting Xu, Taiyao Wang, Wuyang Dai, William G. Adams, Ioannis Ch. Paschalidis

专题命中 安全评测 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.01058 2018-01-04 cs.LG 57%

Polynomial-based rotation invariant features

Jarek Duda

专题命中 安全评测 :alignment(abstract);分类 cs.LG

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.03475 2017-09-25 cs.LG stat.ML 57%

Confident Multiple Choice Learning

Kimin Lee, Changho Hwang, KyoungSoo Park, Jinwoo Shin

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

Comments Accepted in ICML 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.05796 2017-02-21 cs.LG 57%

Collaborative Deep Reinforcement Learning

Kaixiang Lin, Shu Wang, Jiayu Zhou

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.06963 2016-10-12 cs.AI 57%

Limits to Verification and Validation of Agentic Behavior

David J. Jilk

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 13 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.09067 2016-03-01 cs.CY 57%

Firebird: Predicting Fire Risk and Prioritizing Fire Inspections in Atlanta

Michael Madaio, Shang-Tse Chen, Oliver L. Haimson, Wenwen Zhang, Xiang Cheng, Matthew Hinds-Aldrich, Duen Horng Chau, Bistra Dilkina

专题命中 安全评测 :safety(abstract);分类 cs.CY

Comments 10 pages, 4 figures, submitted to KDD 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.02710 2016-02-09 cs.GT cs.AI 57%

Strategic disclosure of opinions on a social network

Umberto Grandi, Emiliano Lorini, Laurent Perrussel

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏