arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2312.01855 2024-04-03 cs.RO cs.AI 79%

Modular Control Architecture for Safe Marine Navigation: Reinforcement Learning and Predictive Safety Filters

Aksel Vaaler, Svein Jostein Husa, Daniel Menges, Thomas Nakken Larsen, Adil Rasheed

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14678 2024-03-25 cs.LG 79%

Towards a Framework for Deep Learning Certification in Safety-Critical Applications Using Inherently Safe Design and Run-Time Error Detection

Romeo Valentin

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Master Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12114 2024-03-20 cs.SE cs.AI 79%

Safety Analysis of Autonomous Railway Systems: An Introduction to the SACRED Methodology

Josh Hunter, John McDermid, Simon Burton

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments S. Bernardi, T. Zoppi (Editors), "Fast Abstracts and Student Forum Proceedings - EDCC 2024 - 19th European Dependable Computing Conference, Leuven, Belgium, 8-11 April 2024"

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04182 2024-02-07 cs.LG cs.RO 79%

Reinforcement Learning with Ensemble Model Predictive Safety Certification

Sven Gronauer, Tom Haider, Felippe Schmoeller da Roza, Klaus Diepold

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Published in: Proc. of the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00996 2024-01-03 cs.AI cs.CR cs.SE 79%

Safety and Performance, Why Not Both? Bi-Objective Optimized Model Compression against Heterogeneous Attacks Toward AI Software Deployment

Jie Zhu, Leye Wang, Xiao Han, Anmin Liu, Tao Xie

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments Accepted by IEEE Transactions on Software Engineering (TSE). Camera-ready Version. arXiv admin note: substantial text overlap with arXiv:2208.05969

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09919 2023-11-29 cs.RO cs.AI cs.FL 79%

Plug in the Safety Chip: Enforcing Constraints for LLM-driven Robot Agents

Ziyi Yang, Shreyas S. Raman, Ankit Shah, Stefanie Tellex

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19007 2023-11-01 cs.LG 79%

Behavior Alignment via Reward Function Optimization

Dhawal Gupta, Yash Chandak, Scott M. Jordan, Philip S. Thomas, Bruno Castro da Silva

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

Comments (Spotlight) Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10657 2023-10-05 cs.RO cs.LG cs.MA cs.SY eess.SY 79%

Learning Adaptive Safety for Multi-Agent Systems

Luigi Berducci, Shuo Yang, Rahul Mangharam, Radu Grosu

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Update with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08709 2023-09-19 stat.ML cs.LG 79%

Price of Safety in Linear Best Arm Identification

Xuedong Shang, Igor Colin, Merwan Barlier, Hamza Cherkaoui

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 20 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08602 2023-08-15 cs.RO cs.LG cs.MA cs.SY eess.SY math.OC 79%

CaRT: Certified Safety and Robust Tracking in Learning-based Motion Planning for Multi-Agent Systems

Hiroyasu Tsukamoto, Benjamin Rivière, Changrak Choi, Amir Rahmani, Soon-Jo Chung

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments IEEE Conference on Decision and Control (CDC), Preprint Version, Accepted July, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03176 2023-08-08 cs.AI 79%

Building Safe and Reliable AI systems for Safety Critical Tasks with Vision-Language Processing

Shuang Ao

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 4 pages

Journal ref 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02164 2023-07-06 cs.AI 79%

Safety Shielding under Delayed Observation

Filip Cano Córdoba, Alexander Palmisano, Martin Fränzle, Roderick Bloem, Bettina Könighofer

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 6 pages, Published at ICAPS 2023 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05596 2023-03-29 eess.SY cs.LG cs.RO cs.SY 79%

Geometry of Radial Basis Neural Networks for Safety Biased Approximation of Unsafe Regions

Ahmad Abuaish, Mohit Srinivasan, Patricio A. Vela

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted into American Control Conference (ACC) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02386 2023-03-07 cs.RO cs.LG cs.SY eess.SY 79%

Modular Safety-Critical Control of Legged Robots

Berk Tosun, Evren Samur

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08969 2023-02-20 cs.IT cs.LG math.IT 79%

Deep Reinforcement Learning for mmWave Initial Beam Alignment

Daniel Tandler, Sebastian Dörner, Marc Gauger, Stephan ten Brink

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06998 2022-12-15 cs.LG cs.RO 79%

Safety Correction from Baseline: Towards the Risk-aware Policy in Robotics via Dual-agent Reinforcement Learning

Linrui Zhang, Zichen Yan, Li Shen, Shoujie Li, Xueqian Wang, Dacheng Tao

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments The 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07874 2022-12-07 cs.SE cs.LG 79%

Ergo, SMIRK is Safe: A Safety Case for a Machine Learning Component in a Pedestrian Automatic Emergency Brake System

Markus Borg, Jens Henriksson, Kasper Socha, Olof Lennartsson, Elias Sonnsjö Lönegren, Thanh Bui, Piotr Tomaszewski, Sankar Raman Sathyamoorthy, Sebastian Brink, Mahshid Helali Moghadam

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted for publication in Software Quality Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01498 2022-11-04 cs.LG stat.ML 79%

On the Safety of Interpretable Machine Learning: A Maximum Deviation Approach

Dennis Wei, Rahul Nair, Amit Dhurandhar, Kush R. Varshney, Elizabeth M. Daly, Moninder Singh

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Published at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05077 2022-10-17 cs.SE cs.LG 79%

Black-box Safety Analysis and Retraining of DNNs based on Feature Extraction and Clustering

Mohammed Oualid Attaoui, Hazem Fahmy, Fabrizio Pastore, Lionel Briand

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 41 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05969 2022-09-12 cs.LG cs.CR cs.SE 79%

Safety and Performance, Why not Both? Bi-Objective Optimized Model Compression toward AI Software Deployment

Jie Zhu, Leye Wang, Xiao Han

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted by ASE2022. Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04803 2022-08-10 cs.LG cs.RO 79%

Exploring the trade off between human driving imitation and safety for traffic simulation

Yann Koeberle, Stefano Sabatini, Dzmitry Tsishkou, Christophe Sabourin

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07369 2022-07-25 cs.LG cs.SY eess.SY math.OC 79%

Learning for MPC with Stability & Safety Guarantees

Sébastien Gros, Mario Zanon

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.00886 2022-06-03 cs.RO cs.LG 79%

Watch Out for the Safety-Threatening Actors: Proactively Mitigating Safety Hazards

Saurabh Jha, Shengkun Cui, Zbigniew Kalbarczyk, Ravishankar K. Iyer

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01419 2022-05-04 cs.RO cs.CV cs.FL cs.LG cs.SY eess.SY 79%

An Empirical Analysis of the Use of Real-Time Reachability for the Safety Assurance of Autonomous Vehicles

Patrick Musau, Nathaniel Hamilton, Diego Manzanas Lopez, Preston Robinette, Taylor T. Johnson

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 30 pages, 12 Figures, Submitted to Artificial Intelligence's Special Issue on "Risk-Aware Autonomous Systems: Theory and Practice."

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12045 2022-04-15 cs.LG cs.SE 79%

How to Certify Machine Learning Based Safety-critical Systems? A Systematic Literature Review

Florian Tambon, Gabriel Laberge, Le An, Amin Nikanjam, Paulina Stevia Nouwou Mindom, Yann Pequignot, Foutse Khomh, Giulio Antoniol, Ettore Merlo, François Laviolette

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 60 pages (92 pages with references and complements), submitted to a journal (Automated Software Engineering). Changes: Emphasizing difference traditional software engineering / ML approach. Adding Related Works, Threats to Validity and Complementary Materials. Adding a table listing papers reference for each section/subsections

Journal ref Autom Softw Eng 29, 38 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05135 2022-03-30 cs.LG cs.CV 79%

PixMix: Dreamlike Pictures Comprehensively Improve Safety Measures

Dan Hendrycks, Andy Zou, Mantas Mazeika, Leonard Tang, Bo Li, Dawn Song, Jacob Steinhardt

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments CVPR 2022. Code and models are available at https://github.com/andyzoujm/pixmix

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02331 2022-02-22 cs.AI 79%

Safety Enhancement for Deep Reinforcement Learning in Autonomous Separation Assurance

Wei Guo, Marc Brittain, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.01781 2022-02-07 cs.CV cs.AI 79%

Predicting the impact of urban change in pedestrian and road safety

Cristina Bustos, Daniel Rhoads, Agata Lapedriza, Javier Borge-Holthoefer, Albert Solé-Ribalta

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12210 2021-12-30 cs.LG cs.SY eess.SY 79%

ProBF: Learning Probabilistic Safety Certificates with Barrier Functions

Athindran Ramesh Kumar, Sulin Liu, Jaime F. Fisac, Ryan P. Adams, Peter J. Ramadge

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Presented at NeurIPS 2021 workshop - Safe and Robust Control of Uncertain Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14324 2021-11-30 cs.LG 79%

Is the Rush to Machine Learning Jeopardizing Safety? Results of a Survey

Mehrnoosh Askarpour, Alan Wassyng, Mark Lawford, Richard Paige, Zinovy Diskin

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏