arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3309 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3309 篇

2302.10030 2023-02-21 cs.AI cs.LG 62%

Safe Deep Reinforcement Learning by Verifying Task-Level Properties

Enrico Marchesini, Luca Marzari, Alessandro Farinelli, Christopher Amato

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS). Marchesini and Marzari contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01751 2023-01-06 cs.CL cs.AI cs.HC 62%

Iterated Decomposition: Improving Science Q&A by Supervising Reasoning Processes

Justin Reppert, Ben Rachbach, Charlie George, Luke Stebbing, Jungwon Byun, Maggie Appleton, Andreas Stuhlmüller

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08302 2022-12-19 cs.LG cs.AI 62%

Safe Evaluation For Offline Learning: Are We Ready To Deploy?

Hager Radi, Josiah P. Hanna, Peter Stone, Matthew E. Taylor

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2021 Workshop on Deployable Decision Making in Embodied Systems [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03412 2022-12-08 cs.CR cs.AI cs.CV cs.LG 62%

Artificial Intelligence Security Competition (AISC)

Yinpeng Dong, Peng Chen, Senyou Deng, Lianji L, Yi Sun, Hanyu Zhao, Jiaxing Li, Yunteng Tan, Xinyu Liu, Yangyi Dong, Enhui Xu, Jincai Xu, Shu Xu, Xuelin Fu, Changfeng Sun, Haoliang Han, Xuchong Zhang, Shen Chen, Zhimin Sun, Junyi Cao, Taiping Yao, Shouhong Ding, Yu Wu, Jian Lin, Tianpeng Wu, Ye Wang, Yu Fu, Lin Feng, Kangkang Gao, Zeyu Liu, Yuanzhe Pang, Chengqi Duan, Huipeng Zhou, Yajie Wang, Yuhang Zhao, Shangbo Wu, Haoran Lyu, Zhiyu Lin, Yifei Gao, Shuang Li, Haonan Wang, Jitao Sang, Chen Ma, Junhao Zheng, Yijia Li, Chao Shen, Chenhao Lin, Zhichao Cui, Guoshuai Liu, Huafeng Shi, Kun Hu, Mengxin Zhang

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Technical report of AISC

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02715 2022-12-07 eess.SY cs.AI cs.LG cs.SY math.OC 62%

Efficient Learning of Voltage Control Strategies via Model-based Deep Reinforcement Learning

Ramij R. Hossain, Tianzhixi Yin, Yan Du, Renke Huang, Jie Tan, Wenhao Yu, Yuan Liu, Qiuhua Huang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01375 2022-12-05 cs.RO cs.AI cs.LG 62%

Embedding Synthetic Off-Policy Experience for Autonomous Driving via Zero-Shot Curricula

Eli Bronstein, Sirish Srinivasan, Supratik Paul, Aman Sinha, Matthew O'Kelly, Payam Nikdel, Shimon Whiteson

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Published in CoRL 2022. Main text (8 pages, 3 figures) + acknowledgements and references (3 pages) + appendix (7 pages, 4 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05308 2022-11-30 cs.LG cs.AI cs.SY eess.SY 62%

Learning Control Policies for Stochastic Systems with Reach-avoid Guarantees

Đorđe Žikelić, Mathias Lechner, Thomas A. Henzinger, Krishnendu Chatterjee

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13474 2022-11-28 cs.LG cs.AI cs.RO 62%

Explainable and Safe Reinforcement Learning for Autonomous Air Mobility

Lei Wang, Hongyu Yang, Yi Lin, Suwan Yin, Yuankai Wu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11759 2022-11-23 cs.LG cs.AI cs.MA 62%

Learning Cooperative Oversubscription for Cloud by Chance-Constrained Multi-Agent Reinforcement Learning

Junjie Sheng, Lu Wang, Fangkai Yang, Bo Qiao, Hang Dong, Xiangfeng Wang, Bo Jin, Jun Wang, Si Qin, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08730 2022-11-17 eess.SY cs.AI cs.LG cs.SY math.DS 62%

A framework for online, stabilizing reinforcement learning

Grigory Yaremenko, Georgiy Malaniya, Pavel Osinenko

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07089 2022-11-10 cs.LG cs.AI 62%

Constrained Update Projection Approach to Safe Policy Optimization

Long Yang, Jiaming Ji, Juntao Dai, Linrui Zhang, Binbin Zhou, Pengfei Li, Yaodong Yang, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS2022. arXiv admin note: substantial text overlap with arXiv:2202.07565

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.06547 2022-11-07 cs.RO cs.AI cs.CV cs.LG 62%

LookOut: Diverse Multi-Future Prediction and Planning for Self-Driving

Alexander Cui, Sergio Casas, Abbas Sadat, Renjie Liao, Raquel Urtasun

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01845 2022-11-04 cs.CR cs.AI cs.LG 62%

Reinforcement Learning based Cyberattack Model for Adaptive Traffic Signal Controller in Connected Transportation Systems

Muhammad Sami Irfan, Mizanur Rahman, Travis Atkison, Sagar Dasgupta, Alexander Hainen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 12 figures, submitted to the Transportation Research Board 102nd Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14492 2022-10-27 cs.LG cs.AI stat.ML 62%

Provable Safe Reinforcement Learning with Binary Feedback

Andrew Bennett, Dipendra Misra, Nathan Kallus

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11259 2022-10-21 cs.LG cs.AI cs.FL cs.RO 62%

Safe Policy Improvement in Constrained Markov Decision Processes

Luigi Berducci, Radu Grosu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted for presentation at the International Symposium on Leveraging Applications of Formal Methods (ISoLA, 2022)

Journal ref LNCS 13701 (2022) 360-381;

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00885 2022-10-19 cs.LG cs.AI 62%

DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning

Archana Bura, Aria HasanzadeZonuzy, Dileep Kalathil, Srinivas Shakkottai, Jean-Francois Chamberland

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05639 2022-10-14 cs.LG cs.AI 62%

Discovered Policy Optimisation

Chris Lu, Jakub Grudzien Kuba, Alistair Letcher, Luke Metz, Christian Schroeder de Witt, Jakob Foerster

专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06380 2022-10-13 cs.LG cs.AI cs.MA cs.RO math.OC 62%

Near-Optimal Multi-Agent Learning for Safe Coverage Control

Manish Prajapat, Matteo Turchetta, Melanie N. Zeilinger, Andreas Krause

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01801 2022-10-06 cs.LG cs.AI 62%

Safe Reinforcement Learning From Pixels Using a Stochastic Latent Representation

Yannick Hogewind, Thiago D. Simao, Tal Kachman, Nils Jansen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08351 2022-09-20 cs.LG cs.AI cs.MA cs.RO 62%

Sample-Efficient Multi-Agent Reinforcement Learning with Demonstrations for Flocking Control

Yunbo Qiu, Yuzhu Zhan, Yue Jin, Jian Wang, Xudong Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by IEEE Vehicular Technology Conference (VTC) 2022-Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.04371 2022-09-07 cs.AI cs.LG cs.SY eess.SY 62%

A Multi-Agent Reinforcement Learning Approach For Safe and Efficient Behavior Planning Of Connected Autonomous Vehicles

Songyang Han, Shanglin Zhou, Jiangwei Wang, Lynn Pepin, Caiwen Ding, Jie Fu, Fei Miao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments This paper is submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08345 2022-08-25 cs.AI cs.LG 62%

Discovering Agents

Zachary Kenton, Ramana Kumar, Sebastian Farquhar, Jonathan Richens, Matt MacDermott, Tom Everitt

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Some typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07307 2022-08-16 cs.RO cs.AI cs.LG 62%

Towards Robust On-Ramp Merging via Augmented Multimodal Reinforcement Learning

Gaurav Bagwe, Jian Li, Xiaoyong Yuan, Lan Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03815 2022-08-12 cs.CL cs.AI 62%

Beyond Distributional Hypothesis: Let Language Models Learn Meaning-Text Correspondence

Myeongjun Jang, Frank Mtumbuka, Thomas Lukasiewicz

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted in the Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.00762 2022-07-29 cs.LG cs.AI cs.CR 62%

Execute Order 66: Targeted Data Poisoning for Reinforcement Learning

Harrison Foley, Liam Fowl, Tom Goldstein, Gavin Taylor

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Workshop on Safe and Robust Control of Uncertain Systems at the 35th Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.10283 2022-07-26 cs.RO cs.AI cs.LG cs.NE 62%

Adding Neural Network Controllers to Behavior Trees without Destroying Performance Guarantees

Christopher Iliffe Sprague, Petter Ögren

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted as Regular Paper to The 61th IEEE Conference on Decision and Control (CDC 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08651 2022-07-19 cs.LG cs.AI 62%

Boolean Decision Rules for Reinforcement Learning Policy Summarisation

James McCarthy, Rahul Nair, Elizabeth Daly, Radu Marinescu, Ivana Dusparic

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09424 2022-07-07 cs.LG cs.AI cs.GT 62%

SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics

Yannis Flet-Berliac, Debabrota Basu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at the 5th Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01497 2022-07-05 cs.CY cs.LG 62%

Aligning Artificial Intelligence with Humans through Public Policy

John Nay, James Daily

专题命中 安全训练 :alignment(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05030 2022-06-22 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

DQ-GAT: Towards Safe and Efficient Autonomous Driving with Deep Q-Learning and Graph Attention Networks

Peide Cai, Hengli Wang, Yuxiang Sun, Ming Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏