arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3309 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3309 篇

2205.11814 2022-06-20 cs.LG cs.AI math.OC 62%

Penalized Proximal Policy Optimization for Safe Reinforcement Learning

Linrui Zhang, Li Shen, Long Yang, Shixiang Chen, Bo Yuan, Xueqian Wang, Dacheng Tao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments IJCAI2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11672 2022-06-13 eess.SY cs.AI cs.LG cs.SY 62%

A Multi-Agent Deep Reinforcement Learning Coordination Framework for Connected and Automated Vehicles at Merging Roadways

Sai Krishna Sumanth Nakka, Behdad Chalaki, Andreas Malikopoulos

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 6 figures

Journal ref 2022 American Control Conference (ACC), (2022), 3297-3302

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02953 2022-05-11 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

Learn-to-Race Challenge 2022: Benchmarking Safe Learning and Cross-domain Generalisation in Autonomous Racing

Jonathan Francis, Bingqing Chen, Siddha Ganju, Sidharth Kathpal, Jyotish Poonganam, Ayush Shivani, Vrushank Vyas, Sahika Genc, Ivan Zhukov, Max Kumskoy, Anirudh Koul, Jean Oh, Eric Nyberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03537 2022-05-10 cs.CR cs.AI cs.LG 62%

Anomaly Detection in Intra-Vehicle Networks

Ajeet Kumar Dwivedi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11788 2022-04-26 cs.AI cs.HC cs.LG 62%

Human-AI Collaboration via Conditional Delegation: A Case Study of Content Moderation

Vivian Lai, Samuel Carton, Rajat Bhatnagar, Q. Vera Liao, Yunfeng Zhang, Chenhao Tan

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08957 2022-04-20 cs.LG cs.AI 62%

COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation

Jongmin Lee, Cosmin Paduraru, Daniel J. Mankowitz, Nicolas Heess, Doina Precup, Kee-Eung Kim, Arthur Guez

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 6 figures, Accepted at ICLR 2022 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06509 2022-04-14 cs.LG cs.AI cs.RO 62%

Safer Autonomous Driving in a Stochastic, Partially-Observable Environment by Hierarchical Contingency Planning

Ugo Lecerf, Christelle Yemdji-Tchassi, Pietro Michiardi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To appear in Generalizable Policy Learning in the Physical World workshop (ICLR 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13112 2022-02-25 cs.LG cs.AI 62%

A Survey on Interpretable Reinforcement Learning

Claire Glanois, Paul Weng, Matthieu Zimmer, Dong Li, Tianpei Yang, Jianye Hao, Wulong Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10341 2022-02-22 cs.LG cs.AI cs.RO 62%

Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization

Quanyi Li, Zhenghao Peng, Bolei Zhou

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Quanyi Li and Zhenghao Peng contribute equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.07565 2022-02-16 cs.LG cs.AI 62%

CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning

Long Yang, Jiaming Ji, Juntao Dai, Yu Zhang, Pengfei Li, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05123 2022-02-11 cs.LG cs.AI 62%

Unaligned but Safe -- Formally Compensating Performance Limitations for Imprecise 2D Object Detection

Tobias Schuster, Emmanouil Seferis, Simon Burton, Chih-Hong Cheng

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.14705 2021-12-30 cs.RO cs.AI cs.LG 62%

Lane Change Decision-Making through Deep Reinforcement Learning

Mukesh Ghimire, Malobika Roy Choudhury, Guna Sekhar Sai Harsha Lagudu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12490 2021-12-30 cs.AI cs.LG cs.RO 62%

Curriculum Learning for Safe Mapless Navigation

Luca Marzari, Davide Corsi, Enrico Marchesini, Alessandro Farinelli

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures. The poster version of this paper has been accepted by The 37th ACM/SIGAPP Symposium on Applied Computing Proceedings (SAC IRMAS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10459 2021-12-21 eess.SY cs.AI cs.LG cs.SY 62%

Safe multi-agent deep reinforcement learning for joint bidding and maintenance scheduling of generation units

Pegah Rokhforoz, Olga Fink

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07385 2021-12-07 cs.RO cs.AI cs.LG cs.SY eess.SY stat.ML 62%

Enhancing Lattice-based Motion Planning with Introspective Learning and Reasoning

Mattias Tiger, David Bergström, Andreas Norrstig, Fredrik Heintz

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07699 2021-12-02 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Safe Autonomous Racing via Approximate Reachability on Ego-vision

Bingqing Chen, Jonathan Francis, Jean Oh, Eric Nyberg, Sylvia L. Herbert

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12953 2021-11-29 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

Learn Zero-Constraint-Violation Policy in Model-Free Constrained Reinforcement Learning

Haitong Ma, Changliu Liu, Shengbo Eben Li, Sifa Zheng, Wenchao Sun, Jianyu Chen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.04894 2021-11-10 cs.LG cs.AI cs.RO 62%

Safe Policy Optimization with Local Generalized Linear Function Approximations

Akifumi Wachi, Yunyue Wei, Yanan Sui

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 6 figures, Accepted to NeurIPS-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04775 2021-09-22 cs.LG cs.AI cs.RO 62%

LS3: Latent Space Safe Sets for Long-Horizon Visuomotor Control of Sparse Reward Iterative Tasks

Albert Wilcox, Ashwin Balakrishna, Brijen Thananjeyan, Joseph E. Gonzalez, Ken Goldberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Conference on Robot Learning (CoRL) 2021. First two authors contributed equally

Journal ref Conference on Robot Learning (CoRL) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06689 2021-09-15 cs.MA cs.AI cs.LG 62%

Reactive and Safe Road User Simulations using Neural Barrier Certificates

Yue Meng, Zengyi Qin, Chuchu Fan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at IROS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13944 2021-07-30 cs.LG cs.AI stat.ML 62%

Lyapunov-based uncertainty-aware safe reinforcement learning

Ashkan B. Jeddi, Nariman L. Dehghani, Abdollah Shafieezadeh

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Submitted to IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.11645 2021-07-13 cs.LG cs.AI cs.RO stat.ML 62%

Accelerating Safe Reinforcement Learning with Constraint-mismatched Policies

Tsung-Yen Yang, Justinian Rosca, Karthik Narasimhan, Peter J. Ramadge

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments International Conference on Machine Learning (ICML) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.15920 2021-05-19 cs.LG cs.AI cs.RO 62%

Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones

Brijen Thananjeyan, Ashwin Balakrishna, Suraj Nair, Michael Luo, Krishnan Srinivasan, Minho Hwang, Joseph E. Gonzalez, Julian Ibarz, Chelsea Finn, Ken Goldberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments RA-L and ICRA 2021. First two authors contributed equally

Journal ref Robotics and Automation Letters (RA-L) and International Conference on Robotics and Automation (ICRA) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06511 2021-05-17 cs.CL cs.AI 62%

NLP is Not enough -- Contextualization of User Input in Chatbots

Nathan Dolbir, Triyasha Dastidar, Kaushik Roy

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.12558 2021-04-20 cs.AI cs.LG cs.SY eess.SY 62%

Assured Learning-enabled Autonomy: A Metacognitive Reinforcement Learning Framework

Aquib Mustafa, Majid Mazouchi, Subramanya Nageshrao, Hamidreza Modares

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.06390 2021-04-14 cs.CL cs.LG 62%

Detoxifying Language Models Risks Marginalizing Minority Voices

Albert Xu, Eshaan Pathak, Eric Wallace, Suchin Gururangan, Maarten Sap, Dan Klein

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.01434 2021-04-05 cs.MA cs.AI cs.LG 62%

An Abstraction-based Method to Check Multi-Agent Deep Reinforcement-Learning Behaviors

Pierre El Mqirmi, Francesco Belardinelli, Borja G. León

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Extended version of AAMAS publication under the same name

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.09230 2021-03-17 cs.LG cs.AI cs.RO 62%

Lyapunov Barrier Policy Optimization

Harshit Sikchi, Wenxuan Zhou, David Held

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03544 2021-03-12 cs.AI cs.CY 62%

Challenges of engineering safe and secure highly automated vehicles

Nadja Marko, Eike Möhlmann, Dejan Ničković, Jürgen Niehaus, Peter Priller, Martijn Rooker

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.04452 2021-03-08 cs.AI cs.LG cs.MA cs.RO 62%

Multi-Agent Safe Planning with Gaussian Processes

Zheqing Zhu, Erdem Bıyık, Dorsa Sadigh

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 5 figures. Published at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏