arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3309 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3309 篇

2405.16184 2024-05-28 eess.SY cs.AI cs.LG cs.SY 62%

Safe Deep Model-Based Reinforcement Learning with Lyapunov Functions

Harry Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15152 2024-05-27 cs.CL cs.AI 62%

Machine Unlearning in Large Language Models

Saaketh Koundinya Gundavarapu, Shreya Agarwal, Arushi Arora, Chandana Thimmalapura Jagadeeshaiah

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02025 2024-05-09 cs.LG cs.AI 62%

A Survey of Constraint Formulations in Safe Reinforcement Learning

Akifumi Wachi, Xun Shen, Yanan Sui

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at IJCAI-24 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18821 2024-05-01 eess.SY cs.AI cs.LG cs.SY 62%

Control Policy Correction Framework for Reinforcement Learning-based Energy Arbitrage Strategies

Seyed Soroush Karimi Madahi, Gargya Gokhale, Marie-Sophie Verwee, Bert Claessens, Chris Develder

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments ACM e-Energy 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18326 2024-04-30 cs.LG cs.AI 62%

SAFE-RL: Saliency-Aware Counterfactual Explainer for Deep Reinforcement Learning Policies

Amir Samadi, Konstantinos Koufos, Kurt Debattista, Mehrdad Dianati

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08570 2024-04-15 cs.RO cs.AI cs.LG 62%

Enhancing Autonomous Vehicle Training with Language Model Integration and Critical Scenario Generation

Hanlin Tian, Kethan Reddy, Yuxiang Feng, Mohammed Quddus, Yiannis Demiris, Panagiotis Angeloudis

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08604 2024-04-11 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Verification of Neural Reachable Tubes via Scenario Optimization and Conformal Prediction

Albert Lin, Somil Bansal

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to 6th Annual Learning for Dynamics & Control Conference. arXiv admin note: text overlap with arXiv:2209.12336

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03386 2024-04-05 cs.RO cs.AI cs.LG 62%

SENSOR: Imitate Third-Person Expert's Behaviors via Active Sensoring

Kaichen Huang, Minghao Shao, Shenghua Wan, Hai-Hang Sun, Shuai Feng, Le Gan, De-Chuan Zhan

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14316 2024-03-22 cs.LG cs.AI 62%

Reinforcement Learning by Guided Safe Exploration

Qisong Yang, Thiago D. Simão, Nils Jansen, Simon H. Tindemans, Matthijs T. J. Spaan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accecpted at ECAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10081 2024-03-20 cs.CV cs.CL cs.LG 62%

DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback

Yangyi Chen, Karan Sikka, Michael Cogswell, Heng Ji, Ajay Divakaran

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments CVPR 2024. The feedback datasets are released at: https://huggingface.co/datasets/YangyiYY/LVLM_NLF

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06397 2024-03-13 cs.LG cs.AI cs.SY eess.SY 62%

DeepSafeMPC: Deep Learning-Based Model Predictive Control for Safe Multi-Agent Reinforcement Learning

Xuefeng Wang, Henglin Pu, Hyung Jun Kim, Husheng Li

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01769 2024-03-05 cs.LG cs.AI math.OC 62%

A Safe Screening Rule with Bi-level Optimization of $ν$ Support Vector Machine

Zhiji Yang, Wanyi Chen, Huan Zhang, Yitian Xu, Lei Shi, Jianhua Zhao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09468 2024-03-01 cs.RO cs.AI cs.LG 62%

Safe Reinforcement Learning in a Simulated Robotic Arm

Luka Kovač, Igor Farkaš

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 2 figures. Appeared in 2023 International Conference on Artificial Neural Networks (ICANN) proceedings. Published version copyrighted by Springer. This work was funded by the Horizon Europe Twinning project TERAIS, G.A. number 101079338 and in part by the national project APVV-21-0105. Link to the code: https://zenodo.org/doi/10.5281/zenodo.10694747

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07457 2024-03-01 cs.LG cs.AI 62%

When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement Learning

Siliang Zeng, Chenliang Li, Alfredo Garcia, Mingyi Hong

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16979 2024-02-28 cs.CY cs.LG cs.SI 62%

Algorithmic Arbitrariness in Content Moderation

Juan Felipe Gomez, Caio Vieira Machado, Lucas Monteiro Paes, Flavio P. Calmon

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16869 2024-02-28 cs.CY cs.AI 62%

Considering Fundamental Rights in the European Standardisation of Artificial Intelligence: Nonsense or Strategic Alliance?

Marion Ho-Dac

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13926 2024-02-22 cs.CL cs.AI 62%

Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content

Federico Bianchi, James Zou

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13338 2024-02-22 cs.LG cs.AI cs.MA 62%

Multi-Agent Car Parking using Reinforcement Learning

Omar Tanner

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Book of Abstracts, ICUR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05149 2024-02-09 cs.LG cs.AI 62%

FlowPG: Action-constrained Policy Gradient with Normalizing Flows

Janaka Chathuranga Brahmanage, Jiajing Ling, Akshat Kumar

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Thirty-seventh Conference on Neural Information Processing Systems. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17633 2024-02-01 cs.CL cs.AI 62%

Navigating the OverKill in Large Language Models

Chenyu Shi, Xiao Wang, Qiming Ge, Songyang Gao, Xianjun Yang, Tao Gui, Qi Zhang, Xuanjing Huang, Xun Zhao, Dahua Lin

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13275 2024-01-30 cs.CL cs.AI 62%

Can AI Assistants Know What They Don't Know?

Qinyuan Cheng, Tianxiang Sun, Xiangyang Liu, Wenwei Zhang, Zhangyue Yin, Shimin Li, Linyang Li, Zhengfu He, Kai Chen, Xipeng Qiu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11334 2024-01-24 cs.CV cs.AI cs.LG 62%

Generalized Out-of-Distribution Detection: A Survey

Jingkang Yang, Kaiyang Zhou, Yixuan Li, Ziwei Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Feel free to comment on our Overleaf manuscript: https://www.overleaf.com/9899719915wmccvdtwpkct#c25192

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13365 2024-01-23 cs.LG cs.AI 62%

Limits of Actor-Critic Algorithms for Decision Tree Policies Learning in IBMDPs

Hector Kohler, Riad Akrour, Philippe Preux

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To be included in an other submission. arXiv admin note: text overlap with arXiv:2304.05839

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07272 2024-01-17 cs.LG cs.CL 62%

Dialogue for Prompting: a Policy-Gradient-Based Discrete Prompt Generation for Few-shot Learning

Chengzhengxu Li, Xiaoming Liu, Yichen Wang, Duyi Li, Yu Lan, Chao Shen

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments AAAI 2024 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03786 2024-01-12 cs.LG cs.AI cs.RO 62%

Long-term Safe Reinforcement Learning with Binary Feedback

Akifumi Wachi, Wataru Hashimoto, Kazumune Hashimoto

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11339 2024-01-12 cs.AI cs.LG cs.MA 62%

ProAgent: Building Proactive Cooperative Agents with Large Language Models

Ceyao Zhang, Kaijie Yang, Siyi Hu, Zihao Wang, Guanghe Li, Yihang Sun, Cheng Zhang, Zhaowei Zhang, Anji Liu, Song-Chun Zhu, Xiaojun Chang, Junge Zhang, Feng Yin, Yitao Liang, Yaodong Yang

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments v3 is the AAAI'24 camera ready version, which polished abstract and introduction based on the reviewers' comments, and enriched related works. 7 pages of main content, 2 pages of references, 2 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10639 2024-01-10 cs.AI cs.LG 62%

Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning

Yuxiao Lu, Arunesh Sinha, Pradeep Varakantham

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01141 2023-12-15 cs.LG cs.AI 62%

DeepSaDe: Learning Neural Networks that Guarantee Domain Constraint Satisfaction

Kshitij Goyal, Sebastijan Dumancic, Hendrik Blockeel

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06436 2023-12-13 cs.LG cs.AI 62%

Reward Certification for Policy Smoothed Reinforcement Learning

Ronghui Mu, Leandro Soriano Marcolino, Tianle Zhang, Yanghao Zhang, Xiaowei Huang, Wenjie Ruan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments This paper will be presented in AAAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02227 2023-12-13 cs.LG cs.AI cs.SY eess.SY 62%

State-Wise Safe Reinforcement Learning With Pixel Observations

Simon Sinong Zhan, Yixuan Wang, Qingyuan Wu, Ruochen Jiao, Chao Huang, Qi Zhu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏