arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3317 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3317 篇

2408.16875 2025-03-03 cs.RO cs.LG 57%

Learning Multi-agent Multi-machine Tending by Mobile Robots

Abdalwhab Abdalwhab, Giovanni Beltrame, Samira Ebrahimi Kahou, David St-Onge

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages, 4 figures, Accepted at an AAAI workshop (The Multi-Agent AI in the Real World Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04385 2025-02-26 cs.AI econ.TH math.OC 57%

Non-maximizing policies that fulfill multi-criterion aspirations in expectation

Simon Dima, Simon Fischer, Jobst Heitzig, Joss Oliver

机构 * École Normale Supérieure(巴黎高等师范学院) PIK(波茨坦气候影响研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 15 pages main text + 4 pages supplement. Slightly corrected version (corrections in blue in Eq. 11)

Journal ref In: Freeman, R., Mattei, N. (eds) Algorithmic Decision Theory. ADT 2024. Lecture Notes in Computer Science(), vol 15248. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16863 2025-02-25 cs.MA cs.LG cs.RO 57%

Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment

Kartik Nagpal, Dayi Dong, Jean-Baptiste Bouvier, Negar Mehr

机构 * University of California Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages+Appendix, 6 Figures, AAMAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16449 2025-02-25 cs.AI cs.SY eess.SY 57%

Facilitating Emergency Vehicle Passage in Congested Urban Areas Using Multi-agent Deep Reinforcement Learning

Haoran Su

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Ph.D. dissertation in Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15922 2025-02-25 cs.LG cs.RO 57%

On the Design of Safe Continual RL Methods for Control of Nonlinear Systems

Austin Coursey, Marcos Quinones-Grueiro, Gautam Biswas

机构 * Institute for Software Integrated Systems, Vanderbilt University(范德堡大学软件集成系统研究所)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15766 2025-02-24 cs.CL 57%

CHBench: A Chinese Dataset for Evaluating Health in Large Language Models

Chenlu Guo, Nuo Xu, Yi Chang, Yuan Wu

机构 * School of Artificial intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18418 2025-02-13 cs.CL 57%

Know Your Limits: A Survey of Abstention in Large Language Models

Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments TACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14975 2025-02-11 cs.CV cs.AI 57%

Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation

Jihyo Kim, Seulbi Lee, Sangheum Hwang

机构 * Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

Comments Accepted at ICLR 2025. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02984 2025-02-06 cs.RO cs.LG cs.SY eess.SY 57%

Learning Efficient Flocking Control based on Gibbs Random Fields

Dengyu Zhang, Chenghao, Feng Xue, Qingrui Zhang

机构 * School of Aeronautics and Astronautics, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区航空航天学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13765 2025-02-04 cs.LG math.OC 57%

On the stability of gradient descent with second order dynamics for time-varying cost functions

Travis E. Gibson, Sawal Acharya, Anjali Parashar, Joseph E. Gaudio, Anurdha M. Annaswamy

机构 * Massachusetts Institute of Technology(麻省理工学院) Brigham and Women’s Hospital(布莱根妇女医院) Harvard Medical School(哈佛医学院) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Final accepted version of TMLR paper. https://openreview.net/forum?id=HlzjI2fn2T

Journal ref Transactions on Machine Learning Research (2025).

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11826 2025-02-04 cs.CL 57%

AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence

Minbeom Kim, Hwanhee Lee, Joonsuk Park, Hwaran Lee, Kyomin Jung

机构 * Seoul National University(首尔大学) Chung-Ang University(中央大学) NAVER AI Lab(NAVER AI实验室) NAVER Cloud(NAVER云) University of Richmond(里士满大学) Sogang University(西江大学)

专题命中 安全训练 :harmlessness(abstract);分类 cs.CL

Comments 19 pages, 11 figures

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05585 2025-01-28 math.OC cs.AI cs.RO 57%

Towards Robust Spacecraft Trajectory Optimization via Transformers

Yuji Takubo, Tommaso Guffanti, Daniele Gammelli, Marco Pavone, Simone D'Amico

机构 * The Aerospace Corporation(航空航天公司) University of Nowhere(诺惠尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Submitted to the IEEE Aerospace Conference 2025. 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11799 2025-01-22 cs.AI cs.LO math.LO 57%

Policy-Adaptable Methods For Resolving Normative Conflicts Through Argumentation and Graph Colouring

Johnny Joyce

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Written and submitted as master's thesis for University of Southampton in 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09913 2025-01-20 cs.AI 57%

Towards A Litmus Test for Common Sense

Hugo Latapie

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08941 2025-01-16 cs.MA cs.LG cs.RO 57%

A Reinforcement Learning Approach to Quiet and Safe UAM Traffic Management

Surya Murthy, John-Paul Clarke, Ufuk Topcu, Zhenyu Gao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Paper presented at SciTech 2025

Journal ref AIAA SciTech 2025 Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06411 2025-01-07 cs.AI cs.RO 57%

Dialogue Possibilities between a Human Supervisor and UAM Air Traffic Management: Route Alteration

Jeongseok Kim, Kangjin Kim

机构 * SK Telecom(SK电信) Chodang University(草堂大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 18 pages, 2 figures, accepted to the Advances in Artificial Intelligence and Machine Learning (AAIML) journal

Journal ref Advances in Artificial Intelligence and Machine Learning (AAIML), 2023, (3):1352-1368

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13365 2024-12-19 cs.AI cs.HC cs.SY eess.SY 57%

Quantitative Predictive Monitoring and Control for Safe Human-Machine Interaction

Shuyang Dong, Meiyi Ma, Josephine Lamp, Sebastian Elbaum, Matthew B. Dwyer, Lu Feng

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11656 2024-12-17 cs.HC cs.LG 57%

Private Yet Social: How LLM Chatbots Support and Challenge Eating Disorder Recovery

Ryuhaerang Choi, Taehan Kim, Subin Park, Jennifer G Kim, Sung-Ju Lee

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10882 2024-12-13 cs.CV cs.CL 57%

Universal Prompt Optimizer for Safe Text-to-Image Generation

Zongyu Wu, Hongcheng Gao, Yueze Wang, Xiang Zhang, Suhang Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01303 2024-12-03 eess.SY cs.AI cs.SY 57%

RL2: Reinforce Large Language Model to Assist Safe Reinforcement Learning for Energy Management of Active Distribution Networks

Xu Yang, Chenhui Lin, Haotian Liu, Wenchuan Wu

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02038 2024-12-03 cs.LG 57%

Realizable Continuous-Space Shields for Safe Reinforcement Learning

Kyungmin Kim, Davide Corsi, Andoni Rodriguez, JB Lanier, Benjami Parellada, Pierre Baldi, Cesar Sanchez, Roy Fox

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Kim, Corsi, and Rodriguez contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17713 2024-11-28 cs.DC cs.AI 57%

Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations

Igor Fedorov, Kate Plawiak, Lemeng Wu, Tarek Elgamal, Naveen Suda, Eric Smith, Hongyuan Zhan, Jianfeng Chi, Yuriy Hulovatyy, Kimish Patel, Zechun Liu, Changsheng Zhao, Yangyang Shi, Tijmen Blankevoort, Mahesh Pasupuleti, Bilge Soran, Zacharie Delpierre Coudert, Rachad Alao, Raghuraman Krishnamoorthi, Vikas Chandra

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16723 2024-11-27 cs.MA cs.AI cs.RO 57%

Two Heads Are Better Than One: Collaborative LLM Embodied Agents for Human-Robot Interaction

Mitchell Rosser, Marc. G Carmichael

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15036 2024-11-25 cs.LG cs.SY eess.SY 57%

Safe Multi-Agent Reinforcement Learning with Convergence to Generalized Nash Equilibrium

Zeyang Li, Navid Azizan

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14368 2024-11-22 cs.AI cs.HC cs.SE 57%

RV4Chatbot: Are Chatbots Allowed to Dream of Electric Sheep?

Andrea Gatti, Viviana Mascardi, Angelo Ferrando

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments In Proceedings FMAS2024, arXiv:2411.13215

Journal ref EPTCS 411, 2024, pp. 73-90

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09623 2024-11-20 cs.RO cs.AI cs.CV 57%

Vision-based Manipulation of Transparent Plastic Bags in Industrial Setups

F. Adetunji, A. Karukayil, P. Samant, S. Shabana, F. Varghese, U. Upadhyay, R. A. Yadav, A. Partridge, E. Pendleton, R. Plant, Y. Petillot, M. Koskinopoulou

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06071 2024-11-20 cs.CV cs.LG 57%

A-BDD: Leveraging Data Augmentations for Safe Autonomous Driving in Adverse Weather and Lighting

Felix Assion, Florens Gressner, Nitin Augustine, Jona Klemenc, Ahmed Hammam, Alexandre Krattinger, Holger Trittenbach, Anja Philippsen, Sascha Riemer

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10072 2024-11-18 cs.CV cs.AI 57%

Real-Time AI-Driven People Tracking and Counting Using Overhead Cameras

Ishrath Ahamed, Chamith Dilshan Ranathunga, Dinuka Sandun Udayantha, Benny Kai Kiat Ng, Chau Yuen

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments This paper is accepted to IEEE Region 10 conference (TENCON) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07700 2024-11-13 cs.LG 57%

Test Where Decisions Matter: Importance-driven Testing for Deep Reinforcement Learning

Stefan Pranger, Hana Chockler, Martin Tappler, Bettina Könighofer

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05214 2024-11-11 cs.CL 57%

STAND-Guard: A Small Task-Adaptive Content Moderation Model

Minjia Wang, Pingping Lin, Siqi Cai, Shengnan An, Shengjie Ma, Zeqi Lin, Congrui Huang, Bixiong Xu

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏