arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3309 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3309 篇

2404.10356 2025-01-07 cs.LG cs.AI 62%

Generating Counterfactual Trajectories with Latent Diffusion Models for Concept Discovery

Payal Varshney, Adriano Lucieri, Christoph Balada, Andreas Dengel, Sheraz Ahmed

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Published at International Conference on Pattern Recognition (ICPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00528 2025-01-03 cs.LG cs.AI 62%

PyMilo: A Python Library for ML I/O

AmirHosein Rostami, Sepand Haghighi, Sadra Sabouri, Alireza Zolanvari

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures, 2 tables, 3 code blocks

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04108 2024-12-25 cs.CR cs.CL cs.LG 62%

Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs

Sara Price, Arjun Panickssery, Sam Bowman, Asa Cooper Stickland

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14234 2024-12-24 cs.SE cs.AI cs.LG cs.PL 62%

Syzygy: Dual Code-Test C to (safe) Rust Translation using LLMs and Dynamic Analysis

Manish Shetty, Naman Jain, Adwait Godbole, Sanjit A. Seshia, Koushik Sen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Project webpage at https://syzygy-project.github.io/. Preliminary version accepted at LLM4Code 2025, 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 62%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14881 2024-12-19 cs.AI cs.CL 62%

Class-RAG: Real-Time Content Moderation with Retrieval Augmented Generation

Jianfa Chen, Emily Shen, Trupti Bavalatti, Xiaowen Lin, Yongkai Wang, Shuming Hu, Harihar Subramanyam, Ksheeraj Sai Vepuri, Ming Jiang, Ji Qi, Li Chen, Nan Jiang, Ankit Jain

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 11 pages, submit to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11138 2024-12-17 cs.LG cs.AI 62%

Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation

Juntao Dai, Yaodong Yang, Qian Zheng, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:9872-9903, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10713 2024-12-17 cs.LG cs.AI cs.CR cs.RO 62%

RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors

Fengshuo Bai, Runze Liu, Yali Du, Ying Wen, Yaodong Yang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08470 2024-12-17 cs.LG cs.AI 62%

Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models

Jerry Huang, Prasanna Parthasarathi, Mehdi Rezagholizadeh, Sarath Chandar

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Published as a long paper at the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP). Official version of paper within conference proceedings is available at http://aclanthology.org/2024.emnlp-main.332

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10410 2024-12-17 cs.AI cs.LG cs.RO 62%

GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents

Shaofei Cai, Bowei Zhang, Zihao Wang, Haowei Lin, Xiaojian Ma, Anji Liu, Yitao Liang

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07241 2024-12-11 cs.HC cs.AI cs.LG 62%

Human-Computer Interaction and Human-AI Collaboration in Advanced Air Mobility: A Comprehensive Review

Fatma Yamac Sagirli, Xiaopeng Zhao, Zhenbo Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06165 2024-12-10 cs.LG cs.AI stat.ML 62%

Conservative Contextual Bandits: Beyond Linear Representations

Rohan Deb, Mohammad Ghavamzadeh, Arindam Banerjee

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07435 2024-11-26 eess.SY cs.AI cs.LG cs.NE cs.SY 62%

Real-world validation of safe reinforcement learning, model predictive control and decision tree-based home energy management systems

Julian Ruddick, Glenn Ceusters, Gilles Van Kriekinge, Evgenii Genov, Cedric De Cauwer, Thierry Coosemans, Maarten Messagie

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted version Energy and AI: https://doi.org/10.1016/j.egyai.2024.100448

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14502 2024-11-25 cs.CR cs.AI cs.CY 62%

Global Challenge for Safe and Secure LLMs Track 1

Xiaojun Jia, Yihao Huang, Yang Liu, Peng Yan Tan, Weng Kuan Yau, Mun-Thye Mak, Xin Ming Sim, Wee Siong Ng, See Kiong Ng, Hanqing Liu, Lifeng Zhou, Huanqian Yan, Xiaobing Sun, Wei Liu, Long Wang, Yiming Qian, Yong Liu, Junxiao Yang, Zhexin Zhang, Leqi Lei, Renmiao Chen, Yida Lu, Shiyao Cui, Zizhou Wang, Shaohua Li, Yan Wang, Rick Siow Mong Goh, Liangli Zhen, Yingjie Zhang, Zhe Zhao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15145 2024-11-22 cs.AI cs.CL cs.MA 62%

CulturePark: Boosting Cross-cultural Understanding in Large Language Models

Cheng Li, Damien Teney, Linyi Yang, Qingsong Wen, Xing Xie, Jindong Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024; Code is released at https://github.com/Scarelette/CulturePark. arXiv admin note: substantial text overlap with arXiv:2402.10946

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12275 2024-11-13 cs.RO cs.AI cs.CV cs.LG cs.MA 62%

Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation

Jiachen Li, Chuanbo Hua, Jianpeng Yao, Hengbo Ma, Jinkyoo Park, Victoria Dax, Mykel J. Kochenderfer

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Project website: https://relational-reasoning-nav.github.io/; 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05718 2024-11-11 cs.RO cs.AI cs.LG 62%

A Retrospective on the Robot Air Hockey Challenge: Benchmarking Robust, Reliable, and Safe Learning Techniques for Real-world Robotics

Puze Liu, Jonas Günster, Niklas Funk, Simon Gröger, Dong Chen, Haitham Bou-Ammar, Julius Jankowski, Ante Marić, Sylvain Calinon, Andrej Orsula, Miguel Olivares-Mendez, Hongyi Zhou, Rudolf Lioutikov, Gerhard Neumann, Amarildo Likmeta Amirhossein Zhalehmehrabi, Thomas Bonenfant, Marcello Restelli, Davide Tateo, Ziyuan Liu, Jan Peters

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accept at NeurIPS 2024 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16163 2024-11-08 cs.CL cs.AI 62%

FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)

Aman Priyanshu, Supriti Vijay

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 4 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04159 2024-11-08 cs.NI cs.AI cs.DC cs.LG 62%

Cooperation and Personalization on a Seesaw: Choice-based FL for Safe Cooperation in Wireless Networks

Han Zhang, Medhat Elsayed, Majid Bavand, Raimundas Gaigalas, Yigit Ozcan, Melike Erol-Kantarci

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15122 2024-11-06 cs.LG cs.AI cs.RO 62%

Scaling Is All You Need: Autonomous Driving with JAX-Accelerated Reinforcement Learning

Moritz Harmel, Anubhav Paras, Andreas Pasternak, Nicholas Roy, Gary Linscott

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01903 2024-11-01 cs.LG cs.AI cs.CV 62%

Text-Aware Diffusion for Policy Learning

Calvin Luo, Mandy He, Zilai Zeng, Chen Sun

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14577 2024-11-01 cs.CL cs.LG 62%

Representation Noising: A Defence Mechanism Against Harmful Finetuning

Domenic Rosati, Jan Wehner, Kai Williams, Łukasz Bartoszcze, David Atanasov, Robie Gonzales, Subhabrata Majumdar, Carsten Maple, Hassan Sajjad, Frank Rudzicz

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments Published in NeurIPs 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10438 2024-10-28 cs.AI cs.LG cs.NE 62%

EVOTER: Evolution of Transparent Explainable Rule-sets

Hormoz Shahrzad, Babak Hodjat, Risto Miikkulainen

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12937 2024-10-18 cs.CL cs.LG 62%

Merge to Learn: Efficiently Adding Skills to Language Models with Model Merging

Jacob Morrison, Noah A. Smith, Hannaneh Hajishirzi, Pang Wei Koh, Jesse Dodge, Pradeep Dasigi

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10871 2024-10-16 cs.CL cs.AI 62%

Applying Refusal-Vector Ablation to Llama 3.1 70B Agents

Simon Lermen, Mateusz Dziemian, Govind Pimpale

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06491 2024-10-10 cs.AI cs.LG 62%

Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack

Leo McKee-Reid, Christoph Sträter, Maria Angelica Martinez, Joe Needham, Mikita Balesni

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06384 2024-10-10 cs.AI cs.CL cs.IR 62%

Validation of the Scientific Literature via Chemputation Augmented by Large Language Models

Sebastian Pagel, Michael Jirasek, Leroy Cronin

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 7 figures, 34 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02657 2024-10-04 cs.CL cs.CY 62%

Hate Personified: Investigating the role of LLMs in content moderation

Sarah Masud, Sahajpreet Singh, Viktor Hangya, Alexander Fraser, Tanmoy Chakraborty

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

Comments 17 pages, 6 Figures, 13 Tables, EMNLP'24 Mains

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19038 2024-10-02 cs.AI cs.LG cs.MA cs.RO 62%

Intention-aware policy graphs: answering what, how, and why in opaque agents

Victor Gimenez-Abalos, Sergio Alvarez-Napagao, Adrian Tormos, Ulises Cortés, Javier Vázquez-Salceda

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 57 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20517 2024-10-01 cs.LG cs.AI 62%

SMLE: Safe Machine Learning via Embedded Overapproximation

Matteo Francobaldi, Michele Lombardi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏