arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3288 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3288 篇

2502.11448 2025-02-19 cs.AI 79%

AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection

Weidi Luo, Shenghong Dai, Xiaogeng Liu, Suman Banerjee, Huan Sun, Muhao Chen, Chaowei Xiao

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12259 2025-02-14 cs.AI 79%

How Safe is Your Safety Metric? Automatic Concatenation Tests for Metric Reliability

Ora Nova Fandina, Leshem Choshen, Eitan Farchi, George Kour, Yotam Perlitz, Orna Raz

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06606 2025-02-11 cs.AI cs.CR 79%

Gen-AI for User Safety: A Survey

Akshar Prabhu Desai, Tejasvi Ravi, Mohammad Luqman, Mohit Sharma, Nithya Kota, Pranjul Yadav

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Journal ref 2024 IEEE International Conference on Big Data (BigData), Washington, DC, USA, 2024, pp. 5315-5324

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02528 2025-02-05 cs.HC cs.AI 79%

Why human-AI relationships need socioaffective alignment

Hannah Rose Kirk, Iason Gabriel, Chris Summerfield, Bertie Vidgen, Scott A. Hale

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17315 2025-01-30 cs.AI cs.CR cs.SE 79%

A sketch of an AI control safety case

Tomek Korbak, Joshua Clymer, Benjamin Hilton, Buck Shlegeris, Geoffrey Irving

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17132 2025-01-29 cs.SE cs.CL 79%

ASTRAL: Automated Safety Testing of Large Language Models

Miriam Ugarte, Pablo Valle, José Antonio Parejo, Sergio Segura, Aitor Arrieta

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Journal ref The 6th ACM/IEEE International Conference on Automation of Software Test (AST 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10057 2025-01-20 cs.CL 79%

MSTS: A Multimodal Safety Test Suite for Vision-Language Models

Paul Röttger, Giuseppe Attanasio, Felix Friedrich, Janis Goldzycher, Alicia Parrish, Rishabh Bhardwaj, Chiara Di Bonaventura, Roman Eng, Gaia El Khoury Geagea, Sujata Goswami, Jieun Han, Dirk Hovy, Seogyeong Jeong, Paloma Jeretič, Flor Miriam Plaza-del-Arco, Donya Rooein, Patrick Schramowski, Anastassia Shaitarova, Xudong Shen, Richard Willats, Andrea Zugarini, Bertie Vidgen

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19626 2025-01-14 cs.AI 79%

Safety through feedback in Constrained RL

Shashank Reddy Chirra, Pradeep Varakantham, Praveen Paruchuri

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2024 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00320 2025-01-08 cs.AI 79%

Autonomous Alignment with Human Value on Altruism through Considerate Self-imagination and Theory of Mind

Haibo Tong, Enmeng Lu, Yinqian Sun, Zhengqiang Han, Chao Liu, Feifei Zhao, Yi Zeng

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16833 2025-01-07 cs.LG 79%

Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models

Chia-Yi Hsu, Yu-Lin Tsai, Chih-Hsun Lin, Pin-Yu Chen, Chia-Mu Yu, Chun-Ying Huang

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments This is the camera-ready version accepted for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06878 2024-12-11 cs.CV cs.LG 79%

SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations

Zhaorun Chen, Francesco Pinto, Minzhou Pan, Bo Li

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 43 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03253 2024-12-05 cs.CL 79%

Alignment at Pre-training! Towards Native Alignment for Arabic LLMs

Juhao Liang, Zhenyang Cai, Jianqing Zhu, Huang Huang, Kewei Zong, Bang An, Mosen Alharthi, Juncai He, Lian Zhang, Haizhou Li, Benyou Wang, Jinchao Xu

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024 main conference. see https://github.com/FreedomIntelligence/AceGPT-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12183 2024-11-20 eess.SY cs.LG cs.SY 79%

Action-Attentive Deep Reinforcement Learning for Autonomous Alignment of Beamlines

Siyu Wang, Shengran Dai, Jianhui Jiang, Shuang Wu, Yufei Peng, Junbin Zhang

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11365 2024-10-10 cs.CL 79%

CoCA: Regaining Safety-awareness of Multimodal Large Language Models with Constitutional Calibration

Jiahui Gao, Renjie Pi, Tianyang Han, Han Wu, Lanqing Hong, Lingpeng Kong, Xin Jiang, Zhenguo Li

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments 10 pages, COLM-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07878 2024-09-26 cs.CY 79%

Mapping Technical Safety Research at AI Companies: A literature review and incentives analysis

Oscar Delaney, Oliver Guest, Zoe Williams

专题命中 安全训练 :safety(title,abstract);分类 cs.CY

Comments Sep-25 update adds papers that we missed in the original dataset, as well as more acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10188 2024-09-17 cs.LG 79%

Enhancing RL Safety with Counterfactual LLM Reasoning

Dennis Gross, Helge Spieker

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08443 2024-09-04 cs.LG 79%

Safety Constrained Multi-Agent Reinforcement Learning for Active Voltage Control

Yang Qu, Jinming Ma, Feng Wu

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted by IJCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04522 2024-08-09 cs.CL 79%

Compromesso! Italian Many-Shot Jailbreaks Undermine the Safety of Large Language Models

Fabio Pernisi, Dirk Hovy, Paul Röttger

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Accepted at ACL 2024 (Student Research Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00997 2024-08-05 cs.AI 79%

A Safe Exploration Strategy for Model-free Task Adaptation in Safety-constrained Grid Environments

Erfan Entezami, Mahsa Sahebdel, Dhawal Gupta

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20729 2024-07-31 cs.CL 79%

Adapting Safe-for-Work Classifier for Malaysian Language Text: Enhancing Alignment in LLM-Ops Framework

Aisyah Razak, Ariff Nazhan, Kamarul Adha, Wan Adzhar Faiq Adzlan, Mas Aisyah Ahmad, Ammar Azman

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06903 2024-07-16 cs.RO cs.AI 79%

Reinforcement Learning in a Safety-Embedded MDP with Trajectory Optimization

Fan Yang, Wenxuan Zhou, Zuxin Liu, Ding Zhao, David Held

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06851 2024-07-10 cs.CL 79%

Safe-Embed: Unveiling the Safety-Critical Knowledge of Sentence Encoders

Jinseok Kim, Jaewon Jung, Sangyeop Kim, Sohyung Park, Sungzoon Cho

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments ACL 2024 KnowledgeableLMs workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04343 2024-07-08 cs.RO cs.LG 79%

Enhancing Safety for Autonomous Agents in Partly Concealed Urban Traffic Environments Through Representation-Based Shielding

Pierre Haritz, David Wanke, Thomas Liebig

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11889 2024-06-18 cs.CL 79%

ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Dacheng Tao

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Accepted to ACL2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05883 2024-06-11 cs.LG cs.IT math.IT stat.ML 79%

Information Theoretic Guarantees For Policy Alignment In Large Language Models

Youssef Mroueh

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03228 2024-06-11 cs.LG cs.RO cs.SY eess.SY 79%

ISAACS: Iterative Soft Adversarial Actor-Critic for Safety

Kai-Chieh Hsu, Duy Phuong Nguyen, Jaime Fernández Fisac

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted in 5th Annual Learning for Dynamics & Control Conference (L4DC), University of Pennsylvania

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01931 2024-06-06 cs.CL 79%

Dishonesty in Helpful and Harmless Alignment

Youcheng Huang, Jingkun Tang, Duanyu Feng, Zheng Zhang, Wenqiang Lei, Jiancheng Lv, Anthony G. Cohn

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19414 2024-05-31 cs.LG 79%

Safety through Permissibility: Shield Construction for Fast and Safe Reinforcement Learning

Alexander Politowicz, Sahisnu Mazumder, Bing Liu

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14488 2024-05-24 cs.CL 79%

MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability

Yanrui Du, Sendong Zhao, Danyang Zhao, Ming Ma, Yuhan Chen, Liangyu Huo, Qing Yang, Dongliang Xu, Bing Qin

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11034 2024-05-21 cs.LG 79%

Safety in Graph Machine Learning: Threats and Safeguards

Song Wang, Yushun Dong, Binchi Zhang, Zihan Chen, Xingbo Fu, Yinhan He, Cong Shen, Chuxu Zhang, Nitesh V. Chawla, Jundong Li

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏