arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2507.06734 2025-07-10 cs.HC cs.AI cs.CL cs.CY 67%

Civil Society in the Loop: Feedback-Driven Adaptation of (L)LM-Assisted Classification in an Open-Source Telegram Monitoring Tool

Milena Pustet, Elisabeth Steffen, Helena Mihaljević, Grischa Stanjek, Yannis Illies

机构 * HTW Berlin(柏林应用技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06845 2025-07-08 cs.CL cs.AI cs.LG 67%

7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement

Pu Zhao, Xuan Shen, Zhenglun Kong, Yixin Shen, Sung-En Chang, Arash Akbari, Timothy Rupprecht, Lei Lu, Enfu Nan, Changdi Yang, Yumei He, Weiyan Shi, Xingchen Xu, Yu Huang, Wei Jiang, Wei Wang, Yue Chen, Yong He, Yanzhi Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Futurewei Technologies(未来科技) AIBAO LLC

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00829 2025-07-02 cs.CR 67%

On the Surprising Efficacy of LLMs for Penetration-Testing

Andreas Happe, Jürgen Cito

专题命中 安全训练 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18325 2025-06-24 cs.CV 67%

NSFW-Classifier Guided Prompt Sanitization for Safe Text-to-Image Generation

Yu Xie, Chengjie Zeng, Lingyun Zhang, Yanwei Fu

机构 * Purple Mountain Laboratories(紫金山实验室) Fudan University(复旦大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13284 2025-06-23 cs.CL cs.AI cs.LG 67%

Learning to Route LLMs with Confidence Tokens

Yu-Neng Chuang, Prathusha Kameswara Sarma, Parikshit Gopalan, John Boccio, Sara Bolouki, Xia Hu, Helen Zhou

机构 * Rice University(里士大学) Apple, Inc.(苹果公司)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13458 2025-05-29 cs.CL cs.AI cs.CR cs.LG 67%

ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails

Xiaofei Wen, Wenxuan Zhou, Wenjie Jacky Mo, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17714 2025-05-26 cs.LG cs.AI cs.CL 67%

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization

Ben Rahman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This manuscript builds upon an earlier version posted to TechRxiv. This arXiv version includes an updated comparison with GRPO (Group Relative Policy Optimization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14397 2025-05-05 cs.CL cs.CY cs.LG 67%

RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?

Adrian de Wynter, Ishaan Watts, Tua Wongsangaroonsri, Minghui Zhang, Noura Farra, Nektar Ege Altıntoprak, Lena Baur, Samantha Claudet, Pavel Gajdusek, Can Gören, Qilong Gu, Anna Kaminska, Tomasz Kaminski, Ruby Kuo, Akiko Kyuba, Jongho Lee, Kartik Mathur, Petter Merok, Ivana Milovanović, Nani Paananen, Vesa-Matti Paananen, Anna Pavlenko, Bruno Pereira Vidal, Luciano Strika, Yueh Tsao, Davide Turcato, Oleksandr Vakhno, Judit Velcsov, Anna Vickers, Stéphanie Visser, Herdyan Widarmanto, Andrey Zaikin, Si-Qing Chen

机构 * Microsoft Research India(微软印度研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY、cs.LG

Comments AAAI 2025--camera ready + extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19066 2025-04-29 cs.CL cs.AI cs.LG physics.ao-ph 67%

ClimaEmpact: Domain-Aligned Small Language Models and Datasets for Extreme Weather Analytics

Deeksha Varshney, Keane Ong, Rui Mao, Erik Cambria, Gianmarco Mengaldo

机构 * College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院) Department of Mathematics, National University of Singapore(新加坡国立大学数学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12545 2025-04-18 cs.CY cs.AI cs.CL 67%

Knowledge Acquisition on Mass-shooting Events via LLMs for AI-Driven Justice

Benign John Ihugba, Afsana Nasrin, Ling Wu, Lin Li, Lijun Qian, Xishuang Dong

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11426 2025-04-16 cs.CL cs.AI cs.LG 67%

A Dual-Space Framework for General Knowledge Distillation of Large Language Models

Xue Zhang, Songming Zhang, Yunlong Liang, Fandong Meng, Yufeng Chen, Jinan Xu, Jie Zhou

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 9 figures, 11 tables, under review. Code is available at: https://github.com/songmzhang/DSKDv2. arXiv admin note: text overlap with arXiv:2406.17328

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14202 2025-04-07 cs.SE cs.AI cs.CL cs.LG 67%

Do LLMs Consider Security? An Empirical Study on Responses to Programming Questions

Amirali Sajadi, Binh Le, Anh Nguyen, Kostadin Damevski, Preetha Chatterjee

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07627 2025-03-21 cs.LG cs.AI cs.CL stat.ML 67%

Automatic Curriculum Expert Iteration for Reliable LLM Reasoning

Zirui Zhao, Hanze Dong, Amrita Saha, Caiming Xiong, Doyen Sahoo

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06074 2025-03-11 cs.CL cs.AI cs.LG 67%

Towards Conversational AI for Disease Management

Anil Palepu, Valentin Liévin, Wei-Hung Weng, Khaled Saab, David Stutz, Yong Cheng, Kavita Kulkarni, S. Sara Mahdavi, Joëlle Barral, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Ryutaro Tanno, Vivek Natarajan, Adam Rodman, Tao Tu, Alan Karthikesalingam, Mike Schaekermann

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 62 pages, 7 figures in main text, 36 figures in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00617 2025-03-04 cs.LG cs.AI cs.CL cs.GT 67%

Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning

Yuheng Zhang, Dian Yu, Baolin Peng, Linfeng Song, Ye Tian, Mingyue Huo, Nan Jiang, Haitao Mi, Dong Yu

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15462 2024-12-23 cs.RO cs.AI cs.CL cs.HC cs.LG 67%

TalkWithMachines: Enhancing Human-Robot Interaction for Interpretable Industrial Robotics Through Large/Vision Language Models

Ammar N. Abbas, Csaba Beleznai

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This paper has been accepted for publication in the proceedings of the 2024 Eighth IEEE International Conference on Robotic Computing (IRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07933 2024-11-01 cs.CL cs.AI cs.LG 67%

Large Language Model Unlearning via Embedding-Corrupted Prompts

Chris Yuhao Liu, Yaxuan Wang, Jeffrey Flanigan, Yang Liu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15762 2024-10-24 cs.LG cs.AI cs.CL 67%

Conditional Language Policy: A General Framework for Steerable Multi-Objective Finetuning

Kaiwen Wang, Rahul Kidambi, Ryan Sullivan, Alekh Agarwal, Christoph Dann, Andrea Michi, Marco Gelmi, Yunxuan Li, Raghav Gupta, Avinava Dubey, Alexandre Ramé, Johan Ferret, Geoffrey Cideron, Le Hou, Hongkun Yu, Amr Ahmed, Aranyak Mehta, Léonard Hussenot, Olivier Bachem, Edouard Leurent

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 40 pages. Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01787 2024-08-19 cs.CY cs.AI cs.LG 67%

Harm Amplification in Text-to-Image Models

Susan Hao, Renee Shelby, Yuchi Liu, Hansa Srinivasan, Mukul Bhutani, Burcu Karagol Ayan, Ryan Poplin, Shivani Poddar, Sarah Laszlo

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01452 2024-08-06 cs.CY cs.AI cs.LG 67%

Building a Domain-specific Guardrail Model in Production

Mohammad Niknazar, Paul V Haley, Latha Ramanan, Sang T. Truong, Yedendra Shrinivasan, Ayan Kumar Bhowmick, Prasenjit Dey, Ashish Jagmohan, Hema Maheshwari, Shom Ponoth, Robert Smith, Aditya Vempaty, Nick Haber, Sanmi Koyejo, Sharad Sundararajan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16900 2024-07-25 cs.LG cs.AI cs.CY 67%

Regulating AI Adaptation: An Analysis of AI Medical Device Updates

Kevin Wu, Eric Wu, Kit Rodolfa, Daniel E. Ho, James Zou

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Journal ref CHIL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16268 2024-07-19 cs.LG cs.AI cs.CY 67%

Foundation Model Transparency Reports

Rishi Bommasani, Kevin Klyman, Shayne Longpre, Betty Xiong, Sayash Kapoor, Nestor Maslej, Arvind Narayanan, Percy Liang

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Journal ref Published in AIES 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17806 2024-06-27 cs.CL cs.AI cs.CR cs.CV cs.LG 67%

MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries?

Xirui Li, Hengguang Zhou, Ruochen Wang, Tianyi Zhou, Minhao Cheng, Cho-Jui Hsieh

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11253 2024-06-26 cs.LG cs.AI cs.CL 67%

Aligning Large Language Models by On-Policy Self-Judgment

Sangkyu Lee, Sungdong Kim, Ashkan Yousefpour, Minjoon Seo, Kang Min Yoo, Youngjae Yu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a main conference paper at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15447 2024-05-07 cs.CL cs.AI cs.CR cs.LG 67%

Are aligned neural networks adversarially aligned?

Nicholas Carlini, Milad Nasr, Christopher A. Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, Ludwig Schmidt

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03683 2024-04-08 cs.LG cs.AI cs.CL 67%

Stream of Search (SoS): Learning to Search in Language

Kanishk Gandhi, Denise Lee, Gabriel Grand, Muxin Liu, Winson Cheng, Archit Sharma, Noah D. Goodman

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08461 2024-04-02 cs.CL cs.AI cs.LG 67%

DistillSpec: Improving Speculative Decoding via Knowledge Distillation

Yongchao Zhou, Kaifeng Lyu, Ankit Singh Rawat, Aditya Krishna Menon, Afshin Rostamizadeh, Sanjiv Kumar, Jean-François Kagy, Rishabh Agarwal

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13649 2024-01-18 cs.LG cs.AI cs.CL 67%

On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Rishabh Agarwal, Nino Vieillard, Yongchao Zhou, Piotr Stanczyk, Sabela Ramos, Matthieu Geist, Olivier Bachem

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2024. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03186 2023-12-07 cs.LG cs.AI cs.CY 67%

Data-Driven Traffic Reconstruction and Kernel Methods for Identifying Stop-and-Go Congestion

Edgar Ramirez Sanchez, Shreyaa Raghavan, Cathy Wu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments Presented at NeurIPS 2023 workshops: Tackling Climate Change with Machine Learning & Computational Sustainability

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14540 2023-09-27 cs.LG cs.AI cs.CV cs.CY 67%

Effect of roundabout design on the behavior of road users: A case study of roundabouts with application of Unsupervised Machine Learning

Tasnim M. Dwekat, Ayda A. Almsre, Huthaifa I. Ashqar

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏