arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3302 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3302 篇

2505.19056 2025-10-08 cs.CL cs.AI cs.LG 75%

An Embarrassingly Simple Defense Against LLM Abliteration Attacks

Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, Bernard Ghanem, George Turkiyyah

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments preprint - under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16366 2025-10-08 cs.CL cs.AI cs.CR cs.LG 75%

A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens

David Dobre, Mehrnaz Mofakhami, Sophie Xhonneux, Leo Schwinn, Gauthier Gidel

机构 * Université de Montréal(蒙特利尔大学) Mila(Mila研究所) Technical University of Munich(慕尼黑技术大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全训练 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18203 2025-08-04 cs.HC cs.AI cs.CL cs.LG 75%

Policy Maps: Tools for Guiding the Unbounded Space of LLM Behaviors

Michelle S. Lam, Fred Hohman, Dominik Moritz, Jeffrey P. Bigham, Kenneth Holstein, Mary Beth Kery

机构 * Stanford University(斯坦福大学) Apple(苹果公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21132 2025-07-30 cs.AI cs.CY cs.LG 75%

Can You Trust an LLM with Your Life-Changing Decision? An Investigation into AI High-Stakes Responses

Joshua Adrian Cahyono, Saran Subramanian

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17441 2025-06-12 cs.CL cs.AI cs.LG 75%

Discovering Forbidden Topics in Language Models

Can Rager, Chris Wendler, Rohit Gandikota, David Bau

机构 * Independent(独立研究者) Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06391 2025-06-10 cs.CY cs.AI cs.CL 75%

From Rogue to Safe AI: The Role of Explicit Refusals in Aligning LLMs with International Humanitarian Law

John Mavi, Diana Teodora Găitan, Sergio Coronado

机构 * Luxembourg Tech School A.s.b.l.(卢森堡技术学校)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20622 2025-05-28 cs.CL cs.AI cs.LG 75%

SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation

Ting Xu, Zhichao Huang, Jiankai Sun, Shanbo Cheng, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Bytedance(字节跳动) Stanford University(斯坦福大学)

专题命中 安全训练 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24370 2025-05-22 cs.LG cs.AI cs.CL 75%

Effectively Controlling Reasoning Models through Thinking Intervention

Tong Wu, Chong Xiang, Jiachen T. Wang, G. Edward Suh, Prateek Mittal

机构 * Princeton University(普林斯顿大学) NVIDIA(英伟达)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03266 2025-05-19 cs.CL cs.AI cs.CY cs.HC cs.SI 75%

LLM Content Moderation and User Satisfaction: Evidence from Response Refusals in Chatbot Arena

Stefan Pasch

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17365 2025-04-14 cs.LG cs.AI cs.CY 75%

How Effective Is Constitutional AI in Small LLMs? A Study on DeepSeek-R1 and Its Peers

Antonio-Gabriel Chacón Menke, Phan Xuan Tan

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00761 2025-02-11 cs.LG cs.AI cs.CL 75%

Tamper-Resistant Safeguards for Open-Weight LLMs

Rishub Tamirisa, Bhrugu Bharathi, Long Phan, Andy Zhou, Alice Gatti, Tarun Suresh, Maxwell Lin, Justin Wang, Rowan Wang, Ron Arel, Andy Zou, Dawn Song, Bo Li, Dan Hendrycks, Mantas Mazeika

专题命中 安全训练 :safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Website: https://www.tamper-resistant-safeguards.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17433 2025-01-30 cs.CR cs.AI cs.CL cs.LG 75%

Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18540 2025-01-20 cs.LG cs.AI cs.CL 75%

Keeping LLMs Aligned After Fine-tuning: The Crucial Role of Prompt Templates

Kaifeng Lyu, Haoyu Zhao, Xinran Gu, Dingli Yu, Anirudh Goyal, Sanjeev Arora

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02987 2024-12-19 cs.LG cs.AI cs.CL 75%

LoRA-Guard: Parameter-Efficient Guardrail Adaptation for Content Moderation of Large Language Models

Hayder Elesedy, Pedro M. Esperança, Silviu Vlad Oprea, Mete Ozay

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11717 2024-11-01 cs.LG cs.AI cs.CL 75%

Refusal in Language Models Is Mediated by a Single Direction

Andy Arditi, Oscar Obeso, Aaquib Syed, Daniel Paleka, Nina Panickssery, Wes Gurnee, Neel Nanda

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13708 2024-10-30 cs.CL cs.AI cs.CY 75%

Towards Safe Multilingual Frontier AI

Artūrs Kanepajs, Vladimir Ivanov, Richard Moulange

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 23 pages; 1 figure and 10 supplementary figures; Accepted (spotlight presentation) at NeurIPS 2024 SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08689 2024-07-12 cs.AI cs.CY cs.LG 75%

Operationalizing the Blueprint for an AI Bill of Rights: Recommendations for Practitioners, Researchers, and Policy Makers

Alex Oesterling, Usha Bhalla, Suresh Venkatasubramanian, Himabindu Lakkaraju

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.18018 2024-06-04 cs.LG cs.AI cs.CL 75%

On Prompt-Driven Safeguarding for Large Language Models

Chujie Zheng, Fan Yin, Hao Zhou, Fandong Meng, Jie Zhou, Kai-Wei Chang, Minlie Huang, Nanyun Peng

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05335 2023-04-12 cs.CL cs.AI cs.LG 75%

Toxicity in ChatGPT: Analyzing Persona-assigned Language Models

Ameet Deshpande, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01663 2022-11-11 cs.LG cs.AI cs.CL 75%

Adversarial Training for High-Stakes Reliability

Daniel M. Ziegler, Seraphina Nix, Lawrence Chan, Tim Bauman, Peter Schmidt-Nielsen, Tao Lin, Adam Scherlis, Noa Nabeshima, Ben Weinstein-Raun, Daniel de Haas, Buck Shlegeris, Nate Thomas

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 7 figures, NeurIPS camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.00006 2020-01-03 cs.CY cs.AI cs.LG stat.ML 75%

Learning from Learning Machines: Optimisation, Rules, and Social Norms

Travis LaCroix, Yoshua Bengio

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04826 2025-12-24 cs.CL cs.AI 74%

Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响

Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

专题命中 安全训练 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。

Comments Accepted at AAAI 2026, Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03875 2026-08-18 cs.LG 版本更新 74%

Learning Multi-Timescale Interventions under Safety and Resource Constraints

安全与资源约束下的多时间尺度干预学习

David Mguni, Wanrong Yang, Jing Dong, Jing Peng, Ziquan Liu, Muhammad Salman Haleem, Baoxiang Wang, Dominik Wojtczak

专题命中 安全训练 :safety(title);分类 cs.LG

AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11649 2026-08-13 cs.CL 新提交 74%

Who Would You Vote For? Auditing Political Alignment in LLMs: An Italian Case-Study

你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究

Simone Mungari

机构 * Revelis s.r.l.(雷维利斯有限责任公司)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 74%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05462 2026-07-22 cs.CR cs.AI 版本更新 74%

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment

评估两用生物学环境中的校准拒绝和安全有用性

Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

机构 * American Wetware(美国湿科公司) LatchBio

专题命中 安全训练 :alignment(title);分类 cs.AI

AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 74%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-06-16 cs.RO cs.AI 版本更新 74%

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

专题命中 安全训练 :alignment(title);分类 cs.AI

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07177 2026-06-02 cs.CR cs.AI 74%

Safe-FedLLM: Delving into the Safety of Federated Large Language Models

Safe-FedLLM:深入探究联邦大语言模型的安全性

Mingxiang Tao, Yu Tian, Wenxuan Tu, Yue Yang, Xue Yang, Xiangyan Tang

机构 * Hainan University(海南大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28372 2026-05-28 cs.LG cs.RO 74%

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

教师-学生表征对齐用于强化学习驱动的模仿学习

Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas Stork

机构 * Department of Computer Science(计算机科学系) Örebro University(奥雷布罗大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出一种通过自监督对比学习构建共享嵌入空间的方法,以减小教师和学生策略之间的不可模仿差距,从而提升学生策略性能。

Comments 6 pages, 5 figures. Accepted as an oral presentation at the RL4IL Workshop at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏