arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2608.11583 2026-08-13 cs.AI 新提交 88%

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13450 2026-08-13 cs.AI cs.CL cs.LG 版本更新 82%

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试

Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 79%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11498 2026-08-13 cs.CV cs.ET cs.LG 新提交 79%

Language-Structured Relational Q-Learning for Threat-Aware Control in Safety-Critical Driving

面向安全关键驾驶中威胁感知控制的语言结构化关系Q学习

Aditya Humnabadkar, Huaizhong Zhang, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对安全关键驾驶,提出语言结构化关系Q学习(ERQ-Net),经2500个场景测试,提升了威胁感知能力但存在识别-控制差距,为相关策略学习提供了新视角。

Comments Accepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11451 2026-08-13 cs.RO cs.AI cs.SY eess.SY 新提交 79%

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

通过神经符号安全护卫实现端到端自动驾驶的引导

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 76%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11649 2026-08-13 cs.CL 新提交 74%

Who Would You Vote For? Auditing Political Alignment in LLMs: An Italian Case-Study

你会投票给谁?大型语言模型(LLM)的政治立场审计:意大利案例研究

Simone Mungari

机构 * Revelis s.r.l.(雷维利斯有限责任公司)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文以意大利为案例,提出系统可复现的LLM政治立场审计框架,分析多模型对意政党及领导人的评价行为、差异等,探究模型政治偏好相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11658 2026-08-13 cs.LG cs.AI cs.MA 新提交 62%

Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning

智能体策略组合是否安全?重新思考合作多智能体强化学习中的后继特征迁移

Zijian Zhao, Sen Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体强化学习中独立策略组合不安全的问题,提出MA-USFA分层方法,兼顾策略组合的安全性与灵活性,无需任务适配即可部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 57%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏