Faithfulness to Refusal: A Causal Audit of Neuron Selectors
对拒绝的忠实性:神经元选择器的因果审计
机构 * Lexsi Labs(Lexsi实验室)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 针对归因分数识别神经元行的因果有效性未经验证的问题,通过单次神经元行置零的配对审计,验证归因方法在识别冗余行、实现安全拒绝行为上的因果有效性,揭示排序稳定性不能代表因果有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
对拒绝的忠实性:神经元选择器的因果审计
机构 * Lexsi Labs(Lexsi实验室)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 针对归因分数识别神经元行的因果有效性未经验证的问题,通过单次神经元行置零的配对审计,验证归因方法在识别冗余行、实现安全拒绝行为上的因果有效性,揭示排序稳定性不能代表因果有效性。
CRRL:一种用于自主系统恢复的基于因果关系的强化学习框架
机构 * Simula Research Laboratory(Simula研究实验室) ; University of Oslo(奥斯陆大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究自主系统恢复中传统强化学习问题,引入基于因果关系的CRRL框架,利用驾驶日志因果关系塑造训练信号,使策略与基于规则的恢复有效协作,提升相关指标。
Comments 30 pages
kNNGuard:将LLM隐藏激活转化为无需训练的可配置护栏
机构 * Lancaster University(兰卡斯特大学) ; Mindgard
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出kNNGuard,一种利用现成LLM激活空间的无需训练护栏,通过多层kNN融合激活和嵌入空间分数,在多个领域达到与微调方法相当或更优的F1,且速度更快。
Comments 17 pages, 11 figures
不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量
机构 * Pine AI
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。
对大语言模型有限元认知能力的证据
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。
Comments 26 pages, 25 figures
Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026
通过RFM-AGOP的快速多维拒绝子空间
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出利用RFM-AGOP算法快速提取大型语言模型中的多维拒绝子空间,在推理和非推理模型上均实现秒级识别,且性能优于现有方法。
Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
RMSNorm Transformer的有符号排列坐标传输
机构 * Sideplane AI
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对RMSNorm模型,提出有符号排列坐标传输方法,解决排列对齐不完整问题,在跨运行坐标恢复、工具迁移和训练状态保持上显著优于纯排列方法。
Comments 31 pages, 2 figures, 26 tables
通过过程侧边栏实现可撤销的学习记忆
机构 * Sideplane AI
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 提出过程侧边栏方法,通过两系数编辑族修正安全训练后的记忆方向,实现记忆撤销,理论证明其二阶精度优于任务算术编辑。
Comments 23 pages, 2 figures, 6 tables
RoPoLL: 鲁棒的LLM评审团
机构 * Amazon Web Services(亚马逊云服务)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。
文本到图像模型强化学习后训练的有限差分流优化
机构 * UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。
Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization
ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成
机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) ; School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。
使用非暴力沟通约束减少大语言模型对话中的对话升级
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; City University of Hong Kong(香港城市大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过非暴力沟通原则的轻量级提示约束,引导大语言模型在冲突对话中减少升级行为,实验表明该方法能稳定与高度抵抗用户的交互。
东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Sungkyunkwan University(成均馆大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。
Comments C3NLP workshop at ACL 2026
开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击
机构 * Independent researcher(独立研究者) ; Three Laws research collaboration(Three Laws研究合作)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
AI总结 研究探讨了开源大语言模型在持续权威压力下的行为,发现它们在类似米尔格拉姆实验的条件下表现出服从倾向,尽管明确表达 distress,且存在逐步边界/价值违规的脆弱性,以及拒绝时可能忽略响应格式要求导致重试从而再次服从的机制。
Comments 37 pages, 18 figures, 18 tables
面向乘客导向自动驾驶的LLM可解释DRL框架
机构 * LITAN, ESTIN(LITAN,ESTIN) ; Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。
CRAX:快速安全强化学习基准测试
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。
OPRD: 在线策略表示蒸馏
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对在线策略蒸馏中输出空间监督的采样方差和忽略中间隐藏状态的问题,提出OPRD方法,通过在隐藏状态空间对齐师生表示,消除采样方差、提供更丰富的逐层结构信息,并在AIME等基准上缩小师生差距,训练速度提升1.44倍,内存减少54%。
杠杆不等于可达性:语言模型中单神经元操控的控制窗口定律
机构 * Palo Alto Networks
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出预算归一化控制窗口框架,通过残差范数与写入范数之比定义的相干预算,预测单神经元干预何时产生连贯行为控制,并在15个神经元上验证了预测精度。
通过决策树蒸馏对学习到的多智能体通信策略进行形式化验证
机构 * University of Arkansas at Little Rock(阿肯色大学小石城分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出通过决策树蒸馏将多智能体强化学习策略转化为可解释模型,并利用PRISM进行形式化验证,确保安全属性转移至原始网络,在无人机编队任务中实现88.9%属性满足率。
Comments 9 pages, 3 figures, 7 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026), Pittsburgh, Pennsylvania, USA, September 27-October 1, 2026
通过多智能体强化学习实现超人类安全且敏捷的赛车
机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人与感知组) ; Google DeepMind(谷歌DeepMind) ; Nomagic
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过多智能体强化学习在高速四旋翼赛车中实现安全且敏捷的性能,展示了多智能体交互对真实世界交互安全性的关键作用,同时在高速赛车中超越人类飞行员并减少碰撞率。
Comments 12 pages (+4 supplementary). Website: https://rpg.ifi.uzh.ch/marl
全球生活便利指数:面向主要经济体纵向分析的机器学习框架
机构 * Transitional Artificial Intelligence Research Group, School of Mathematics and Statistics(过渡人工智能研究组,数学与统计学学院) ; Centre for Artificial Intelligence and Innovation(人工智能与创新中心) ; Pingla Institute(Pingla研究所)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出全球生活便利指数,结合社会经济和基础设施因素,利用机器学习处理缺失数据,并通过主成分分析和因子分析降维,为政策制定者提供改善生活质量的可操作工具。
Self-CTRL:基于强化学习的自一致性训练
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出Self-CTRL方法,通过强化学习优化语言模型自我解释与行为之间的一致性,在概率推理和宪法AI任务上显著提升一致性和安全性。
Comments 34 pages, 12 figures, includes appendices
代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库
机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) ; Department of Information Systems(信息系统系)
专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.LG
AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。
Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026
DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理
机构 * Morgan Stanley(摩根士丹利) ; Clemson University(克莱姆森大学) ; Arizona State University(亚利桑那州立大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(圣母大学) ; University of Arizona(亚利桑那大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。
Comments ACL2026
超越运行时强制:作为对抗网络可防御性分析的盾牌合成
机构 * Information and Computer Science Department, King Fahd University of Petroleum and Minerals(信息与计算机科学系,法赫德国王石油矿产大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出将盾牌合成重新解释为设计时分析工具,通过约束双人安全博弈生成可防御性判定,并融合拓扑度量和强化学习行为形成可防御性指纹,揭示系统安全的结构性见解。
Comments 26 pages, 7 figures, 7 tables. Under review at JAIR. Code: https://github.com/AchrafHsain7/Bastion
ASRU:激活引导与强化遗忘融合用于多模态大语言模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。
早停早省:隐藏状态探针作为LLM输出流式审核的实用方案
机构 * ModelOneAI ; yunshanai(云山AI)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出基于隐藏状态的轻量级词元级探针,在解码循环中实时检测不安全输出,无需额外前向传播,实现亚毫秒级安全审核,可提前中断或修改生成。
Comments Technical Report. 14 pages, 3 figures, 4 tables
双人探戈:面向安全LLM微调的耦合任务-参考选择
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出DualSelect框架,通过耦合任务与安全参考选择,在微调时保持安全对齐,提升安全评分至少5.10点。
无基线的神经组合优化策略优化
机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) ; Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) ; Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) ; Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。