arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 13 篇

2509.19212 2026-08-31 cs.CL cs.AI 版本更新 86%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2026-08-31 cs.LG cs.AI cs.CL 版本更新 85%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 17 pages, 7 figures, 9 tables. Code and data available at this https URL (https://github.com/erikl2/safety-refusal-stability). v3: corrects dataset attribution (AdvBench+HarmBench, not BeaverTails), fixes label-derived statistics and CIs, revises the judge-noise analysis to a sensitivity framing; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新 82%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 安全训练 :safety(title,abstract)

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-08-31 cs.AI 新提交 79%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24662 2026-08-31 cs.NI 版本更新 71%

OpenTwin: Closed-Loop Digital Twins for Trustworthy Policy Deployment in Open RAN

OpenTwin:面向开放RAN的数字孪生驱动闭环KPM推理与控制

Zifan Zhang, Md Sharif Hossen, Dara Ron, Vijay K. Shah, Yuchen Liu

专题命中 安全训练 :trustworthy(title)

AI总结 针对O-RAN中KPM数据稀缺和AI模型直接部署风险,提出基于开源模拟器和O1接口的数字孪生框架OpenTwin,采用XGBoost与递归最小二乘两步ML方法实现高精度KPM镜像与节能控制。

Comments 13 pages, 5 tables, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28010 2026-08-31 cs.LG cs.AI 新提交 62%

When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?

条件流匹配何时能替代逐点负对数似然?

Yansen Han, Hongxin Sun, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Fudan University(复旦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分解刻画了条件流匹配(CFM)可替代逐点负对数似然(NLL)的条件,指出其在离策略总体最优处的局限性,相关结论及分解为适配LLM方法至流匹配提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28407 2026-08-31 cs.CL 新提交 57%

A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

用于可解释多特质作文评分的结构化反馈提取统一框架

Shihang Yang, Sanwoo Lee, Ningning Zhao, Yunfang Wu

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 该研究针对多特质自动作文评分中反馈与评分分离的问题,提出统一框架HiFTS,结合教师LLM提炼反馈并训练学生模型,在新数据集CFMS-34及ASAP++上取得优异评分与反馈效果。

Comments 14 pages, accepted to EMNLP 2026 Findings. Code: this https URL (https://github.com/Atiyahsama/HiFTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 57%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28233 2026-08-31 cs.AI 新提交 57%

REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

REINS:基于稀疏自编码器特征的增强拒绝抑制引导方法

Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng, Zi-Qi Chen, Jiaqi Wang, Zhen-Hua Ling

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对现有SAE引导方法在复杂包装器有害提示上的不足,提出REINS方法,可抑制有害特征、增强安全弃权特征,在GUISE等数据集上大幅减少有害响应并保留模型通用能力。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27844 2026-08-31 cs.CL 新提交 57%

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

EvoHarmBench:通过类人迭代规避突破内容审核

Ruijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li, Haiwen Hong

机构 * Yuvion Team, Alibaba Group(阿里巴巴集团Yuvion团队) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究提出首个动态对抗评估框架EvoHarmBench,针对5类违规229个语义子簇的5002个样本评估LLM审核模型,发现SOTA模型经12次迭代后规避成功率达80.3%,将推动内容安全评估转向动态模式。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-31 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments Accepted to Findings of EMNLP 2026. 23 pages, 6 figures. Code: this https URL (https://github.com/Noverse0/HALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI eess.SY 新提交 50%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 安全训练 :safety(abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 50%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏