arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2508.09473 2026-08-26 cs.LG cs.AI cs.CL 版本更新 89%

NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs

NeuronTune:用于大语言模型中安全-效用平衡对齐的细粒度神经元调制

Birong Pan, Jianhao Chen, Mayi Xu, Qiankun Pi, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeuronTune是一种细粒度神经元调制框架,通过定位安全关键与效用保留神经元并动态控制干预范围,实现了大语言模型安全与效用的平衡优化,性能优于现有最先进技术。

Comments This work was accepted by WISE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-26 cs.AI cs.CL 新提交 81%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24191 2026-08-26 cs.CL cs.AI 新提交 81%

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

《翻译中的隐秘危害:利用“乌尔语未检出”分数测量大型语言模型仇恨言论检测中的跨文字安全不一致性》

Fawzia Zehra (Fuzzy) Kara-Isitt, Sonal Khosla, Stephen Swift

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对乌尔语在LLM安全评估中的缺失问题,测试五款LLM在多类乌尔语相关数据集上的表现,发现其跨文字安全不一致性,且开放权重模型问题更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-08-26 cs.CR cs.AI cs.CL 版本更新 79%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: this https URL (https://github.com/Harry-Ashley/adversa-guardrail-degradation). Published in the 2026 IEEE/ACIS 24th International Conference on Software Engineering Research, Management and Applications (SERA), pp. 414-417. Recipient of the Best Paper Award at IEEE/ACIS SERA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24777 2026-08-26 cs.AI cs.CR 新提交 74%

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏

Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) KAUST(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。

Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 70%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24654 2026-08-26 cs.CL cs.CY 新提交 62%

Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems

期望、反弹、恢复与兴奋:模型发布如何塑造Reddit对对话式AI系统的认知

Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究通过分析Reddit讨论发现,对话式AI系统的模型发布会动态影响用户认知,不同提供商的模型发布在情感表现与关注主题上存在明显差异,这类发布是面向用户的重要干预措施。

Comments Accepted at EMNLP 2026 Main Conference. The companion website is available at this https URL (https://vavre.github.io/p/upai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02520 2026-08-26 cs.MA cs.AI cs.LG eess.SY 版本更新 62%

Highway Congestion Reduction through Reinforcement Learning Based Eulerian Headway Control

基于强化学习的欧拉车头间距控制实现高速公路拥堵缓解

Yaron Veksler, Sharon Hornstein, Han Wang, Maria Laura Delle Monache, Daniel Urieli

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对传统拥堵控制策略的缺陷,提出基于强化学习的欧拉车头间距控制系统,经大规模仿真验证可显著提升交通流量,为高速公路拥堵缓解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交 57%

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23941 2026-08-26 cs.AI 新提交 57%

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元

Yuchen Han, Cheng Yan, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。

Comments 37 pages, 20 figures, 32 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏