arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 22 篇

2603.02229 2026-08-25 cs.LG cs.CL 版本更新 84%

Safety Training May Persist Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21570 2026-08-25 cs.AI cs.LG 新提交 81%

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

适用于CPU可部署安全分类的可复现、许可感知蒸馏方案

Edson Rodrigues da Cruz Filho, Paulo Ricardo Ferreira Neves, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可复现、许可感知的知识蒸馏方案,训练小型学生模型实现CPU可部署的安全分类,其性能接近大参数教师模型,误报率更低且推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21775 2026-08-25 cs.CL 新提交 79%

No One Model Catches Every Harm: Benchmarking Content Moderation Across Safety Scenarios

没有一种模型能应对所有危害:跨安全场景的内容审核基准测试

Afshin Orojlooyjadid, Hitesh Patel

机构 * Oracle AI(甲骨文人工智能)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 该研究测试53个模型在11个数据集的四类安全场景下的表现,发现前沿模型在部分场景落后于专用模型,实际对话安全未解决,挑战规模即安全的假设并提供模型选择框架。

Comments EMNLP 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07356 2026-08-25 cs.CL 版本更新 79%

Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks

仅安全对齐权重不够:拒绝教师引导微调可在有害微调攻击下提升安全性与下游性能

Seokil Ham, Yubin Choi, Yujin Yang, Seungju Cho, Younghun Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 针对有害微调攻击威胁,该研究提出拒绝教师引导微调框架,将安全FaaS微调范式从安全对齐权重微调转为基础权重在安全教师指导下的微调,可减少有害输出并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 70%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23034 2026-08-25 cs.LG cs.CL 新提交 62%

ST$^2$U: Stateful Test-Time Unlearning via Restricted Knowledge Boundary Control

ST$^2$U:通过受限知识边界控制实现的有状态测试时遗忘

Xunlei Chen, Qinghui Gong, Ruini Xue, Yaodong Hu, Tian Lan, Wenhong Tian

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ST$^2$U方法,将测试时遗忘转化为全轨迹范围的受限知识边界控制,在三个基准和三个模型系列上,该方法比测试时基线大幅减少受限知识重新进入,实现了保留与遗忘的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22894 2026-08-25 cs.CL cs.AI 新提交 62%

AraDetox: A Multi-Dialect Arabic Detoxification Dataset

AraDetox:多方言阿拉伯语解毒数据集

Mo El-Haj

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多方言阿拉伯语解毒数据集AraDetox,基于GPT-5和Gemini 2.5 Flash生成海量解毒文本,经评估验证其可有效去除有害语言并保留原意,为相关研究提供公开资源。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22284 2026-08-25 cs.SE cs.AI cs.LG 新提交 62%

Learning from the Test: Self-Referential Differential Testing for Deep RL Agents

从测试中学习:深度强化学习智能体的自引用差异测试

Junda He, Jieke Shi, Zhou Yang, Mingfei Cheng, David Lo

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对深度强化学习智能体的最优性评估缺口,提出Delta框架,通过两阶段差异测试,结合离线RL算法,在5个环境中平均发现2518个最优性缺陷,效果优于基线方法50.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10279 2026-08-25 cs.CR cs.AI cs.CL 版本更新 62%

Withholding the Completing Chunk: Exact Release-Boundary Equivalence for Production Streaming Guardrails

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 9 pages, 2 figures, 4 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28900 2026-08-25 cs.RO cs.AI cs.LG eess.SY 版本更新 62%

Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing

针对GPS退化和欺骗的鲁棒多智能体强化学习用于小型无人机分离保障

Alex Zongo, Filippos Fotiadis, Ufuk Topcu, Peng Wei

机构 * George Washington University(乔治华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多智能体强化学习解决小型无人机在GPS退化和欺骗下的鲁棒分离保障问题,提出闭式表达式对抗扰动,实现线性时间评估,并在高密度无人机模拟中取得近零碰撞率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-08-25 cs.DB cs.AI cs.CL cs.SE 版本更新 62%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22797 2026-08-25 cs.AI 新提交 57%

Performance of a domain-specific large language model in answering patient questions in psychiatry

面向精神病学领域的专用大语言模型在回答患者问题时的性能表现

Alexander J. Hish, Arjun Nagendran, Scott N. Compton

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究开发了专用LLM MIND,对比ChatGPT、OpenEvidence回答患者关于艾司西酞普兰的问题,发现MIND评分更高但医生更偏好ChatGPT,为构建精神病学安全LLM提供了进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22752 2026-08-25 cs.AI cs.IR 新提交 57%

The Compaction Cliff in Long-Running AI Agent Memory

长期运行AI智能体记忆中的压缩 cliff

Saber Zerhoudi, Jelena Mitrovic, Michael Granitzer

机构 * University of Passau(帕绍大学) IT:U

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对AI智能体记忆压缩时安全规则保留率骤降的压缩cliff问题,提出Knowledge Triage框架,通过三类算子优化上下文管理,在多基准测试中优于现有方法,并发布了相关数据集与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22615 2026-08-25 cs.AI 新提交 57%

DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue

DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习

Qi Zhang, Heajun An, Prakriti Dumaru, Sang Won Lee, Lifu Huang, Pamela J. Wisniewski, Jin-Hee Cho

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 DeepSAGE是融合LLM与DRL的阶段感知咨询对话框架,经评估在阶段目标完成与对话效率上优于6种替代方案,为AI咨询提供了有前景的新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21803 2026-08-25 cs.CR cs.AI 新提交 57%

ExplainGuard: A Zero Trust Framework for Post-Hoc Explanation Integrity Guarantees in Blackbox XAI Models

ExplainGuard:一种用于黑盒XAI模型事后解释完整性保证的零信任框架

Maraz Mia, Shovan Roy, Mir Mehedi A. Pritom, Maanak Gupta

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出ExplainGuard零信任框架,通过策略决策点的三项验证支柱,中和XAI解释操纵攻击,将审计过程转为可验证操作,保障黑盒XAI模型事后解释的完整性。

Comments 9 pages, 2 figures. Accepted at the IEEE Cybersecurity Awareness and Research Symposium 2026 (IEEE CARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21501 2026-08-25 cs.AI 新提交 57%

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

让信用跟随计算:面向大语言模型强化学习的架构感知信用传输

Qifan Shi, Zhaolu Kang, Chenghua Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14685 2026-08-25 cs.LG stat.ML 版本更新 57%

Rethinking Reverse KL as Adaptive Entropy Distillation

将反向KL重新思考为自适应熵蒸馏

Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-08-25 cs.CV cs.CL 版本更新 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22932 2026-08-25 eess.SP 新提交 50%

AirMoE: Realizing Over-the-Air Distributed Mixture-of-Experts Inference at the Wireless Edge

AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理

Huiling Yang, Zhanwei Wang, Kaibin Huang

专题命中 安全训练 :alignment(abstract)

AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22868 2026-08-25 cs.CR 新提交 50%

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全

Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17235 2026-08-25 eess.SY 版本更新 50%

Safe Deep Reinforcement Learning for Energy-Efficient HVAC Control in Multi-Zone Residential Buildings

面向多区域住宅建筑节能HVAC控制的安全深度强化学习

Oussama Ziadi, Abdelilah Rochd, Samir Idrissi Kaitouni, Mohamed Oualid Mghazli, Adnane Saoud

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。

Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-08-25 cs.RO 版本更新 50%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏