DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue
DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 DeepSAGE是融合LLM与DRL的阶段感知咨询对话框架,经评估在阶段目标完成与对话效率上优于6种替代方案,为AI咨询提供了有前景的新路径。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
DeepSAGE:用于结构化CBT咨询对话的阶段感知强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 DeepSAGE是融合LLM与DRL的阶段感知咨询对话框架,经评估在阶段目标完成与对话效率上优于6种替代方案,为AI咨询提供了有前景的新路径。
ExplainGuard:一种用于黑盒XAI模型事后解释完整性保证的零信任框架
专题命中 安全训练 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出ExplainGuard零信任框架,通过策略决策点的三项验证支柱,中和XAI解释操纵攻击,将审计过程转为可验证操作,保障黑盒XAI模型事后解释的完整性。
Comments 9 pages, 2 figures. Accepted at the IEEE Cybersecurity Awareness and Research Symposium 2026 (IEEE CARS 2026)
让信用跟随计算:面向大语言模型强化学习的架构感知信用传输
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 该研究针对大语言模型强化学习的信用传输算子与架构无关的问题,提出计算条件信用传输框架及 CompPO 算法,在 Qwen3-4B 等模型上较 GRPO 取得更优的保留准确率与贪心评估表现。
Comments 22 pages, 6 figures
将反向KL重新思考为自适应熵蒸馏
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。
SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查
机构 * University of South Florida(佛罗里达州立大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。
AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理
专题命中 安全训练 :alignment(abstract)
AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。
AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全
专题命中 安全训练 :safety(abstract)
AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。
面向多区域住宅建筑节能HVAC控制的安全深度强化学习
专题命中 安全训练 :safety(abstract)
AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。
Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026
基于相位分解强化学习的分布式多机器人月球货物运输
机构 * Tohoku University(东北大学) ; École Centrale de Lille(里尔中央理工学院) ; Institut Teknologi Bandung(万隆理工学院)
专题命中 安全训练 :safety(abstract)
AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。
Comments 8 pages, 9 Figures, Accepted at IROS2026
面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室) ; Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。
Comments Accept by EMNLP 2026 Findings
打破假设:针对语义攻击的输入端越狱防御审计
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文针对本地部署大语言模型的输入端越狱防御开展审计,追溯防御失效的假设根源,在6款14B至35B参数的开源权重模型上,用100条来自40余公开源的越狱提示完成13800条评估记录的测试。
PsychJail:通过对大语言模型策略的多轮说服探索心理越狱
机构 * The Defense Innovation Institute, Academy of Military Sciences(军事科学院国防创新研究院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.AI
AI总结 本文提出PsychJail框架,利用社会心理学技术构建攻击策略,通过轨迹级强化学习优化,在四个对齐LLM上实现87.3%平均攻击成功率,揭示了不同模型的心理画像指纹,为LLM安全红队提供了新方向。
面向地下论坛中自动化网络威胁情报的获取
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 本文提出首个基于多智能体大语言模型的主动CTI获取系统DarkBot,其在受控与真实世界实验中均优于基线,可从地下论坛高效获取CTI且安全合规。
Comments 23 pages, 19 figures
相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性
机构 * University of Arizona(亚利桑那大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。
Comments Accepted to EMNLP 2026 (Main Conference)
TEE-X:面向边缘端大视觉模型的感知可信执行环境加速框架
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 该研究提出TEE-X框架,在Arm TrustZone的OP-TEE上验证,可在NVIDIA Jetson AGX Xavier上实现大视觉模型的安全高效边缘推理,兼顾性能与安全性。
激活引导用于不牺牲连贯性的对齐开放式生成
机构 * Tara Research ; Technical University of Munich(慕尼黑工业大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。
$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容
专题命中 越狱攻击 :safety(abstract)
AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。
Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)
基于ASAS对领先阿拉伯大型语言模型开展红队测试
专题命中 红队测试 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。
Comments 13 pages, 5 figues, 3 tables
SecOPD:通过策略内蒸馏缓解自适应提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 针对AI智能体面临的自适应提示注入攻击,提出SecOPD方法,通过令牌级反馈优化防御微调,大幅降低攻击成功率,且安全性可泛化到工具调用等新领域。
Comments EMNLP 2026 (main conference)
先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) ; School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)
专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。
超越过度弃权:通过潜在指令流形防御间接提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)
AI总结 针对LLMs防御间接提示注入时的安全-效用权衡问题,提出AEGIS模型,通过指令敏感投影器与统一多层共识机制实现出色的攻击检测性能,缓解IPI攻击。
Comments Extended Content of EMNLP 2026 Findings
面包屑式搜索智能体
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。
Comments 39 pages, 7 figures
基于关键词锚定的事实替换缓解RAG系统中的数据库泄露
机构 * Nanjing University(南京大学)
专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 针对RAG系统易受提示注入攻击导致数据库泄露的问题,提出KFS-RAG防御方法,通过关键词锚定的事实替换缓解泄露风险,同时保持响应准确性与相关性,为构建安全可信RAG系统提供可行方案。
CALYREX:跨注意力层扩展变换器用于系统提示锚定
机构 * Cornell University(康奈尔大学)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG
AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。
Comments Preprint. 14 pages, 4 figures, 5 tables
你的智能体大模型会秘密编码间接提示注入暴露的潜在信号
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用
Comments v2. Compared to v1, we include the Kimi-K3 model's results and conduct a series of new experiments on understanding probe generalization
面向安全关键多无人机系统的智能体人工智能:挑战与机遇
机构 * Aalborg University(奥尔堡大学) ; University of Southern Denmark(南丹麦大学)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI
AI总结 本文针对安全关键多无人机系统应用受限问题,结合NAMUR、PERSIST项目经验,提出将智能体AI作为社会技术设计问题,采用以人为本的迭代方法开发可迁移的概念验证系统与评估策略。
Comments 9 pages, 4 figures, presented at the AgentCraft Workshop at IUI2026 Conference, this https URL (https://agentcraft-iui.github.io/2026/) - this http URL (http://CEUR-WS.org) proceedings forthcoming
超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析
机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。
量化对生物医学大语言模型可靠性的影响
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。
Comments 8 pages, 1 figure
用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。
遗忘学习不只是擦除:通过生成不平等实现时间解耦
专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型遗忘学习的挑战,提出基于训练的细粒度框架ADU,通过解耦上下文注意力路径实现精准遗忘,在TOFU和WMDP基准上表现最优,同时保留高模型效用并减少副作用。