The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails
《狼来了:多模态安全护栏中安全输入被对抗性误分类为不安全》
AI总结 该研究针对多模态安全护栏提出不安全诱导攻击,通过不安全语义蒸馏实现84%攻击成功率,揭示了当前多模态安全架构存在安全输入被误判为不安全的可用性漏洞。
Comments Accepted by KDD 2026
期刊&会议
ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining
《狼来了:多模态安全护栏中安全输入被对抗性误分类为不安全》
AI总结 该研究针对多模态安全护栏提出不安全诱导攻击,通过不安全语义蒸馏实现84%攻击成功率,揭示了当前多模态安全架构存在安全输入被误判为不安全的可用性漏洞。
Comments Accepted by KDD 2026
用于生成式推荐的协同记忆增强
AI总结 针对现有生成式推荐模型未利用跨用户协同信号的问题,提出OMEGA框架,通过潜在上下文压缩、协同记忆库与目标感知检索等机制,在多数据集上显著优于现有先进模型。
Comments Accepted by KDD 2026 Research Track
RH-RAG:适用于隐私受限场景的可信长文本生成
机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)
AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。
Comments accepted in KDD 2026 SeT-LLM Workshop
不要提供无法完成的任务:面向大规模LLM技能选择的确定性可执行性门控机制
机构 * Wix Israel(Wix以色列) ; Wix Ukraine(Wix乌克兰)
AI总结 该研究针对大规模LLM技能选择中不可执行技能的干扰问题,提出三阶段选择流水线,经生产分析和反事实测试,可大幅减少技能描述上下文并阻止不可执行技能影响模型选择。
Comments 7 pages, 3 figures. Preprint. Submitted to the ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2027), Applied Data Science Track; currently under review
用于生成式推荐的分层残差策略优化
AI总结 针对生成式推荐器后训练中标记级信用分配问题,提出HRPO框架,将项目级结果转换为标记对齐学习信号,经实验在会话效用和业务指标上取得提升。
Comments 12 pages, 6 figures, 10 tables. Accepted at KDD 2026 Research Track
SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。
Comments Accepted by KDD 2026. 12 pages, 6 figures