arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

共收录 2566
1905.11031 2026-06-04 math.OC cs.NA math.NA

A Block Decomposition Algorithm for Sparse Optimization

一种用于稀疏优化的块分解算法

Ganzhao Yuan, Li Shen, Wei-Shi Zheng

AI总结 本文提出了一种结合组合搜索方法和坐标下降方法优势的块分解算法,通过随机或贪心策略选择坐标子集作为工作集,并在原始目标函数上进行全局组合搜索,从而找到更优的 stationary 点,并建立了算法的收敛速度。

Comments to appear in SIGKDD 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.03709 2026-06-04 eess.SY cs.SY

Grey-box Process Control Mining for Anomaly Monitoring and Deconstruction

灰盒过程控制挖掘用于异常监控与分解

Andrés Vargas, MD Ridwan Al Iqbal, John S. Erickson, Kristin P. Bennett

AI总结 本文提出一种灰盒方法用于智能制造中的异常检测,结合过程控制ODE模型与贝叶斯回归,生成特征形状签名以识别异常来源。

Comments 9 pages, 15 figures, accepted to ODD v5.0: ACM SIGKDD 2018 Workshop August 2018, London UK. Paper originally published on the workshop's website, but not considered archival for resubmission purposes, so resubmitting to arXiv is allowed

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.07349 2026-06-04 cs.SI cs.NA math.NA stat.ML

Incremental Method for Spectral Clustering of Increasing Orders

逐步方法用于增加阶次的谱聚类

Pin-Yu Chen, Baichuan Zhang, Mohammad Al Hasan, Alfred O. Hero

AI总结 本文提出一种逐步方法,用于构建图拉普拉斯矩阵的特征谱,通过利用图拉普拉斯矩阵的特征结构,从已知的K-1个最小特征对中获取K个特征对,从而将批量特征分解问题转化为高效的顺序主导特征对计算问题。

Comments in KDD workshop on mining and learning graph, 2016 http://www.mlgworkshop.org/2016/

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.04644 2026-06-04 math.NA cs.NA

Abnormal Subspace Sparse PCA for Anomaly Detection and Interpretation

异常子空间稀疏PCA用于异常检测与解释

Xingyan Bin, Ying Zhao, Bilong Shen

AI总结 本文提出基于PCA的可解释异常检测模型,通过稀疏正交加载向量构建异常子空间,实现对检测到的异常进行解释,实验表明其检测性能与PCA相当。

Comments ODDx3, ACM SIGKDD 2015 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1312.7651 2026-06-04 stat.ML cs.LG cs.SY eess.SY

Petuum: A New Platform for Distributed Machine Learning on Big Data

Petuum:一种用于大数据上分布式机器学习的新平台

Eric P. Xing, Qirong Ho, Wei Dai, Jin Kyu Kim, Jinliang Wei, Seunghak Lee, Xun Zheng, Pengtao Xie, Abhimanu Kumar, Yaoliang Yu

AI总结 本文提出一种通用框架,系统解决大规模机器学习中的数据和模型并行挑战,通过观察许多机器学习程序本质上是优化导向的,并允许容错、迭代收敛的算法解决方案,从而实现高效的系统设计。

Comments 15 pages, 10 figures, final version in KDD 2015 under the same title

详情

展开后加载摘要…

URL PDF HTML 收藏
1404.1530 2026-06-04 cs.DS cs.IT cs.NA math.IT math.NA math.ST stat.ML stat.TH

Provable Deterministic Leverage Score Sampling

可证明的确定性杠杆评分采样

Dimitris Papailiopoulos, Anastasios Kyrillidis, Christos Boutsidis

AI总结 本文研究确定性杠杆评分采样在矩阵近似中的有效性,证明其在幂律衰减条件下与随机采样等效,并通过实验证明其性能优于现有方法。

Comments 20th ACM SIGKDD Conference on Knowledge Discovery and Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03184 2026-06-03 q-fin.CP cs.LG q-fin.ST

FinStressTS: A Parametric Synthetic Benchmark for Time-Series Forecasting in Finance

FinStressTS: 金融时间序列预测的参数化合成基准

Jiaze Sun, Kelvin J. L. Koa, Ruiyang Ni, Yize Liu, Haonan Chen, Ke-Wei Huang

机构 * National University of Singapore(新加坡国立大学) Asian Institute of Digital Finance(亚洲数字金融研究所) Nanyang Technological University(南洋理工大学)

AI总结 针对金融预测中信号弱、机制复杂的问题,提出FinStressTS合成基准,通过30个诊断环境系统评估15种模型在点预测与概率预测上的表现,揭示模型性能对数据机制的依赖性。

Comments KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03467 2026-06-03 cs.AI

StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems

StepFinder:多智能体系统中故障归因的时间语义框架

Taiyu Zhu, Yifan Wu, Weilin Jin, Ying Li, Gang Huang

机构 * Peking University(北京大学)

AI总结 提出StepFinder框架,通过将执行日志编码为时间语义序列并利用时序建模与注意力模块,高效准确地定位多智能体系统中的故障根因步骤。

Comments 12 pages, 5 figures. Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03179 2026-06-03 cs.CL

HyperPatch: Sequential Knowledge Editing Under n-ary Structural Drift

HyperPatch: n元结构漂移下的顺序知识编辑

Yu-Kai Chan, Wen-Sheng Lien, Dong-Ting Yao, Bo-Kai Ruan, Kwan-Yeung Lin, Hong-Han Shuai, Meng-Fen Chiang

机构 * National Yang Ming Chiao Tung University

AI总结 针对非平稳环境中n元事件顺序更新引发的结构漂移问题,提出HyperPatch框架,通过超图流形上的稳定性建模,实现参数保留的知识编辑,在MQuAKE-CF和MQuAKE-T基准上分别取得96.24%和21.06%的跳步准确率相对提升。

Comments Accepted to Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03068 2026-06-03 cs.LG cs.AI

Learn When and Where to Connect: Adaptive Virtual Nodes for Dynamic Message Passing on Graphs

学习何时何地连接:图上动态消息传递的自适应虚拟节点

Jaejun Lee, Joyce Jiyoung Whang

机构 * School of Computing, KAIST(计算机学院,韩国科学技术院) Department of AI Computing, KAIST(人工智能计算系,韩国科学技术院)

AI总结 提出MAVN框架,通过端到端可微分的方式自适应地决定在消息传递神经网络的哪一层为哪些节点引入虚拟节点,并基于双向评分机制建立连接,理论证明其能模拟任意节点-虚拟节点连接模式,实验表明在多个数据集上显著提升骨干网络性能。

Comments 12 pages, 6 figures, 10 tables, 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02946 2026-06-03 cs.LG cs.CR

Outsmarting the Chameleon: Counterfactual Decoupling for Tactical OOD Shifts in Live Streaming Risk Assessment

智取变色龙:针对直播风险评估中战术性OOD偏移的反事实解耦

Yiran Qiao, Jing Chen, Jiaqi Xu, Yang Liu, Qiwei Zhong, Xiang Ao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ByteDance China(字节跳动中国)

AI总结 针对直播中恶意行为者通过战术性分布偏移(Tactical OOD Shift)规避检测的问题,提出基于潜在因果的反事实解耦框架LPCD,通过潜在层建模意图与叙事变化并强制潜在反事实一致性,实现鲁棒的风险评估。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00809 2026-06-03 cs.AI

NBQ: Next-Best-Question for Dynamic Profiling

NBQ: 动态画像中的下一最佳问题

Yimin Shi, Clarice Wang, Haixun Wang, Xiaokui Xiao

机构 * National University of Singapore(国立新加坡大学) University of Pennsylvania(宾夕法尼亚大学) EvenUp

AI总结 提出NBQ框架,通过自适应选择信息增益最大的问题,从对话中动态构建用户画像,并引入QuickMatch加速双向匹配。

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26704 2026-06-03 cs.LG cs.AI

SL-BiLEM: Structured Learnable Behavior-in-the-Loop Epidemic Modeling for Forecasting and Policy Evaluation

SL-BiLEM: 用于预测和政策评估的结构化可学习行为循环流行病模型

Haochun Wang, Sendong Zhao, Jingbo Wang, Yanrui Du, Ting Liu, Bing Qin

机构 * Faculty of Computing, Harbin Institute of Technology(计算学院,哈尔滨工业大学)

AI总结 提出SL-BiLEM模型,通过物理约束正则化实现鲁棒外推,在政策干预导致的分布偏移下预测准确率提升76%,并支持反事实分析。

Comments ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19250 2026-06-03 cs.CL

Can Structural Cues Save LLMs? Evaluating Language Models in Massive Document Streams

结构线索能否拯救LLM?评估大规模文档流中的语言模型

Yukyung Lee, Yebin Lim, Woojun Jung, Wonjun Choi, Susik Yoon

机构 * Boston University(波士顿大学) Korea University(韩国大学)

AI总结 本文提出StreamBench基准,通过主题聚类、时序问答和摘要任务评估语言模型在混合多事件的文档流中的表现,发现结构线索能提升聚类和时序QA性能,但时序推理仍是挑战。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05290 2026-06-03 cs.AI

X-RAY: Mapping LLM Reasoning Capability via Formalized and Calibrated Probes

X-RAY: 通过形式化与校准探针映射大语言模型推理能力

Tianxi Gao, Yufan Cai, Yusi Yuan, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出X-RAY系统,利用形式化工具生成结构可控的校准探针,通过分析约束交互、推理深度和解空间几何等属性,揭示LLM在约束细化与解空间重构下的推理不对称性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05207 2026-06-03 cs.IR cs.CL

Core-based Hierarchies for Efficient GraphRAG

基于核心的高效图RAG层次结构

Jakir Hossain, Ahmet Erdem Sarıyüce

机构 * University at Buffalo(布法罗大学)

AI总结 针对图RAG中Leiden聚类不可复现的问题,提出用k-core分解替代,构建确定性、密度感知的层次结构,并设计轻量级启发式方法,在保证连接性的同时降低LLM成本,提升答案全面性和多样性。

Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08873 2026-06-03 cs.IR cs.AI cs.CY cs.SI physics.soc-ph

Whose Name Comes Up? II: Benchmarking and Intervention-Based Auditing of LLM-Based Scholar Recommendation

谁的名字出现?II:基于基准测试和干预审计的LLM学者推荐系统

Lisette Espín-Noboa, Gonzalo Gabriel Méndez

机构 * Complexity Science Hub Vienna(维也纳复杂性科学中心) Universitat Politècnica de València(巴塞罗那理工大学) Inria Rennes(里昂国家信息与自动化研究所)

AI总结 提出LLMScholarBench基准,通过温度变化、表示约束提示和检索增强生成等干预措施审计22个LLM在物理专家推荐中的技术质量和社会代表性,发现干预措施带来不同权衡。

Comments In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26). 30 pages: 11 pages in main (6 figures, 1 table), 19 pages in appendix (22 figures, 2 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12574 2026-06-03 cs.IR

Uncovering Competing Poisoning Attacks in Retrieval-Augmented Generation

揭示检索增强生成中的竞争性投毒攻击

Liuji Chen, Xiaofang Yang, Yuanzhuo Lu, Jinghao Zhang, Xin Sun, Qiang Liu, Shu Wu, Jing Dong, Liang Wang

AI总结 针对检索增强生成系统,研究多个攻击者同时投毒以争夺同一查询目标的问题,提出竞争有效性指标和PoisonArena框架。

Comments Accepted by KDD 2026. Project page: https://poison-arena.github.io/

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02417 2026-06-02 cs.IR

Dynamic Spectral Denoising with Global-Context Attention for Multi-Behavior Recommendation

动态谱去噪与全局上下文注意力在多行为推荐中的应用

Miaomiao Cai, Yunshan Ma, Fangqi Zhu, Junfeng Fang, Zhijie Zhang, Zhiyong Cheng, Xiang Wang, See-Kiong Ng

AI总结 针对多行为推荐中行为依赖噪声和异质性导致的表示级瓶颈,提出动态特征级谱滤波和全局上下文注意力融合的SpectraMB模型,实现表示净化与可靠性感知融合。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02142 2026-06-02 cs.LG cs.DB

TimeBlocks: Foundational and Continual Time-Series Blockbase -- Extended Version

TimeBlocks: 基础与持续时间序列块库——扩展版本

David Campos, Bin Yang, Tung Kieu, Lei Chen, Chenjuan Guo, Christian S. Jensen

机构 * Aalborg University, Denmark(奥尔堡大学,丹麦) University of Amsterdam Netherlands(阿姆斯特丹大学,荷兰) East China Normal University China(华东师范大学,中国) Aalborg University Denmark(奥尔堡大学,丹麦) Hong Kong University of Science(香港科学大学)

AI总结 提出TimeBlocks方法,通过可互换的模块化模型块和路由策略,构建轻量级、多任务的时间序列模型,并引入StreamCore实现持续校准,在多个数据集上优于现有基线。

Comments 15 pages. An extended version of "TimeBlocks: Versatile and Continual Time-Series Blockbase" accepted at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01873 2026-06-02 cs.LG

G2LoRA: Gradient Orthogonal Low-Rank Adaptation Framework for Graph Continual Learning on Text-Attributed Graphs

G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习

Yuhan Wang, Yibo Ding, Yutong Ye, Mufan Zhao, Wenbo Zhang, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01539 2026-06-02 stat.ME cs.LG

Scalable Counterfactual Risk Estimation for Rare Events in Longitudinal Data

纵向数据中罕见事件的可扩展反事实风险估计

Xiaohui Yin, Avijit Mitra, Ying Zhou, Kun Chen, Hong Yu

机构 * University of Connecticut Storrs(康涅狄格大学斯托尔分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

AI总结 针对纵向生存数据中罕见事件导致的类不平衡和计算负担问题,提出一种可扩展的子采样与重加权策略,应用于ICE等因果效应估计器,在保持一致性的同时提高稳定性。

Comments Accepted at KDD-2026, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01352 2026-06-02 cs.AI

FlowTime: Towards Continuous Generative Watch Time Prediction via Flow-based Personalized Priors

FlowTime: 基于流的个性化先验实现连续生成式观看时间预测

Hongxu Ma, Han Zhou, Chenghou Jin, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) Kuaishou Technology(快手科技) Tongji University(同济大学)

AI总结 针对现有观看时间预测方法在范式上的局限性,提出连续生成式回归范式及FlowTime方法,利用一步生成变分自编码器和基于流的个性化先验,有效建模多模态用户-物品交互模式,显著提升预测性能。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01046 2026-06-02 cs.AI

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

TravelEval:评估基于LLM的旅行规划代理的综合基准框架

Weiyi Chen, Shuaixiong Wang, Ziyun Gao, Kaichun Hu, Wangze Ni, Shimin Di, Chen Jason Zhang, Lei Chen

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))

AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。

Comments 31pages, 8 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01022 2026-06-02 cs.CV cs.AI

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01016 2026-06-02 cs.CL cs.AI eess.AS

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

PolySpeech-100:面向100多种语言和方言的大规模语音理解基准

Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) JD AI Research(京东人工智能研究院)

AI总结 为解决现有语音评估基准在资源丰富语言偏向、缺乏语义推理和忽视方言的问题,提出PolySpeech-100基准,通过混合构建管道覆盖110种语言变体,并评估22个模型,发现开源端到端模型在重方言上优于级联系统,而思维链提示在零样本设置下会降低性能。

Comments 19 pages, 13 figures, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00685 2026-06-02 cs.LG

Prior-Guided Multi-Omic Transformers for Single-Cell Gene Regulatory Network Inference

先验引导的多组学Transformer用于单细胞基因调控网络推断

Tianyang Xu, Tianci Liu, Niraj Rayamajhi, Ryan Patrick, Kranthi Varala, Ying Li, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家庭电气与计算机工程学院) Purdue University(普渡大学) Department of Horticulture and Landscape Architecture(园艺与景观建筑系) School of Biological Sciences(生物科学学院)

AI总结 提出EpiAwareNet框架,通过先验引导的多组学Transformer,结合基因-峰值交叉注意力模块和批量数据先验,从配对单细胞数据中重建基因调控网络。

Comments 12 pages, 6 figures. Accepted to the KDD 2026 AI4Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00610 2026-06-02 cs.IR cs.AI cs.MA

MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation

MemGraphRAG:基于记忆的多智能体系统用于图检索增强生成

Chuanjie Wu, Zhishang Xiang, Yunbo Tang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * Xiamen University(厦门大学) Jilin University(吉林大学)

AI总结 提出MemGraphRAG框架,通过基于记忆的多智能体系统构建高质量知识图谱,并设计记忆感知的分层检索算法,在多个基准上超越现有模型。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00563 2026-06-02 cs.LG cs.AI stat.ML

A Practical Upper Bound on Selection Bias Effects in Medical Prediction Models

医学预测模型中选择偏差影响的一个实用上界

Kara Liu, Maggie Wang, Russ B. Altman

机构 * Stanford University(斯坦福大学)

AI总结 针对选择偏差导致模型泛化性差的问题,提出在仅部分观测选择机制和目标分布的现实条件下,对目标群体最差模型性能的一个新上界,并通过合成数据和真实数据验证其有效性和实用性。

Comments 32 pages, 27 figures, will be published at ACM SIGKDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00531 2026-06-02 cs.MA

State Machine Guided Multi-Relational Synthetic Data from Logs for Anomaly Detection

基于日志的状态机引导的多关系合成数据用于异常检测

Aja Khanal, Apurva Narayan

AI总结 提出从日志中恢复执行状态机并诱导多表关系模式,生成保留结构、时间和过程约束的合成数据,以增强异常检测性能。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏