arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

2026-06-11 至 2026-06-11 共收录 5
2606.12215 2026-06-11 cs.CV cs.IR cs.LG 新提交

MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching

MLT-Dedup:通过多级表示和时空匹配的高效大规模在线视频去重

David Yuchen Wang, Haoying Li, Hailun Xu, Wei Chee Yew, Zirui Zhu, Sanjay Saha, Hao Hei, Kanchan Sarkar, Kun Xu

机构 * TikTok Singapore(TikTok新加坡) School of Computing, National University of Singapore(新加坡国立大学计算机学院) TikTok San Jose(TikTok圣何塞)

AI总结 提出MLT-Dedup框架,采用多级视频编码器提取细粒度帧级和稀疏片段级嵌入,结合差分特征增强相似性模块进行时空匹配,在90%精度下降低在线重复率91%,索引容量提升5倍。

Comments Accepted by KDD-2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11831 2026-06-11 cs.LG cs.AI 新提交

From Uniform to Learned Graph Priors: Diffusion for Structure Discovery

从均匀到学习图先验:用于结构发现的扩散

Qi Shao, Hao Guo, Jiawen Chen, Duxin Chen, Wenwu Yu

机构 * School of Mathematics, Southeast University(东南大学数学学院)

AI总结 提出Diff-prior,一种扩散参数化的自适应先验,通过可学习的去噪式校准对边后验进行结构化校准,提升神经关系推理方法的结构发现可靠性。

Comments 15 pages, 3 figures, Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11268 2026-06-11 cs.LG 新提交

LakeFM: Toward a Foundation Model for Aquatic Ecosystems Using Irregular Multivariate Multi-depth Time Series Data

LakeFM:基于不规则多变量多深度时间序列数据的水生生态系统基础模型

Abhilash Neog, Sepideh Fatemi, Medha Sawhney, Kazi Sajeed Mehrab, Aanish Pradhan, Bennett J. McAfee, Emma Marchisin, Arka Daw, Robert Ladwig, Cayelan C. Carey, Paul Hanson, Anuj Karpatne

机构 * Virginia Tech(弗吉尼亚理工大学) Grand Valley State University(大峡谷州立大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊AGI) Aarhus University(奥胡斯大学)

AI总结 针对湖泊时间序列数据不规则采样和跨湖泊泛化难题,提出预训练基础模型LakeFM,在模拟和观测数据上学习表征,实现优于现有模型的预测性能。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11235 2026-06-11 cs.LG cs.DB stat.ME 新提交

Few-Shot Resampling for Scalable Statistically-Sound Data Mining

少样本重采样:可扩展的统计可靠数据挖掘

Leonardo Pellegrina, Fabio Vandin

机构 * Department of Information Engineering, University of Padova(帕多瓦大学信息工程系)

AI总结 提出FewRS方法,基于重采样评估数据挖掘结果的统计显著性,通过推导新的上界偏差界,仅需极少量重采样数据集即可保证假发现概率,显著提升可扩展性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11719 2026-06-11 cs.IR 版本更新

Uncertainty-aware Generative Recommendation

不确定性感知的生成式推荐

Chenxiao Fan, Chongming Gao, Yaxin Gong, Haoyan Liu, Fuli Feng, Xiangnan He

AI总结 提出不确定性感知生成式推荐框架UGR,通过不确定性加权奖励、难度感知优化和显式置信度对齐,解决生成式推荐中忽视模型置信度导致的训练不稳定和决策风险问题。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏