arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

共收录 143
2606.14511 2026-06-15 cs.DB 新提交

Evaluating and Generating Query Workloads for High Dimensional Vector Similarity Search

评估和生成高维向量相似性搜索的查询工作负载

Matteo Ceccarello, Alexandra Levchenko, Ioana Ileana, Themis Palpanas

AI总结 本文评估了多种查询硬度度量,并提出HephAnn和HephGrad两种方法,用于生成符合用户指定硬度目标的查询工作负载,以深入分析相似性搜索算法的行为。

Comments This paper appeared in the proceedings of KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13513 2026-06-12 cs.AI 新提交

CloudCons: A Comprehensive End-to-End Benchmark for Cloud Resource Consolidation

CloudCons:云资源整合的全面端到端基准测试

Xiaobin Zhang, Lefei Shen, Mouxiang Chen, Zhuo Li, Hongkai Li, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao Liu

机构 * Zhejiang University(浙江大学) State Street Technology (Zhejiang) Ltd.(道富科技(浙江)有限公司) Richoo AI Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Datadog AI Research

AI总结 提出CloudCons基准,评估云资源整合中预测模型的决策效用,发现基础模型零样本预测准确但决策效用未必更优,并分析预测分位数选择对资源效率与可靠性的权衡。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12991 2026-06-12 cs.AI 新提交

APCyc: Property-Informed Design of Cyclic Peptides via Automated Cyclization

APCyc:通过自动环化实现环肽的性质导向设计

Yifan Zhao, Lang Qin, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AI-Peptide Drug Design Joint Laboratory(AI-多肽药物设计联合实验室)

AI总结 提出APCyc框架,通过扩展残基词汇和显式编码环化位点与连接类型,结合贝叶斯后验引导,实现目标感知的环肽从头设计并联合优化多种理化性质。

Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12494 2026-06-12 cs.LG 新提交

Net-Ev$^2$: A Generative Simulator for Network Event Evolution

Net-Ev$^2$:网络事件演化的生成式模拟器

Guangyu Wang, Zhaonan Wang

机构 * NYU Shanghai(上海纽约大学)

AI总结 提出Net-Ev$^2$,一种结合事件线索与网络拓扑的生成式模拟器,通过结构引导掩码预训练和拓扑感知扩散过程模拟网络事件演化,在多个道路网络数据集上达到最优性能。

Comments Accepted by KDD 2026 Research Track

Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10678 2026-06-12 cs.LG 新提交

One Step Closer to Ground Truth: A Multi-Scale Residual-Aware Representation Learning Pipeline for Predicting Time Series Data

更接近真实:一种多尺度残差感知表示学习管道用于时间序列预测

Amrijit Biswas, Mustafa Kamal, Robin Krambroeckers, M. M. Lutfe Elahi, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * RobotBulls Labs(RobotBulls实验室) North South University(南北大学)

AI总结 提出两阶段模型无关框架,通过显式解耦预测与残差学习,使用元校正器动态建模结构误差模式,提升Transformer预测精度。

Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09171 2026-06-12 cs.HC 新提交

sketch-plot: Progressive Editing for Text-to-Image Academic Figures

sketch-plot:文本到图像学术图形的渐进式编辑

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Wei Chen

AI总结 提出sketch-plot系统,通过三层渐进式编辑流水线(PNG、可编辑拼图、SVG)实现文本生成学术图形的精确编辑,用户按需选择编辑层级,避免全局重绘。

Comments 6 pages, 3 figures. Submitted to the KDD 2026 Workshop on AI Data Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12215 2026-06-11 cs.CV cs.IR cs.LG 新提交

MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching

MLT-Dedup:通过多级表示和时空匹配的高效大规模在线视频去重

David Yuchen Wang, Haoying Li, Hailun Xu, Wei Chee Yew, Zirui Zhu, Sanjay Saha, Hao Hei, Kanchan Sarkar, Kun Xu

机构 * TikTok Singapore(TikTok新加坡) School of Computing, National University of Singapore(新加坡国立大学计算机学院) TikTok San Jose(TikTok圣何塞)

AI总结 提出MLT-Dedup框架,采用多级视频编码器提取细粒度帧级和稀疏片段级嵌入,结合差分特征增强相似性模块进行时空匹配,在90%精度下降低在线重复率91%,索引容量提升5倍。

Comments Accepted by KDD-2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11831 2026-06-11 cs.LG cs.AI 新提交

From Uniform to Learned Graph Priors: Diffusion for Structure Discovery

从均匀到学习图先验:用于结构发现的扩散

Qi Shao, Hao Guo, Jiawen Chen, Duxin Chen, Wenwu Yu

机构 * School of Mathematics, Southeast University(东南大学数学学院)

AI总结 提出Diff-prior,一种扩散参数化的自适应先验,通过可学习的去噪式校准对边后验进行结构化校准,提升神经关系推理方法的结构发现可靠性。

Comments 15 pages, 3 figures, Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11268 2026-06-11 cs.LG 新提交

LakeFM: Toward a Foundation Model for Aquatic Ecosystems Using Irregular Multivariate Multi-depth Time Series Data

LakeFM:基于不规则多变量多深度时间序列数据的水生生态系统基础模型

Abhilash Neog, Sepideh Fatemi, Medha Sawhney, Kazi Sajeed Mehrab, Aanish Pradhan, Bennett J. McAfee, Emma Marchisin, Arka Daw, Robert Ladwig, Cayelan C. Carey, Paul Hanson, Anuj Karpatne

机构 * Virginia Tech(弗吉尼亚理工大学) Grand Valley State University(大峡谷州立大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊AGI) Aarhus University(奥胡斯大学)

AI总结 针对湖泊时间序列数据不规则采样和跨湖泊泛化难题,提出预训练基础模型LakeFM,在模拟和观测数据上学习表征,实现优于现有模型的预测性能。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11235 2026-06-11 cs.LG cs.DB stat.ME 新提交

Few-Shot Resampling for Scalable Statistically-Sound Data Mining

少样本重采样:可扩展的统计可靠数据挖掘

Leonardo Pellegrina, Fabio Vandin

机构 * Department of Information Engineering, University of Padova(帕多瓦大学信息工程系)

AI总结 提出FewRS方法,基于重采样评估数据挖掘结果的统计显著性,通过推导新的上界偏差界,仅需极少量重采样数据集即可保证假发现概率,显著提升可扩展性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10357 2026-06-10 cs.IR cs.AI 新提交

Atomic Intent Reasoning: Bringing LLM Semantics to Industrial Cross-Domain Recommendations

原子意图推理:将LLM语义引入工业跨域推荐

Zhuohang Jiang, Yuxin Chen, Shijie Wang, Haohao Qu, Zhou Jindong, Wenqi Fan, Li Qing, Dongxu Liang, Jun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Kuaishou Technology(快手科技)

AI总结 提出AIR框架,通过离线LLM推理与在线高效检索组合,实现工业级跨域推荐,在快手电商中GMV提升3.446%。

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09909 2026-06-10 cs.CR cs.AI cs.CV 新提交

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

通过两阶段潜在特征优化绕过基于扩散的定制中的版权保护

Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

AI总结 提出两阶段潜在特征优化(TS-LFO)攻击方法,通过潜在去噪和重建阶段恢复被防御破坏的映射,有效绕过扩散模型定制中的版权保护。

Comments accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09896 2026-06-10 cs.GT cs.AI cs.LG 新提交

HMAF: A Hierarchical Multi-Slot GD-RTB Allocation Framework

HMAF:一种分层多槽GD-RTB分配框架

Tianxing Bu, Zhaoqi Zhang, Linyou Cai, Miao Xie, Shengri Xue, Tan Qu, Qianlong Xie, Xingxing Wang, Siqiang Luo, Gao Cong

机构 * Meituan(美团) Nanyang Technological University(南洋理工大学) China Agricultural University(中国农业大学)

AI总结 针对GD与RTB共存广告平台中短期收益与长期交付的平衡难题,提出分层多槽分配框架HMAF,采用计划-校准-执行范式,集成离线约束优化与在线决策,在美团实现GD交付率提升3.72%、广告总收入提升1.59%。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09293 2026-06-09 cs.CL 新提交

One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems

一个模型,多个目标:面向电商对话系统的自适应多目标学习

Mingzhe Li, Jing Xiang, Enguo Zhou, Lang Gao, Tai Li, Qishen Zhang, Xiangliang Zhang, Xiuying Chen

机构 * ByteDance(字节跳动) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Notre Dame(圣母大学)

AI总结 提出自适应多目标强化学习框架MORE,通过将推理功能作为约束指导策略优化,并引入自适应多奖励机制平衡语言目标,在电商对话系统中同时提升推理准确性和语言自然性,在线实验转化率提升30.09%。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08853 2026-06-09 econ.EM stat.ME 新提交

AI-Assisted Variance Reduction in Randomized Experiments

AI辅助的随机实验方差缩减

David Arbour, Eli Ben-Michael, Avi Feller, Apoorva Lal, Lo-Hua Yuan

AI总结 提出将AI预测作为协变量纳入标准回归调整,以降低随机实验方差,具有“无害”特性,并通过模拟和三个实证应用验证了效率提升。

Comments camera ready for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08617 2026-06-09 cs.CL 新提交

Cross-Source Reasoning-based Correction for Author Name Disambiguation

基于跨源推理的作者姓名消歧校正

Fanjin Zhang, Yunhe Pang, Bo Chen, Zhiyu Shen, Yanghui Rao, Evgeny Kharlamov, Jie Tang

机构 * Renmin University of China(中国人民大学) Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oslo(奥斯陆大学)

AI总结 提出CrossND框架,通过跨源不一致分配推理,结合数据精炼、监督微调和测试时缩放,无需人工干预即可校正作者姓名消歧错误。

Comments Accepted at KDD 2026 ADS track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08497 2026-06-09 cs.AI cs.CL 新提交

Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets

解释黑盒语言模型:学习优化语言结构化的单词子集

Minyoung Hwang, Seokhyun Lee, Changhee Lee

机构 * Korea University(高丽大学)

AI总结 针对黑盒语言模型解释的三个关键需求(推理效率、黑盒兼容性、语言结构可解释性),提出一种通过强化学习选择信息性单词子集的方法,实现高效、无梯度且语言连贯的解释。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08147 2026-06-09 q-bio.GN cs.LG 新提交

Biological Reasoning-Informed Regression for Interpretable Regulatory DNA Activity Prediction

面向可解释调控DNA活性预测的生物学推理引导回归

Yi Duan, Zhao Yang, Jiwei Zhu, Ying Ba, Chuan Cao, Bing Su

机构 * Gaoling School of Artificial Intelligence(甘岭人工智能学院) Renmin University of China(中国人民大学) Zhongguancun Academy(中关村学院)

AI总结 提出R3LM框架,通过结构化生物学知识教LLM进行推理引导回归,在增强子预测上达到最优性能并提供可解释机制。

Comments Accepted at KDD 2026 AI4Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07789 2026-06-09 cs.LG stat.ML 新提交

A Framework for Evaluating and Benchmarking Concept Drift Detection Methods

概念漂移检测方法的评估与基准测试框架

Vitor Cerqueira, Heitor Murilo Gomes, Marco Heyden, Bernhard Pfahringer, Albert Bifet

机构 * University of Coimbra(科英布拉大学) Victoria University of Wellington(惠灵顿维多利亚大学) Commerzbank(德国商业银行) University of Waikato(怀卡托大学) AI Institute, University of Waikato(怀卡托大学人工智能研究所)

AI总结 提出一个包含漂移模拟、时序感知评估和超参数优化协议的基准测试框架,在7个真实数据集上评估14种漂移检测方法,揭示其优劣并建立基线性能。

Comments Accepted in KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07599 2026-06-09 cs.LG cs.AI cs.CV 新提交

DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression

DiffoR:一种统一的连续生成框架用于通用序数回归

Hongxu Ma, Lin Wang, Chenghou Jin, Han Zhou, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

机构 * Fudan University(复旦大学) Kuaishou Technology(快手科技) Shanghai University of Finance and Economics(上海财经大学) Tongji University(同济大学)

AI总结 提出DiffOR框架,将序数回归建模为连续生成任务,利用扩散模型通过迭代去噪恢复连续序数值,并设计双解耦策略(多尺度增量聚合与动态去噪感知)保留序数拓扑,在12个基准上超越现有方法。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07567 2026-06-09 q-bio.BM cs.AI cs.CE 新提交

SurfDesign: Effective Protein Design on Molecular Surfaces

SurfDesign:基于分子表面的高效蛋白质设计

Fang Wu, Shuting Jin, Xiangru Tang, Mark Gerstein, Xiangxiang Zeng, Yejin Choi, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) Wuhan University of Science and Technology(武汉科技大学) Yale University(耶鲁大学) School of Medicine, Yale University(耶鲁大学医学院) Hunan University(湖南大学) Yuelushan Laboratory(岳麓实验室) Kumo.AI Toyota Technological Institute at Chicago(芝加哥技术研究所)

AI总结 提出SurfDesign框架,将分子表面建模为连续几何流形并整合预训练蛋白质语言模型,通过表面等变消息传递捕捉几何特征,在从头设计结合子和酶设计基准上优于现有方法。

Journal ref KDD 2026 AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07492 2026-06-08 cs.IR cs.LG stat.ML 新提交

Bradley-Terry Rankings for Recommender Systems Across Dataset Taxonomies

基于数据集分类学的推荐系统Bradley-Terry排名

Ekaterina Grishina, Stepan Kuznetsov, Askar Tsyganov, Ilya Ivanov, Daria Korovaitceva, Margarita Rusanova, Uliana Parkina, Alexander Derevyagin, Evgeny Frolov, Sergey Samsonov, Anton Lysenko

机构 * HSE University(俄罗斯莫斯科国立高等经济学院)

AI总结 针对推荐算法排名对数据集特性敏感的问题,提出基于Bradley-Terry模型的数据驱动排名方法,并引入排名一致性指标和针对未见数据集的算法排名方法。

Comments KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏