arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

至 收录 143
2607.04557 2026-07-07 cs.LG cs.AI q-bio.QM 新提交

Predicting Therapeutic Outcome via Aligning Patient-Specific Knowledge Graph and Gene-Level Perturbation Representations

通过对齐患者特异性知识图谱和基因水平扰动表示来预测治疗结果

Dongmin Bang, Sugyun An, Inyoung Sung, Ilho Yun, Sun Kim, Sangseon Lee

机构 * Interdisciplinary Program in Bioinformatics, Seoul National University(首尔国立大学生物信息学跨学科项目) AIGENDRUG Co., Ltd.(爱真药物有限公司) BK21 FOUR Intelligence Computing, Seoul National University(首尔国立大学BK21四号智能计算) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, Inha University(仁荷大学人工智能系)

AI总结 针对临床响应标签和治疗后分子图谱稀缺阻碍治疗反应预测的问题,提出PREDIKTOR框架,结合个性化网络视图与可转移转录组扰动视图预测临床药物反应,提升性能并支持精准肿瘤学。

Comments 12 pages, 5 figures, 5 tables. Accepted at BIOKDD 2026, held in conjunction with ACM SIGKDD 2026

URL PDF HTML 收藏
2607.02945 2026-07-07 cs.PF 新提交

Optimus: A Generic Operator-Level PyTorch Model Transformation Framework

Optimus:一个通用的算子级PyTorch模型转换框架

Menglu Yu, Jiaqi Xu, Yuzhen Huang, Yanbo Liang, Jia Liu, Shuai Yang, Jason Ansel, Elias Ellison, Edward Yang, Brian Hirsh, Jia Chen Ren, Will Feng, Oguz Ulgen, Xu Zhao, Daohang Shi, Huaqing Xiong, Quanyu Zhu, Mingming Ding, Junqing Zhou, Ruilin Chen, Yuhang Yang, Chi-Keung Luk

AI总结 针对大规模工业应用中深度学习模型架构复杂多样、人工优化不可行的问题,介绍基于PyTorch 2.x的通用模型转换框架Optimus,用预定义模式和贪心搜索算法,可提升模型性能。

Journal ref In Proceedings of the 2026 ACM SIGKDD Conference on Knowledge Discovery and Data Mining

URL PDF HTML 收藏
2607.02928 2026-07-07 cs.LG 新提交

CoFEND: A Cross-Modal Fusion End-to-End Network for Cold-Start Drug-Drug Interaction Prediction

CoFEND:用于冷启动药物-药物相互作用预测的跨模态融合端到端网络

Di Wu, Hongyi Sun, Haichao Xu, Jia Chen, Zhong Chen, Jie Yang

机构 * College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) Beihang University(北京航空航天大学) School of Computing, Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校计算机学院) School of Physics and Electronic Science, Zunyi Normal University(遵义师范学院物理与电子科学学院)

AI总结 针对新药冷启动药物-药物相互作用预测难题,提出CMF-ELN。利用多模态信息构建知识图谱,设计图自动编码器融合跨模态相似性,采用两阶段可解释性方案,提升预测准确性与机制解释性。

Comments 11 pages, 2 figures, accepted by KDD 2026

URL PDF HTML 收藏
2607.02703 2026-07-07 cs.SE cs.AI cs.DC cs.MA 新提交

LLMoxie: Exploring Agentic AI for Scientific Software Development

LLMoxie:探索用于科学软件开发的智能AI

Landung Setiawan, Anant Mittal, Cordero Core, Anshul Tambay, Carlos Garcia Jurado Suarez, David A. C. Beck, Andrew J. Connolly, Vani Mandava

机构 * eScience Institute University of Washington(eScience研究院华盛顿大学)

AI总结 研究针对科学软件开发中现有AI编码代理的不足,介绍LLMoxie平台及其插件生态系统,通过实践总结多域研究软件工程师中心采用智能AI的挑战、平台设计及操作经验,提升AI编码代理能力。

Comments 9 pages, 4 figures. Accepted to ACM SIGKDD 2026 Workshop: Agentic AI for Scientific and Societal Advances (SciSoc Agents and LLMs). Describes an agentic AI platform for scientific software engineering with governed multi-cloud inference, structured multiagent workflows, and domain-aware coding support (cs.SE, cs.MA, cs.AI)

URL PDF HTML 收藏
2607.02115 2026-07-03 cs.IR 新提交

Planning over Matrix-Factorization MDPs for Candidate Generation

基于矩阵分解MDP的候选生成规划

Mikhail Trapeznikov, Maksim Utushkin

AI总结 将推荐系统的用户旅程建模为MDP,通过折叠更新用户状态进行规划,实验表明单步前瞻即可显著提升固定嵌入下的检索效果。

Comments Accepted to the 5th Workshop on End-to-End Customer Journey Optimization at KDD 2026. 6 pages, 3 figures, 2 tables

URL PDF HTML 收藏
2607.01773 2026-07-03 cs.AI 新提交

Verifiable Knowledge Expansion through Retrieval-Grounded Formal Concept Analysis

通过检索基础的形式概念分析实现可验证的知识扩展

Yujin Yang, Heejung Lee

机构 * Hanyang University(汉阳大学)

AI总结 提出一种检索增强的小语言模型框架,利用形式概念分析作为符号验证循环,通过种子属性和检索验证实现知识扩展,在罕见共济失调数据集上评估了关系F1和蕴含F1。

Comments 8 pages, 2 figures, Accepted to the 8th epiDAMIK ACM SIGKDD International Workshop on Epidemiology meets Data Mining and Knowledge Discovery (epiDAMIK 2026)

URL PDF HTML 收藏
2607.01485 2026-07-03 cs.IR 新提交

CoPersona: Collaborative Persona Graphs for Robust LLM Personalization

CoPersona: 面向鲁棒LLM个性化的协作人格图

Yangtian Zhang, Leyao Wang, Hiren Madhu, Ngoc Bui, Walter Roznyatovskiy, Rex Ying

AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。

Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables

URL PDF HTML 收藏
2607.00958 2026-07-02 cs.LG 新提交

LeNEPA: No-Augmentation Next-Latent Prediction for Time-Series Representation Learning

LeNEPA:无增强的下一潜在预测用于时间序列表示学习

Alexander Chemeris, Ming Jin, Randall Balestriero

机构 * Langotime South Africa(Langotime南非) Griffith University Australia(澳大利亚格里菲斯大学) Brown University United States(美国布朗大学)

AI总结 提出LeNEPA,一种无需数据增强的下一潜在预测架构,通过SIGReg正则化和轻量投影空间,在固定配方测试中跨数据集保持性能,优于ECG调优的JEPA。

Comments 9 pages, 4 figures, 6 tables; accepted by the 12th Mining and Learning from Time Series (KDD MILETS 2026); source code and artifacts: https://github.com/langotime/lenepa-milets-2026

URL PDF HTML 收藏
2607.00956 2026-07-02 cs.LG cs.AI 新提交

Aionoscope: Debugging Latent-State Accessibility in Time-Series Representations

Aionoscope:时间序列表示中潜在状态可访问性的调试

Alexander Chemeris, Ming Jin, Randall Balestriero

机构 * Langotime South Africa(Langotime 南非) Griffith University(格里菲斯大学) Brown University(布朗大学)

AI总结 提出Aionoscope,一种基于生成器的诊断工具,用于调试冻结时间序列表示中的潜在状态可访问性,揭示粗粒度和细粒度可访问性之间的不匹配。

Comments 9 pages, 4 figures. Accepted by the 12th Mining and Learning from Time Series (KDD MILETS 2026). Interactive results: https://aionoscope.langotime.ai/ . Source artifacts: https://github.com/langotime/aionoscope/ and https://github.com/langotime/aionoscope-benchmarks/

URL PDF HTML 收藏
2607.00280 2026-07-02 cs.LG cs.CY econ.EM stat.AP 新提交

Understanding Guest Preferences and Optimizing Two-sided Marketplaces: Airbnb as an Example

理解客人偏好与优化双边市场:以Airbnb为例

Yufei Wu, Daniel Schmierer

机构 * Airbnb, Inc.(Airbnb公司)

AI总结 结合经济建模与因果推断,分析客人对价格等因素的响应及偏好异质性,以优化定价工具和个性化推荐,提升市场匹配效率。

Comments 5 pages, 3 figures. Presented at the KDD 2024 Workshop on Two-Sided Marketplace Optimization, Barcelona, Spain

URL PDF HTML 收藏
2607.00398 2026-07-02 cond-mat.str-el cs.AI cs.ET 新提交

Holographic Quantum Transformer: A Generalist Neuro-Symbolic Architecture for Solving Frustrated Systems via Generative Attention

全息量子变换器:一种通过生成式注意力解决受挫系统的通用神经符号架构

Xingran Guo, Tiaojie Xiao, Jie Liu, Keqin Li

机构 * National University of Defense Technology(国防科技大学) State University of New York at New Paltz(纽约州立大学新帕尔茨分校)

AI总结 提出全息量子变换器(HQT),利用全局自注意力解决非局域纠缠模式,在受挫J1-J2海森堡模型上达到高精度,并实现零样本尺寸外推协议。

Comments 10 pages, accepted to KDD '26

Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

URL PDF HTML 收藏
2606.30992 2026-07-01 stat.ME cs.LG stat.AP 新提交

Hierarchical Clustering As a Novel Solution to the Notorious Multicollinearity Problem in Observational Causal Inference

层次聚类作为观测因果推断中多重共线性问题的新解决方案

Yufei Wu, Zhiying Gu, Alex Deng, Jacob Zhu, Linsha Chen

机构 * Airbnb, Inc.(Airbnb公司)

AI总结 针对观测因果推断中多重共线性导致无法分离变量影响的问题,提出基于层次聚类聚合数据以缓解共线性的方法,并通过营销应用验证其有效性。

Comments Presented at the KDD 2023 Workshop on Causal Inference and Machine Learning in Practice, Long Beach, CA; also presented at the 2023 Joint Statistical Meetings

URL PDF HTML 收藏
2606.30664 2026-07-01 stat.AP cs.AI cs.LG 新提交

Estimating the Effect of Timing on Coupon Effectiveness

估计时机对优惠券有效性的影响

Deddy Jobson

机构 * Mercari, Inc.(Mercari公司)

AI总结 提出一个因果推断框架,利用自然随机对照试验估计在关键时机发送优惠券的效果,无需专用AB测试,并通过案例和公开数据集验证其有效性。

Comments 12 pages, 5 figures. Published in Proceedings of the 1st Workshop on End-End Customer Journey Optimization, co-located with KDD 2022, August 15, 2022, Washington, DC

URL PDF HTML 收藏
2606.30999 2026-07-01 cs.LG econ.EM stat.AP stat.ME 新提交

Estimating Supply Incrementality in Two-sided Marketplaces: A Causal Machine Learning Approach

双边市场中供给增量的估计:一种因果机器学习方法

Yufei Wu, Daniel Schmierer, Dan Zylberglejd

机构 * Airbnb, Inc.(爱彼迎公司)

AI总结 本文提出一种结合双重/去偏机器学习与层次贝叶斯框架的因果方法,利用地理空间相似性度量估计双边市场中新增供给对交易量的影响,并在Airbnb数据上验证了其合理性和强样本外性能。

Comments 5 pages, 3 figures. Accepted at the KDD 2025 Workshop on Causal Inference and Machine Learning in Practice (not presented)

URL PDF HTML 收藏
2606.30932 2026-07-01 cs.LG stat.AP stat.ME 新提交

Personalizing Marketplace Policies with Competing Objectives and Constrained Experiments: Evidence from a Job Marketplace

具有竞争目标和受限实验的市场政策个性化:来自求职市场的证据

Yufei Wu, Zhen Yan

机构 * LinkedIn Corporation(领英公司)

AI总结 针对双边市场政策个性化中跨方外部性和市场干扰问题,提出集成框架,通过混合排名模型和目标外推方法,在满足约束条件下提升目标指标。

Comments 10 pages, 6 figures. Accepted at ACM SIGKDD 2026 (Applied Data Science Track)

URL PDF HTML 收藏
2606.30840 2026-07-01 cs.AI 新提交

Contrastive Reflection for Iterative Prompt Optimization

对比反思:迭代提示优化

Derek Koh, Jinghui Mo, Benjamin H. Le, Jiening Zhan, Baofen Zheng, Kevin Bevis, Nathaniel C. Owen, Lauren Elizabeth Charney, Wenqiong Liu, Jingwei Wu

机构 * LinkedIn(领英)

AI总结 提出对比反思框架,通过对比失败与成功行为,迭代优化检索增强生成代理的提示,在HotpotQA上准确率从51.4%提升至60.4%。

Comments 6 pages, 1 figure. To appear at Agent4IR @ KDD 2026 (KDD 2026 Workshop on AI Agents for Information Retrieval)

URL PDF HTML 收藏
2606.27997 2026-06-29 cs.LG stat.ML 新提交

Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings

对重要任务的基准测试:用于保持模型排名的数据集选择

Rostislav Gusev, Alexey Zaytsev

机构 * Applied AI Institute Moscow(莫斯科应用人工智能研究所)

AI总结 提出一个框架,通过评估不同选择策略如何保持全局模型排名,从大量数据集中选择代表性子集,并利用自举聚合提供置信区间。在时间序列分类和NLP基准上,简单策略如FAFI优于随机选择;在推荐系统中改进不显著。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

URL PDF HTML 收藏
2606.27688 2026-06-29 cs.LG cs.AI 新提交

Deployment-Side Adaptiveness in Multi-Horizon Volatility Forecasting

多期波动率预测中的部署侧自适应性

Riku Green, Zahraa S. Abdallah, Telmo M Silva Filho

机构 * The University of Bristol(布里斯托大学)

AI总结 研究多期波动率预测中,通过改变推理时的展开规则来提升预测性能,发现验证集选择的部署策略能有效改善MIMO模型性能,且策略选择对评估指标敏感。

Comments Accepted for KDD 2026 Machine Learning in Finance Workshop

URL PDF HTML 收藏
2606.27291 2026-06-26 cs.LG 新提交

Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search

设计便携查询生成的奖励信号:工业语义职位搜索案例研究

Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

AI总结 提出RLAIF框架生成便携职位搜索查询,通过奖励塑造解决策略优化中的奖励黑客问题,实验表明稳健奖励设计比优化器选择更关键。

Comments Accepted to KDD 2026 Workshop on AI Agent for Information Retrieval (Agent4IR)

URL PDF HTML 收藏
2606.26787 2026-06-26 cs.LG cs.AI cs.CL 新提交

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

AIGP:基于LLM的电商定价长期价值对齐框架

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。

Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)

URL PDF HTML 收藏
2606.26458 2026-06-26 cs.AI 新提交

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学) Dalian University of Technology(大连理工大学) Stony Brook University(石溪大学)

AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。

Comments Accepted by KDD'26

URL PDF HTML 收藏
2606.23603 2026-06-26 cs.LG 新提交

MORL-A2C: Multi-Objective Reinforcement Learning Reranker for Optimizing Healthiness in MOPI-HFRS

MORL-A2C:用于优化MOPI-HFRS健康性的多目标强化学习重排序器

Aarya Vasantlal, Joshua Zolla, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学)

AI总结 提出MORL-A2C,将食物推荐建模为K步重排序问题,利用冻结图神经网络嵌入和优势演员-评论家算法,在保持排序质量的同时显著提升健康对齐度。

Comments Accepted at the International Workshop on Resource-Efficient Learning for Knowledge Discovery (RelKD) at ACM SIGKDD 2026

URL PDF HTML 收藏
2606.25456 2026-06-25 cs.LG 新提交

Towards Robust EEG Decoding Based on Riemannian Self-Attention

基于黎曼自注意力的鲁棒脑电解码方法

Shaocheng Jin, Tao Zhou, Rui Wang, Ziheng Chen, Xiaoqing Luo, Xiaojun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Information Engineering and Computer Science(信息工程与计算机科学系) University of Trento(特伦托大学) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音与信号处理中心) University of Surrey(萨里大学)

AI总结 针对脑电解码中信号低信噪比和现有黎曼方法依赖特定度量的局限,提出基于Bures-Wasserstein度量的黎曼自注意力网络及其可推广版本GBWAtt,在三个数据集上验证了鲁棒性和有效性。

Comments Accepted by KDD 2026

URL PDF HTML 收藏
2606.25285 2026-06-25 cs.LG cs.AI 新提交

EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression

EPTS:弹性后训练稀疏性用于高效大型语言模型压缩

Ke Xu, Jiaqi Wan, Wenhao Hu, Han Pu, Xiaoyun Wang

机构 * School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) School of Computer Science and Technology(计算机科学与技术学院) Tiangong University(天工大学)

AI总结 提出弹性后训练稀疏性(EPTS)框架,通过单次优化生成单一弹性模型,支持多种稀疏度配置,解决传统方法需为每个稀疏度单独优化的效率问题。

Comments KDD 2026

URL PDF HTML 收藏
2606.25237 2026-06-25 cs.IR cs.LG 新提交

Extreme Meta-Classification for Large-Scale Zero-Shot Retrieval

大规模零样本检索的极端元分类

Sachin Yadav, Deepak Saini, Anirudh Buvanesh, Bhawna Paliwal, Kunal Dahiya, Siddarth Asokan, Yashoteja Prabhu, Jian Jiao, Manik Varma

机构 * Microsoft Research(微软研究院) Microsoft(微软) Indian Institute of Technology(印度理工学院)

AI总结 提出EMMETT框架和IRENE算法,通过为新颖项即时合成分类器,解决大规模零样本检索中模型容量与泛化能力的矛盾,在Recall@10上提升高达15%,并在实际广告检索中提升点击率4.2%。

Comments Accepted at KDD 2024, 20 pages

Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, ACM, 2024

URL PDF HTML 收藏
2606.17460 2026-06-25 cs.LG cs.NA math.NA physics.comp-ph 新提交

Operator Boosting Produces Pareto-Efficient PDE Surrogates

算子提升产生帕累托高效的PDE代理模型

Lennon J. Shikhman

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院) Department of Mathematics and Systems Engineering, Florida Institute of Technology(佛罗里达理工学院数学与系统工程系)

AI总结 提出算子提升框架,通过残差学习直接构建紧凑神经算子代理,在30个数据集-架构对上平均准确率提升,参数量减少72-95%,并在多个PDE基准上实现帕累托改进。

Comments 11 pages, 3 figures, 3 tables. Submitted to ACM SIGKDD 2027 AI4Sciences Track

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

URL PDF HTML 收藏
2606.24133 2026-06-24 cs.LG cs.CL 新提交

Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning

基于多目标强化学习的LLM预训练整体数据调度器

Chenhao Dang, Jing Ma, Mingjie Liao

机构 * China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

AI总结 提出HDS框架,将数据调度建模为连续控制空间的强化学习问题,利用SAC算法和融合数据质量、跨域影响及模型权重的多目标奖励函数,在The Pile上减少44%训练迭代达到同等困惑度,并在MMLU等任务上提升7.2%。

Comments Our code is at https://github.com/DANG-ai/LLM-Training-Holistic-Data-Schedule

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Vol. 1, pp. 176-187, 2026

URL PDF HTML 收藏
2606.23830 2026-06-24 cs.LG cs.AI 新提交

Deciphering Fingerprints of 3D Molecular Surfaces for Accurate Epitope Prediction

解读3D分子表面指纹以实现准确的表位预测

Fang Wu, Weihao Xuan, Jure Leskovec, Yejin Choi, Li Erran Li

机构 * Stanford University(斯坦福大学) The University of Tokyo(东京大学) Amazon AWS(亚马逊AWS)

AI总结 提出SurfBind框架,直接基于分子表面表示,通过Transformer架构、补丁级表面建模、结合物感知交叉注意力和分层粗到细预测范式,实现表位预测,在SAbDab和DB5.5基准上达到最先进性能。

Journal ref KDD 2026 AI4Science

URL PDF HTML 收藏
2606.22961 2026-06-23 cs.IR 新提交

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估

Yue Que, Junyi Zhou, Xiaokun Zhang, Haiming Jin, Qiao Xiang, Chen Ma

AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。

Comments Accepted by KDD 2026

URL PDF HTML 收藏