LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation
LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估
AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。
Comments Accepted by KDD 2026
期刊&会议
ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining
LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估
AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。
Comments Accepted by KDD 2026
SelPE:面向私有结构化文本合成的渐进式选择方法
AI总结 提出SelPE框架,通过渐进式多批次top-1选择机制,在严格差分隐私预算下实现小样本私有结构化文本的高效合成,解耦语义抽象与模式实现,提升结构有效性、保真度和下游效用。
Comments Accepted at KDD 2026
门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降
AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。
Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素
机构 * Independent Researcher(独立研究者) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。
Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。
Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea
超越时间序列:基于多模态学习的空间推理用于流行病预测
机构 * University of Michigan(密歇根大学)
AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。
Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track
规模化的陷阱:揭示并缓解基于Transformer的推荐系统中的流行度偏差放大
机构 * Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 发现扩大Transformer推荐模型规模会放大流行度偏差,通过理论和实证分析揭示注意力聚合和前馈投影导致谱坍缩是根本原因,提出SPRINT正则化方法缓解该问题,在0.05M至0.34B参数规模上实现更优的扩展行为。
Comments Accepted by KDD 2026
TF-SNO:用于学习非平稳偏微分方程的时频门控谱神经算子
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 针对非平稳PDE中频谱随时间漂移的问题,提出TF-SNO,通过可学习的时频门控机制使谱响应随状态演化,在不引入显式时间维度下隐式学习时间变化,提升长期预测稳定性。
Comments Accepted by KDD 2026
MammoExpert:乳腺X线诊断中的思维链推理基准测试
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Yizhun co. ltd(医准有限公司) ; International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) ; School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) ; Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) ; Peking University(北京大学)
AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。
Comments KDD 2026
SciLens: 多模态科学声明验证的智能蕴含与归因框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong Baptist University(香港浸会大学) ; NVIDIA AI Technology Center(英伟达人工智能技术中心)
AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。
Comments KDD 2026 SciSoc Agents & LLMs (Oral)
FairTutor: 预算受限AI辅导中的公平感知教学LLM路由
机构 * Independent researcher, Shanghai, China(独立研究者,上海,中国)
AI总结 提出FairTutor框架,通过教学驱动的多智能体编排实现成本效益AI辅导,在降低71.6%服务成本的同时达到97.1%的优质教学质量,并引入AIED优势差距指标衡量公平性。
Comments AI for Education Day at SIGKDD 2026, 14 pages, 2 figures
LLM即代码:面向Agent框架的编程范式
机构 * City University of Hong Kong(香港城市大学) ; Tencent Jarvis Lab(腾讯贾维斯实验室)
AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。
Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)