Contextual Slate GLM Bandits with Limited Adaptivity
有限自适应性下的上下文式板GLM赌博机
机构 * Microsoft Research India(微软研究院印度)
AI总结 针对有限自适应性的上下文式板赌博机问题,提出两种算法B-SlateGLinCB和RS-SlateGLinCB,分别适用于批处理和少切换设置,在多样性假设下实现与非线性参数无关的遗憾界,并具有计算效率。
Comments Accepted at ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
有限自适应性下的上下文式板GLM赌博机
机构 * Microsoft Research India(微软研究院印度)
AI总结 针对有限自适应性的上下文式板赌博机问题,提出两种算法B-SlateGLinCB和RS-SlateGLinCB,分别适用于批处理和少切换设置,在多样性假设下实现与非线性参数无关的遗憾界,并具有计算效率。
Comments Accepted at ICML 2026
破解生成困惑度:为何无条件文本评估需要分布度量
机构 * AITHYRA Institute(AITHYRA研究所)
AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。
Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea
基于梯度信息逻辑校正的离散扩散模型即插即用引导
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出GILC框架,通过将预训练去噪网络作为变分代理来估计引导信号,并引入无雅可比机制直接校正干净预测逻辑,实现无需额外训练的离散扩散模型可控生成,在DNA、蛋白质序列和分子生成任务上达到最优性能。
Comments Accepted by ICML 2026
DisjunctiveNet: 通过可微凸优化层实现的神经符号学习
机构 * Davidson School of Chemical Engineering, Purdue University, West Lafayette, USA(帕克大学化学工程大卫逊学校)
AI总结 针对数据稀疏且富含领域知识的场景,提出DisjunctiveNet框架,通过可微凸优化层将析取约束嵌入神经网络,实现硬约束满足与强预测性能。
Comments ICML 2026
多层级策略分类:通过晋升与降级动态激励改进
机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)
AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。
Comments 9 pages, 4 figures, ICML 2026
轻量强制:通过稀疏注意力加速自回归视频扩散
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)
AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。
Comments ICML 2026
TEAM: 时空一致性引导的专家激活用于MoE扩散语言模型加速
机构 * Institute for Artificial Intelligence(人工智能研究院) ; School of Integrated Circuits(集成电路学院) ; Yuanpei College(元培学院) ; Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)
AI总结 针对MoE扩散语言模型中专家激活过多导致推理开销大的问题,提出TEAM框架,利用路由决策的时空一致性,通过保守激活和激进推测解码实现加速,最高提速2.2倍且性能损失极小。
Comments Accepted by ICML 2026
随机优势变换(RAT):通过直接反向传播计算自然策略梯度
机构 * The University of Manchester, United Kingdom(曼彻斯特大学,英国)
AI总结 本文提出RAT方法,通过直接反向传播估计正则化自然策略梯度,解决了传统方法中估计和求逆Fisher矩阵成本高的问题,实验证明其在连续和视觉控制基准上性能优异且易于实现。
Comments Accepted to ICML 2026
基于边际的置信度排名用于可靠的LLM判断
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
AI总结 本文提出一种基于边际的置信度排名方法,通过学习专用置信度估计器,改进LLM在人类判断一致性上的表现,通过模拟标注者多样性与边际排名公式,显式建模LLM区分人类一致与不一致案例的置信度,并推导出通用性保证。
Comments Accepted to ICML 2026
OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。
Comments Accepted to ICML 2026
注意力汇点作为大语言模型幻觉检测的内部信号
机构 * Department of Artificial Intelligence, Wroclaw University of Science and Technology(弗罗茨瓦夫科技大学人工智能系)
AI总结 本文提出SinkProbe方法,通过分析注意力汇点揭示幻觉检测机制,基于理论提出新的检测方法,在多个数据集和LLM上取得最佳性能。
Comments Accepted at ICML 2026
无约束线性赌博机的一种扰动方法
机构 * Inria, Univ. Grenoble Alpes, Grenoble INP, CNRS, LIG, 38000 Grenoble, France(法国国家信息与自动化研究所、格勒诺布尔阿尔卑斯大学、格勒诺布尔INP、国家科学研究中心、格勒诺布尔理工大学) ; The University of Tokyo(东京大学)
AI总结 本文提出一种基于扰动的框架,将无约束线性赌博机问题简化为标准在线线性优化问题,并实现了静态和动态遗憾的最优高概率保证。
Comments 50 pages; v2: ICML 2026; v3: fixed document outine + typos
LLM API中的令牌高效变化检测
机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) ; Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) ; LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) ; Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)
AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。
Comments ICML 2026
用于语言模型预训练的课程引导层缩放
机构 * Stanford University(斯坦福大学)
AI总结 受人类认知发展启发,提出课程引导层缩放框架,通过渐进式层堆叠使数据难度与模型增长同步,在不同参数规模预训练并分层数据,提升模型泛化及零样本性能。
Comments Accepted to ICML 2026. Code available at https://github.com/su-karanps/cgls
将连续属性的公平零空间投影扩展到核方法
机构 * Felix Störck ; Fabian Hinder ; Barbara Hammer
AI总结 提出将公平零空间投影扩展到核诱导特征空间,通过经验特征空间直接变换核矩阵,实现模型和公平评分无关的连续属性公平性方法,并在支持向量回归中展示竞争性或改进性能。
Comments Accepted to ICML 2026 (v3: typo corrected in appendix A.2)
WorldMirror:基于任意先验提示的通用三维世界重建
机构 * Zhejiang University(浙江大学) ; Chinese University of Hong Kong(香港中文大学) ; Tencent Hunyuan(腾讯混元)
AI总结 本研究提出WorldMirror这一统一前馈模型,可整合多种几何先验并生成多种三维表示,在多类三维几何任务的基准测试中达到最优性能且推理效率高。
Comments Accepted to ICML 2026. Code: https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirror Project page: https://3d-models.hunyuan.tencent.com/world/