Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions
弥合大语言模型在多项选择题中的知识-预测差距
机构 * KAIST(韩国科学技术院)
AI总结 通过分析隐藏表示中的知识子空间和预测子空间,提出轻量级推理时干预方法KAPPA来对齐两者,从而减少LLM在多项选择题上的知识-预测差距。
Comments Accepted to ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
弥合大语言模型在多项选择题中的知识-预测差距
机构 * KAIST(韩国科学技术院)
AI总结 通过分析隐藏表示中的知识子空间和预测子空间,提出轻量级推理时干预方法KAPPA来对齐两者,从而减少LLM在多项选择题上的知识-预测差距。
Comments Accepted to ICML 2026
FOVI:一种受生物启发的深度视觉模型中央凹接口
机构 * harvard(哈佛大学) ; nvidia
AI总结 受人类视觉系统启发,提出基于视网膜和V1的中央凹接口FOVI,通过kNN卷积和低秩适应实现高效变分辨率视觉处理,在减少像素和计算成本的同时保持竞争力。
Comments ICML 2026
前瞻样本奖励引导用于扩散模型的测试时缩放
机构 * KAIST(韩国科学技术院)
AI总结 提出一种高效测试时缩放方法LiDAR采样,通过前瞻几步采样和精确求解器引导粒子向高奖励区域移动,无需反向传播,在GenEval上达到与最新梯度引导方法相同性能且加速9.5倍。
Comments ICML 2026 Spotlight
ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐
机构 * Zhejiang University(浙江大学)
AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。
Comments ICML 2026
从零到英雄:推进表格异常检测的零样本基础模型
机构 * Xueying Ding(丁雪莹) ; Haomin Wen(文浩明) ; Simon Klüttermann(西蒙·克吕特曼) ; Leman Akoglu(拉曼·阿科格卢)
AI总结 提出OUTFORMER模型,通过混合合成先验和自演化课程训练,实现零样本表格异常检测,在AdBench及新基准上达到最优性能。
Comments 41 Pages, ICML 2026
R2-Router: 一种基于推理的LLM路由新范式
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对现有LLM路由忽略输出长度对质量和成本影响的问题,提出R2-Router,通过将输出长度预算作为可控变量联合选择最优LLM和预算,实现低成本高质量路由。
Comments Accepted by ICML 2026
ObjEmbed:迈向通用多模态对象嵌入
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出ObjEmbed模型,通过分解图像为多个区域嵌入(每个对应一个对象)并生成语义和IoU两种互补嵌入,实现细粒度视觉-语言对齐,在视觉定位、局部和全局图像检索等任务中表现优异。
Comments Accepted by ICML 2026
通过Wasserstein和Kalman-Wasserstein KL散度的适定KL正则化控制
机构 * Department of Mathematics, Technical University of Munich \& Munich Center for Machine Learning, Germany. The majority of the work was conducted while at the Institute of Mathematics at the Technical University of Berlin, Germany \& the Berlin Mathematical School. ; Institute for Data Science Foundations, Hamburg University of Technology, Germany ; Santa Fe Institute, USA
AI总结 针对KL散度在支持不匹配和低噪声下失效的问题,提出基于传输几何的KL变体,消除线性时不变系统中的奇异性,实现适定控制并提升闭环性能。
Comments 37 pages, 9 figures, comments welcome. Accepted @ ICML'26
深度时间序列模型的可解释性需要语义对齐
机构 * University of Padua(帕多瓦大学)
AI总结 本文提出深度时间序列模型的可解释性应追求语义对齐,即预测应基于对用户有意义的变量,并受时空机制约束,同时需保持时间演化下的语义一致性,为此提供了形式化定义和模型设计蓝图。
Comments Accepted at ICML 2026
LRAgent: 面向多LoRA LLM代理的高效KV缓存共享
机构 * KAIST(韩国科学技术院)
AI总结 针对多LoRA代理系统中每个代理独立存储相同长轨迹的KV缓存导致内存和计算开销大的问题,提出LRAgent框架,通过将缓存分解为共享基座部分和适配器依赖部分,并利用共享A的多LoRA架构和Flash-LoRA-Attention内核,实现高效共享,在保持精度的同时显著降低开销。
Comments 25 pages, 10 figures, 22 tables
Journal ref ICML 2026 Poster
AblationBench:评估实证AI研究中消融实验的自动规划
机构 * Google Research(谷歌研究)
AI总结 提出AblationBench基准套件,包含作者消融和审稿人消融两个任务,用于评估语言模型在AI研究中规划消融实验的能力,实验表明当前最佳模型仅能识别45%的原始消融,低于人类水平。
Comments AI4Science Workshop, ICML 2026; Project page: https://ablation-bench.github.io/
Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点
机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)
AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。
Comments 29 pages, 14 figures. Accepted at ICML 2026
说服性隐私
AI总结 从贝叶斯博弈论角度提出新隐私度量框架,涵盖差分隐私并扩展至确定性算法。
Comments 24 pages, accepted as regular paper in ICML 2026
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
用秩统计量近似 $f$-散度
机构 * Department of Mathematics, Technical University of Munich \& Munich Center for Machine Learning, Germany. The majority of the work was conducted while at the Institute of Mathematics at the Technical University of Berlin, Germany \& the Berlin Mathematical School. ; Department of Signal Theory
AI总结 提出一种基于秩统计量的 $f$-散度近似方法,通过直接处理秩分布避免显式密度比估计,并证明其单调性、下界性质及收敛速率,同时扩展到高维数据的切片版本。
Comments 40 pages, 16 figures, 6 tables, accepted at ICML'26. Comments welcome!
GUDA: 基于反事实的扩散模型分组训练数据归因方法
机构 * University of Tokyo(东京大学) ; Toyota Central Research Laboratory(丰田中央研究所) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)
AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。
Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda
Softplus注意力与重加权提升大语言模型的长度外推能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种两阶段注意力机制,用Softplus和l1归一化替代Softmax,并引入基于不变熵的动态缩放因子和重加权机制,以提升数值稳定性、缓解注意力下沉现象,并显著改善长度外推性能。
Comments Accepted by ICML 2026
PFT: 机器学习原子间势的声子微调
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出声子微调(PFT)方法,通过监督二阶力常数来优化机器学习原子间势(MLIP)的曲率,显著提升声子热力学性质预测精度。
Comments 17 pages, 11 figures, ICML 2026
极限情况下语言生成中噪声影响的刻画
机构 * Harvard University(哈佛大学) ; Duke University(杜克大学)
AI总结 本文在极限语言生成模型中,通过分析噪声字符串对生成能力的影响,证明了单个噪声字符串严格减少可生成集合族,且有限噪声等价于单个噪声,并首次刻画了非均匀噪声依赖的可生成性。
Comments ICML 2026
拔掉看似有知觉的机器的插头是理性选择——一种形而上学视角
机构 * Erik J. Bekkers ; Anna Ciaunica
AI总结 本文通过引入生物唯心主义框架,批判计算功能主义,论证人工智能只是功能模仿而非有意识主体,从而解决拔掉有情感AI的插头是否道德的悖论。
Comments Accepted at ICML in the position paper track
迈向物理基础模型
机构 * University of Cambridge(剑桥大学)
AI总结 提出通用物理变换器(GPhyT),通过在大规模多样化模拟数据上训练,实现单一模型在多个物理领域(如流固耦合、冲击波、热对流和多相流)的零样本泛化与长期稳定预测,性能超越专用架构7倍以上。
Comments ICML-AI4Physics 2026
立场:当前基准测试阻碍了时间序列预测深度学习的真正进展
机构 * University of Cambridge(剑桥大学)
AI总结 本文指出当前基准测试实践未能识别影响性能的关键设计因素,尤其是全局性与局部性等被忽视的方面对预测方法类别和实验结果有重大影响,并提出辅助预测模型卡以改进架构比较。
Comments ICML 2026
退化感知度量提示用于高光谱图像恢复
机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院) ; School of Computer Science, Wuhan University, Wuhan, Hubei, China(武汉大学计算机学院) ; Zhongguancun Academy, Beijing, China(中关村学院)
AI总结 提出退化感知度量提示(DAMP)框架,通过可解释的空间-光谱度量作为退化提示,结合退化自适应混合专家(DAMoE)模块,实现多维度退化统一恢复,在自然和遥感高光谱数据集上达到最先进性能并展现零样本泛化能力。
Comments Accepted by ICML 2026
揭示大型语言模型及其基准测试中的能力差距
机构 * University of Zurich(苏黎世大学)
AI总结 提出一种基于稀疏自编码器概念激活的新方法,自动发现模型在细粒度概念上的弱点(模型差距)和基准测试覆盖不平衡(基准差距),并通过内部表示评估和跨基准比较进行验证。
Journal ref ICML 2026
离散扩散VLA:将离散扩散引入视觉-语言-动作策略中的动作解码
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出离散扩散VLA,通过将动作块离散化并在统一Transformer骨干内使用离散扩散模式进行渐进细化,实现自适应解码顺序和错误纠正,在多个基准上取得高性能并保留预训练的视觉-语言先验。
Comments Accepted by ICML 2026. 17 pages
硬标签登场!重新思考硬标签在缓解局部语义漂移中的作用
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对软标签在稀疏监督下导致的局部语义漂移问题,提出混合硬标签与软标签的HALD训练范式,在数据集蒸馏和大规模分类任务中提升泛化性能。
Comments ICML 2026. Code at: https://github.com/Jiacheng8/HALD
非光滑优化的保护性随机Polyak步长:无需小(次)梯度的鲁棒性能
机构 * Mathematical Institute for Data Science (MINDS), Johns Hopkins University, Baltimore, MD, USA(数据科学数学研究所(MINDS),约翰霍普金斯大学,巴尔的摩,MD,美国) ; Department of Computer Science, Johns Hopkins University, Baltimore, MD, USA(计算机科学系,约翰霍普金斯大学,巴尔的摩,MD,美国) ; Department of Applied Mathematics and Statistics, Johns Hopkins University, Baltimore, MD, USA(应用数学与统计学系,约翰霍普金斯大学,巴尔的摩,MD,美国)
AI总结 针对非光滑凸优化问题,提出保护性随机Polyak步长(SPS_safe)用于随机次梯度方法,在无需强假设下提供收敛保证,并融入动量机制,实验验证其在深度神经网络训练中避免梯度消失的鲁棒性。
Comments 43rd International Conference on Machine Learning (ICML 2026)
生成路径的崩溃:扩散引导的准则与修正
机构 * Department of Biomedical Sciences, Seoul National University, Seoul, South Korea(首尔国立大学生物医学科学系) ; School of Transdisciplinary Innovations, Seoul National University, Seoul, South Korea(首尔国立大学跨学科创新学院) ; Interdisciplinary Program in AI, Seoul National University, Seoul, South Korea(首尔国立大学人工智能交叉学科项目) ; Kim Jaechul Graduate School of AI, Seoul, South Korea(金 Jaechul人工智能研究生院)
AI总结 针对扩散和流模型推理时引导中出现的边缘路径崩溃问题,提出路径存在准则和自适应路径修正方法ACE,通过时变指数控制中间分布的分位数半径,在药物设计和图像生成任务中优于固定指数基线。
Comments Accepted to ICML 2026
VocSim:单源音频中零样本内容身份的无训练基准
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 提出VocSim,一个无需训练的无标签基准,通过冻结嵌入的几何对齐评估通用音频表示在零样本内容身份识别中的性能,并在多领域音频上取得强结果,同时揭示跨语言泛化差距。
Comments Accepted at ICML 2026. Code: https://github.com/vocsim/benchmark
ClinTutor-R1:在临床苏格拉底式教育中推进可扩展且稳健的一对多对齐
机构 * Hong Kong University of Science and Technology(香港理工大学)
AI总结 针对临床查房等一对多教学场景中上下文稀释与目标错位问题,提出基于多智能体模拟器ClinEdu构建的苏格拉底式教学数据集ClinTeach,并开发首个显式内部思维机制的一对多对齐视觉语言智能体ClinTutor-R1,通过建模个体信念状态与群体共识,在静态基准、交互评估、专家评审及200人真实用户研究中超越基线模型20%以上,达到与专有模型相当的性能,并展现出随学生规模扩展的教学质量可扩展性。
Comments Accepted by ICML 2026 (Spotlight)
通过基座对齐模型协作优化多样性与质量
机构 * University of Chicago(芝加哥大学) ; University of Southern California, Information Sciences Institute(南加州大学信息科学研究所) ; University of California, Davis(加州大学戴维斯分校)
AI总结 提出基座对齐模型协作框架(BACo),在推理时通过令牌级路由策略动态结合基座LLM与其对齐版本,以单次前向传递同时提升生成多样性和质量。
Comments ICML 2026. (47 pages, 22 figures)