Unveiling the Visual Counting Bottleneck in Vision-Language Models
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
高斯混合的总变差与Hellinger距离之间的尖锐不等式
AI总结 本文建立了紧支撑混合分布下高斯位置混合的总变差与Hellinger距离之间的上界,并构造序列证明其尖锐性,从而解决了Jia等人(2023)提出的开放问题,并给出了总变差下学习高斯混合的熵特征以及Hellinger距离下的最优鲁棒估计。
Comments 36 pages
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea. PMLR 306, 2026
理解引导强度
AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。
Comments Accepted for publication at ICML 2026 (50 pages)
基于解耦输入输出速率的基于查询的语音恢复非对称建模
AI总结 研究语音恢复中输入输出采样率不同的问题,提出基于查询的xSFI建模框架TF-Restormer,通过特定编码合成方式及多种损失训练,在多采样率基准测试中无需冗余重采样实现保真度与感知质量平衡。
Comments Accepted to ICML 2026
LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?
机构 * University of Michigan(密歇根大学)
AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。
Comments ICML 2026 Camera Ready
FPTQuant:用于大语言模型量化的函数保持变换
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。
Comments Forty-third International Conference on Machine Learning (ICML 2026)
对比CFG:通过对比正负概念引导扩散采样
机构 * EverEx
AI总结 研究在条件扩散模型采样中,针对简单否定CFG引导存在的问题,提出用对比损失实现对给定条件引导的新方法,能在多样场景下有效注入或去除给定概念并保持样本质量。
Comments 20 pages, 11 figures. Poster in ICML 2026