arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-02 至 2026-06-02 共收录 220
2602.10623 2026-06-02 cs.LG cs.AI

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09153 2026-06-02 cs.RO cs.AI cs.CV cs.GR

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith: 面向仿真就绪室内场景的智能体生成

Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。

Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24069 2026-06-02 cs.LG cs.AI

Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures

LLM 能否进行结构性推理?通过数据结构视角进行基准测试

Yu He, Yingxi Li, Colin White, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

AI总结 本文提出 DSR-Bench 基准,通过 20 种数据结构、35 种操作和 4140 个问题实例评估 LLM 的结构性推理能力,发现顶级模型在挑战性实例上仅得 0.46/1,且在空间数据、上下文丰富场景及自身代码推理上表现不佳。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09651 2026-06-02 stat.ML cs.LG

The Entropic Signature of Class Speciation in Diffusion Models

扩散模型中类别分化的熵特征

Florian Handke, Dejan Stančević, Felix Koulischer, Thomas Demeester, Luca Ambrogioni

AI总结 通过追踪潜在语义变量的类别条件熵,检测扩散模型中的语义转变区间,并验证其在高斯混合模型和实际模型中的有效性。

Comments Accepted at International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00753 2026-06-02 math.OC cs.LG

Mirror Descent Under Generalized Smoothness

广义光滑性下的镜像下降

Dingzhi Yu, Wei Jiang, Hongyi Tao, Yuanyu Wan, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出一种新的 $\ell_*$-光滑性概念,将经典光滑性推广到一般范数空间,并证明镜像下降类算法在此条件下收敛率与经典光滑性一致。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06065 2026-06-02 stat.ML cond-mat.dis-nn cs.CL cs.LG

Deep networks learn to parse uniform-depth context-free languages from local statistics

深度网络从局部统计中学习解析均匀深度的上下文无关语言

Jack T. Parley, Francesco Cagnetta, Matthieu Wyart

AI总结 通过引入可调类概率上下文无关文法并设计基于深度卷积网络的推理算法,揭示了语言结构从局部统计中涌现的机制,并验证了深度卷积和Transformer架构的预测。

Comments Accepted as regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21140 2026-06-02 cs.LG cs.CL stat.AP stat.ML

How to Correctly Report LLM-as-a-Judge Evaluations

如何正确报告LLM作为评估者的评估结果

Chungpa Lee, Thomas Zeng, Jongwon Jeong, Jy-yong Sohn, Kangwook Lee

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对LLM作为评估者时存在偏差的问题,提出一种插件式校正框架,实现无偏估计和统计原理的不确定性量化,并证明在分布偏移下仍保持无偏性。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02763 2026-06-02 cs.LG

Exposing Vulnerabilities in Explanation for Time Series Classifiers via Dual-Target Attacks

通过双目标攻击暴露时间序列分类器解释中的脆弱性

Bohan Wang, Zewen Liu, Lu Lin, Hui Liu, Li Xiong, Ming Jin, Wei Jin

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出TSEF双目标攻击方法,通过联合操纵分类器和解释器输出,实现目标性误分类同时保持解释与参考一致,揭示解释稳定性不能作为决策鲁棒性的可靠指标。

Comments Accepted at ICML 2026; Code is available at https://github.com/Bohan7/TSEF

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21474 2026-06-02 cs.LG

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation

d2: 通过轨迹似然估计改进扩散语言模型的推理能力

Guanghan Wang, Gilad Turok, Yair Schiff, Marianne Arriola, Volodymyr Kuleshov

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技)

AI总结 提出d2框架,通过新的策略梯度算法和轨迹似然估计,显著提升扩散语言模型在逻辑与数学推理任务上的性能。

Comments ICML 2026. project page: https://guanghanwang.com/d2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07223 2026-06-02 cs.LG

Vegas: Self-Speculative Decoding with Verification-Guided Sparse Attention

Vegas: 验证引导稀疏注意力的自推测解码

Yikang Yue, Yuqi Xue, Jian Huang

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出Vegas方法,利用验证过程自然识别关键KV缓存条目,并仅对这些条目进行稀疏注意力计算,从而提升自推测解码的吞吐量。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06448 2026-06-02 cs.LG cs.AI

Principle-Evolvable Scientific Discovery via Uncertainty Minimization

通过不确定性最小化实现原理可演化的科学发现

Yingming Pu, Tao Lin, Hongyu Chen

机构 * Westlake University(西lake大学) Zhejiang University(浙江大学)

AI总结 提出PiEvo框架,将科学发现视为原理空间上的贝叶斯优化,通过信息导向假设选择与异常驱动增强机制,使智能体自主演化理论世界观,在四个基准上平均解质量达90.81%~93.15%,收敛速度提升83.3%。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

Journal ref Proc. 43rd Intl. Conf. on Machine Learning (ICML 2026), PMLR 306

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06136 2026-06-02 cs.LG cs.CV

Tempora: Characterising the Time-Contingent Utility of Online Test-Time Adaptation

Tempora: 表征在线测试时适应的时间条件效用

Sudarshan Sreeram, Young D. Kwon, Cecilia Mascolo

机构 * University of Bristol(布里斯托大学)

AI总结 提出Tempora框架,通过时间场景、评估协议和时间条件效用指标,系统评估测试时适应方法在延迟约束下的准确性-延迟权衡,揭示传统排名在时间压力下失效。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05970 2026-06-02 cs.LG cs.AI math.DS stat.ML

Inverse Depth Scaling From Most Layers Being Similar

大多数层相似时的逆深度缩放

Yizhou Liu, Sara Kangaslahti, Ziming Liu, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 通过分析大型语言模型和玩具残差网络,发现损失与深度成反比,归因于功能相似的层通过集成平均而非组合学习或平滑动力学离散化来减少误差,表明需要架构创新以鼓励深度组合使用。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05435 2026-06-02 cs.CV

Stable Velocity: A Variance Perspective on Flow Matching

稳定速度:流匹配的方差视角

Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对流匹配中单样本条件速度导致的高方差训练目标,提出稳定速度框架,通过方差表征识别高低方差区域,并引入无偏方差缩减目标(StableVM)、方差感知表示对齐(VA-REPA)以及免微调加速采样(StableVS),在多个大规模模型上实现训练效率提升和超过2倍采样加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05395 2026-06-02 stat.ML cs.AI cs.LG

Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers

用于高效推断一致LLM答案的最优贝叶斯停止

Jingkai Huang, Will Ma, Zhengyuan Zhou

机构 * Stern School of Business, New York University, New York, USA(纽约大学 Stern 商学院) Graduate School of Business, Columbia University, New York, USA(哥伦比亚大学 商学院)

AI总结 利用贝叶斯先验信息,通过L-聚合停止策略在达到足够一致性时提前停止采样,以最小化采样成本并高效识别最一致的LLM答案。

Comments Accepted to ICML 2026. Camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15371 2026-06-02 cs.CV cs.NE

Event2Vec: Processing Neuromorphic Events Directly by Representations in Vector Space

Event2Vec: 通过向量空间表示直接处理神经形态事件

Wei Fang, Priyadarshini Panda

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Event2Vec表示法,使Transformer能直接处理稀疏异步事件数据,在多个基准上实现高精度、低延迟和高吞吐量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05293 2026-06-02 cs.CV

Fast-SAM3D: 3Dfy Anything in Images but Faster

Fast-SAM3D: 更快地将图像中的任何物体三维化

Weilun Feng, Mingqiang Wu, Zhiliang Chen, Chuanguang Yang, Haotong Qin, Yuqi Li, Xiaokun Liu, Guoxin Fan, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu, Zhulin An

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出Fast-SAM3D,一种无需训练的三维重建加速框架,通过多级异构性感知机制(模态感知步骤缓存、联合时空令牌雕刻、频谱感知令牌聚合)实现高达2.67倍端到端加速且保真度损失极小。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04861 2026-06-02 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph

From Evaluation to Design: Using Potential Energy Surface Smoothness Metrics to Guide Machine Learning Interatomic Potential Architectures

从评估到设计:利用势能面平滑度指标指导机器学习原子间势架构

Ryan Liu, Eric Qu, Tobias Kreiman, Samuel M. Blau, Aditi S. Krishnapriyan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出键平滑度表征测试(BSCT)作为高效评估机器学习原子间势(MLIP)势能面平滑度的指标,并与分子动力学稳定性强相关,同时指导模型设计以减少伪影。

Comments Accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23782 2026-06-02 cs.CL

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

弥合大语言模型在多项选择题中的知识-预测差距

Yoonah Park, Haesung Pyun, Yohan Jo

机构 * KAIST(韩国科学技术院)

AI总结 通过分析隐藏表示中的知识子空间和预测子空间,提出轻量级推理时干预方法KAPPA来对齐两者,从而减少LLM在多项选择题上的知识-预测差距。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03766 2026-06-02 cs.CV cs.NE q-bio.NC

FOVI: A biologically-inspired foveated interface for deep vision models

FOVI:一种受生物启发的深度视觉模型中央凹接口

Nicholas M. Blauch, George A. Alvarez, Talia Konkle

机构 * harvard(哈佛大学) nvidia

AI总结 受人类视觉系统启发,提出基于视网膜和V1的中央凹接口FOVI,通过kNN卷积和低秩适应实现高效变分辨率视觉处理,在减少像素和计算成本的同时保持竞争力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03211 2026-06-02 cs.LG cs.AI

Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models

前瞻样本奖励引导用于扩散模型的测试时缩放

Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

机构 * KAIST(韩国科学技术院)

AI总结 提出一种高效测试时缩放方法LiDAR采样,通过前瞻几步采样和精确求解器引导粒子向高奖励区域移动,无需反向传播,在GenEval上达到与最新梯度引导方法相同性能且加速9.5倍。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03203 2026-06-02 cs.CL cs.LG

ForesightKV: Optimizing KV Cache Eviction for Reasoning Models by Learning Long-Term Contribution

ForesightKV: 通过学习长期贡献优化推理模型的KV缓存驱逐

Zican Dong, Peiyu Liu, Junyi Li, Zhipeng Chen, Han Peng, Shuo Wang, Wayne Xin Zhao

机构 * Zhejiang University(浙江大学)

AI总结 提出ForesightKV框架,通过监督学习和强化学习预测KV对在长文本生成中的重要性,在仅用一半缓存预算下优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03018 2026-06-02 cs.LG

From Zero to Hero: Advancing Zero-Shot Foundation Models for Tabular Outlier Detection

从零到英雄:推进表格异常检测的零样本基础模型

Xueying Ding, Haomin Wen, Simon Klüttermann, Leman Akoglu

机构 * Xueying Ding(丁雪莹) Haomin Wen(文浩明) Simon Klüttermann(西蒙·克吕特曼) Leman Akoglu(拉曼·阿科格卢)

AI总结 提出OUTFORMER模型,通过混合合成先验和自演化课程训练,实现零样本表格异常检测,在AdBench及新基准上达到最优性能。

Comments 41 Pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02823 2026-06-02 cs.CL

R2-Router: A New Paradigm for LLM Routing with Reasoning

R2-Router: 一种基于推理的LLM路由新范式

Jiaqi Xue, Qian Lou, Jiarong Xing, Heng Huang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对现有LLM路由忽略输出长度对质量和成本影响的问题,提出R2-Router,通过将输出长度预算作为可控变量联合选择最优LLM和预算,实现低成本高质量路由。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01753 2026-06-02 cs.CV

ObjEmbed: Towards Universal Multimodal Object Embeddings

ObjEmbed:迈向通用多模态对象嵌入

Shenghao Fu, Yukun Su, Fengyun Rao, Jing Lyu, Xiaohua Xie, Wei-Shi Zheng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ObjEmbed模型,通过分解图像为多个区域嵌入(每个对应一个对象)并生成语义和IoU两种互补嵌入,实现细粒度视觉-语言对齐,在视觉定位、局部和全局图像检索等任务中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02250 2026-06-02 math.OC cs.LG

Well-Posed KL-Regularized Control via Wasserstein and Kalman-Wasserstein KL Divergences

通过Wasserstein和Kalman-Wasserstein KL散度的适定KL正则化控制

Viktor Stein, Adwait Datar, Nihat Ay

机构 * Department of Mathematics, Technical University of Munich \& Munich Center for Machine Learning, Germany. The majority of the work was conducted while at the Institute of Mathematics at the Technical University of Berlin, Germany \& the Berlin Mathematical School. Institute for Data Science Foundations, Hamburg University of Technology, Germany Santa Fe Institute, USA

AI总结 针对KL散度在支持不匹配和低噪声下失效的问题,提出基于传输几何的KL变体,消除线性时不变系统中的奇异性,实现适定控制并提升闭环性能。

Comments 37 pages, 9 figures, comments welcome. Accepted @ ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02239 2026-06-02 cs.LG

Interpretability in Deep Time Series Models Demands Semantic Alignment

深度时间序列模型的可解释性需要语义对齐

Giovanni De Felice, Riccardo D'Elia, Alberto Termine, Pietro Barbiero, Giuseppe Marra, Silvia Santini

机构 * University of Padua(帕多瓦大学)

AI总结 本文提出深度时间序列模型的可解释性应追求语义对齐,即预测应基于对用户有意义的变量,并受时空机制约束,同时需保持时间演化下的语义一致性,为此提供了形式化定义和模型设计蓝图。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01053 2026-06-02 cs.LG

LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents

LRAgent: 面向多LoRA LLM代理的高效KV缓存共享

Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

机构 * KAIST(韩国科学技术院)

AI总结 针对多LoRA代理系统中每个代理独立存储相同长轨迹的KV缓存导致内存和计算开销大的问题,提出LRAgent框架,通过将缓存分解为共享基座部分和适配器依赖部分,并利用共享A的多LoRA架构和Flash-LoRA-Attention内核,实现高效共享,在保持精度的同时显著降低开销。

Comments 25 pages, 10 figures, 22 tables

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏