arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-28 至 2026-05-28 共收录 82
2602.13524 2026-05-28 cs.LG cs.AI

Singular Vectors of Attention Heads Align with Features

注意力头的奇异向量与特征对齐

Gabriel Franco, Carson Loughridge, Mark Crovella

机构 * Department of Computer Science, Boston University, Boston, USA Faculty of Computing \& Data Sciences, Boston University, Boston, USA

AI总结 本文通过理论分析和实验验证,解释了注意力头奇异向量与特征表示对齐的原因和条件,并提出了稀疏注意力分解作为对齐的可检验预测。

Comments To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11564 2026-05-28 cs.CV

LUVE : Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts

LUVE:基于双频专家的潜在级联超高分辨率视频生成

Chen Zhao, Jiawei Chen, Hongyu Li, Zhuoliang Kang, Shilin Lu, Xiaoming Wei, Kai Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 提出LUVE框架,通过三阶段潜在级联架构(低分辨率运动生成、潜在空间上采样、高分辨率内容精炼)结合双频专家,解决超高分辨率视频生成中的运动建模、语义规划和细节合成难题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18647 2026-05-28 cs.LG cs.AI

STFlow: Data-Coupled Flow Matching for Geometric Trajectory Simulation

STFlow: 用于几何轨迹模拟的数据耦合流匹配

Kiet Bennema ten Brinke, Koen Minartz, Vlado Menkovski

机构 * Machine Learning for Physical Sciences (ML4Sci/e) Group, Department of Mathematics \& Computer Science, Eindhoven University of Technology, The Netherlands

AI总结 提出STFlow,一种基于图神经网络和层次卷积的生成模型,通过数据依赖耦合的流匹配框架,从条件随机游走而非高斯噪声去噪,降低传输成本,提高训练和推理效率,在N体系统、分子动力学和人类轨迹预测中实现最低预测误差。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea. PMLR 306, 2026, 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04463 2026-05-28 cs.DS

Simple Algorithms for Bad Triangle Transversals with Applications to Correlation Clustering

坏三角形横截的简单算法及其在相关聚类中的应用

Florian Adriaens, Nikolaj tatti

AI总结 本文提出坏三角形横截问题(BTT)的多个2-近似算法,证明其在完全图上NP难近似到优于2137/2136因子,并给出BTT与相关聚类(CC)最优值在完全图上相差不超过3/2因子的枢轴变换过程。

Comments Accepted to ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03515 2026-05-28 cs.LG cs.AI cs.DC

Mitigating Staleness in Asynchronous Pipeline Parallelism via Basis Rotation

通过基旋转缓解异步流水线并行中的陈旧性问题

Hyunji Jung, Sungbin Shin, Namhoon Lee

机构 * POSTECH(POSTECH大学)

AI总结 针对异步流水线并行中梯度陈旧性随流水线深度线性增长的问题,提出基旋转框架,通过将优化器坐标系与Hessian特征基对齐来保持延迟更新的有效性,理论证明最小化基失配并实证在3B参数LLM训练中减少81.7%迭代次数。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03491 2026-05-28 cs.CV cs.CL

Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance

解耦骨架与血肉:基于解缠对齐和结构感知引导的高效多模态表格推理

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Xiaoqiang Zhou, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

AI总结 提出DiSCo解缠结构-内容对齐框架和Table-GLS全局到局部结构引导推理框架,高效增强LVLM的表格理解与推理能力,无需昂贵监督或外部工具。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01990 2026-05-28 cs.LG cs.AI

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME: 用于多模态持续指令调优的稳定混合专家模型

Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

AI总结 针对多模态持续指令调优中专家路由漂移和专家漂移问题,提出稳定混合专家模型(SAME),通过正交子空间分解路由动态和曲率感知缩放更新专家,实现无重放的状态最优性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/LAMDA-CL/Prism

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01745 2026-05-28 cs.LG cs.AI

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

概率-熵校准:一种用于自适应微调的弹性指标

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出概率-熵校准信号(相对排名指标)进行token级重加权,以平衡预训练先验与下游对齐,在数学推理、分布外推理和代码生成任务上优于仅基于概率或熵的方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02174 2026-05-28 cs.LG math.OC math.PR stat.ML

Flatness-Aware Stochastic Gradient Langevin Dynamics

平坦感知随机梯度Langevin动力学

Stefano Bruno, Youngsik Hwang, Jaehyeon An, Sotirios Sabanis, Dong-Young Lim

机构 * UNIST InnoCORE AI-Space Solar Initiative, Ulsan National Institute of Science and Technology (UNIST), Ulsan, 44919, Republic of Korea(UNIST InnoCORE AI-Space Solar Initiative,乌山国立科学与技术研究所(UNIST),乌山,44919,韩国) Artificial Intelligence Graduate School, Ulsan National Institute of Science and Technology (UNIST), Ulsan, 44919, Republic of Korea(人工智能研究生院,乌山国立科学与技术研究所(UNIST),乌山,44919,韩国) Department of Industrial Engineering, Ulsan National Institute of Science and Technology (UNIST), Ulsan, 44919, Republic of Korea(工业工程系,乌山国立科学与技术研究所(UNIST),乌山,44919,韩国) School of Mathematics, University of Edinburgh, Edinburgh, United Kingdom(爱丁堡大学数学学院,爱丁堡,英国) Department of Mathematics, National Technical University of Athens, Athens, Greece(雅典国家技术大学数学系,雅典,希腊) Archimedes, Athena Research and Innovation Centre, Marousi, Greece(Archimedes,雅典研究与创新中心,Marousi,希腊)

AI总结 提出平坦感知随机梯度Langevin动力学(fSGLD),通过理论规定的噪声尺度与逆温度耦合,在保持计算效率的同时偏向平坦盆地,并提供非渐近理论分析和实验验证。

Comments Accepted by ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01203 2026-05-28 cs.CL cs.LG

Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse

注意力汇聚在注意力层中锻造原生MoE:针对头部坍塌的汇聚感知训练

Zizhuo Fu, Wenxuan Zeng, Runsheng Wang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(人工智能研究院,北京大学,北京) School of Integrated Circuits, Peking University, Beijing(集成电路学院,北京大学,北京)

AI总结 本文通过理论和实证证明注意力汇聚自然构建了注意力层内的混合专家机制,并提出汇聚感知训练算法以缓解头部坍塌问题,提升模型性能。

Comments 2026 International Conference on Machine Learning (ICML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16679 2026-05-28 cs.CL cs.AI cs.CY

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

PICACO: 通过总相关优化实现大语言模型的多元情境价值对齐

Han Jiang, Dongyao Zhu, Xiaoyuan Yi, Ziang Xiao, Zhihua Wei, Xing Xie

机构 * Johns Hopkins University, Baltimore, MD, USA(约翰霍普金斯大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Tongji University, Shanghai, China(同济大学)

AI总结 针对情境对齐中价值冲突导致的指令瓶颈问题,提出PICACO方法,通过优化元指令并最大化指定价值与模型响应的总相关,无需微调即可实现多元价值平衡对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06106 2026-05-28 cs.LG

Unifying Low Dimensional Spectra in Deep Learning

统一深度学习中的低维谱

Connall Garrod, Jonathan P. Keating

机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所)

AI总结 本文利用无约束特征模型(UFM)证明深度神经坍缩(DNC)是多种深度学习矩阵(如Hessian、梯度和权重)中低维谱结构的统一来源,并给出了特征值和特征向量的解析构造。

Comments revised version; title changed slightly. 45 pages, 20 figures. Accepted at the International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15015 2026-05-28 cs.LG

Plug-and-Play Benchmarking of Reinforcement Learning Algorithms for Large-Scale Flow Control

强化学习算法在大规模流动控制中的即插即用基准测试

Jannis Becktepe, Aleksandra Franz, Nils Thuerey, Sebastian Peitz

机构 * TU Dortmund University(图卢兹大学) Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Technical University Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 提出首个完全基于PyTorch、可微分的强化学习流动控制基准套件FluidGym,通过标准化评估协议实现控制方法的系统比较。

Comments Accepted to ICML 2026. Code available at https://github.com/safe-autonomous-systems/fluidgym

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10714 2026-05-28 cs.CV cs.GR

Alterbute: Editing Intrinsic Attributes of Objects in Images

Alterbute: 编辑图像中物体的内在属性

Tal Reiss, Daniel Winter, Matan Cohen, Alex Rav-Acha, Yael Pritch, Ariel Shamir, Yedid Hoshen

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Reichman University(雷赫曼大学)

AI总结 提出Alterbute方法,通过扩散模型结合松弛训练目标和视觉命名实体,在保持物体身份和场景上下文的同时编辑颜色、纹理、材质和形状等内在属性。

Comments ICML 2026. Project page is available at https://talreiss.github.io/alterbute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10334 2026-05-28 cs.CV cs.LG

An analytic theory of convolutional neural network inverse problems solvers

卷积神经网络逆问题求解器的解析理论

Minh Hai Nguyen, Quoc Bao Do, Edouard Pauwels, Pierre Weiss

机构 * IRIT \& CBI, CNRS \& Université Toulouse, France Toulouse School of Economics, Université Toulouse Capitole, France

AI总结 通过最小均方误差估计器引入平移等变性和有限感受野的归纳偏置,推导出局部等变MMSE的解析公式,并在多种逆问题、数据集和架构上验证其与神经网络输出高度一致。

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20934 2026-05-28 cs.AI cs.CV cs.LG

Guaranteed Optimal Compositional Explanations for Neurons

神经元的保证最优组合解释

Biagio La Rosa, Leilani H. Gilpin

机构 * Computer Science and Engineering Department, University of California, Santa Cruz, US(加州大学圣克鲁兹分校计算机科学与工程系)

AI总结 提出首个框架,通过分解、启发式和算法,在完整状态空间上计算保证最优的组合解释,并证明10-40%的波束搜索解释在概念重叠时非最优。

Comments Accepted at ICML 2026 (Oral), 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17620 2026-05-28 cs.CL

Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models

忘记知识,记住使用:面向大型语言模型的上下文感知遗忘

Yuefeng Peng, Parnian Afshar, Megan Ganji, Thomas Butler, Amir Houmansadr, Mingxian Wang, Dezhi Hong

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Amazon(亚马逊)

AI总结 针对现有遗忘方法损害上下文可用性的问题,提出一种插件式目标项,在保持遗忘效果和保留集性能的同时恢复模型对已遗忘知识的上下文使用能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01450 2026-05-28 cs.LG cs.AI cs.RO

Investigating Memory in Model-Free RL with POPGym Arcade

基于POPGym Arcade的无模型强化学习中的记忆研究

Zekang Wang, Zhe He, Borong Zhang, Edan Toledo, Steven Morad

机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院) Centre for AI, University College London(伦敦大学学院人工智能中心)

AI总结 本文通过引入分析工具和POPGym Arcade环境套件,研究深度强化学习中的记忆机制,发现价值函数会将信用分配到无关历史,并展示分布外场景如何污染记忆。

Comments Appear at ICML 2026 as a Spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02329 2026-05-28 cs.CL cs.AI

SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification

SelfJudge: 通过自监督验证器加速推测解码

Kanghoon Yoon, Minsub Kim, Sungjae Lee, Joonhyung Lee, Sunghyeon Woo, Yeonjun In, Se Jung Kwon, Chanyoung Park, Dongsoo Lee

机构 * Efficient AI Large Language Model(大型语言模型) Speculative Decoding(推测解码)

AI总结 提出SelfJudge方法,利用目标模型的自监督训练验证器,通过评估令牌替换后响应的语义保持性来加速推测解码,实现更优的推理-准确率权衡。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18893 2026-05-28 cs.CL cs.LG

xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction

xKV:通过对齐奇异向量提取的跨层KV缓存压缩

Chi-Chih Chang, Wei-Cheng Lin, Chien-Yu Lin, Hung-Yueh Chiang, Yash Akhauri, Xilai Dai, Huiqiang Jiang, Yucheng Li, Luis Ceze, Kai-Chiang Wu, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学) Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Surrey(塞夫顿大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出xKV,一种通过跨层共享低秩子空间压缩KV缓存的后训练方法,实现高达8倍压缩且保持长上下文任务精度,并引入选择性重建实现端到端加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07772 2026-05-28 cs.LG cs.AI

MOLE: MOdular Learning FramEwork via Mutual Information Maximization

MOLE: 基于互信息最大化的模块化学习框架

Tianchao Li, Yulong Pei

机构 * Department of Mathematics(数学系) Computer Science, Eindhoven University of Technology, Eindhoven, the Netherland(计算机科学系,埃因霍温理工大学,埃因霍温,荷兰)

AI总结 提出一种异步局部学习框架MOLE,通过层间模块化与互信息最大化实现梯度隔离的局部优化,适用于向量、网格和图数据,并在图级别和节点级别任务上验证了通用性。

Comments accepted by icml llw

Journal ref ICML Workshop on Localized Learning (LLW) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏