Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation
梯度预处理实现高效可靠的奖励引导生成
机构 * KAIST(韩国科学技术院)
AI总结 提出一种梯度预处理方法,通过将奖励梯度投影到白高斯噪声可行集上,实现一步生成模型在奖励引导生成中的高效性和可靠性,防止奖励黑客攻击并加速优化。
Comments ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
梯度预处理实现高效可靠的奖励引导生成
机构 * KAIST(韩国科学技术院)
AI总结 提出一种梯度预处理方法,通过将奖励梯度投影到白高斯噪声可行集上,实现一步生成模型在奖励引导生成中的高效性和可靠性,防止奖励黑客攻击并加速优化。
Comments ICML 2026
视觉-语言-动作模型的对比表示正则化
机构 * KAIST(韩国科学技术院)
AI总结 提出机器人状态感知对比损失(RS-CL),通过对比学习对齐VLM表示与机器人本体感受状态,提升VLA模型在机器人操作任务中的性能。
Comments ICML 2026
训练扩散语言模型用于黑盒优化
AI总结 针对离线黑盒优化问题,提出通过扩散语言模型的双向建模能力,结合统一语料构建和两阶段后训练框架,实现高效设计生成,在Design-Bench上达到最优性能。
Comments Accepted at ICML 2026 as a Spotlight Paper (top 2.2% of submissions)
基于分布鲁棒节点回归的变量聚类
机构 * Department of Industrial Engineering and Operations Research & The Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究院,哥伦比亚大学)
AI总结 本文提出一种分布鲁棒节点回归方法,通过凸松弛、数据驱动鲁棒区域选择和ADMM算法,实现多因子块模型下的变量聚类,并在数值实验中展示其优越性能。
Comments ICML 2026
从抽象到实例化:学习视觉-语言-动作模型的行为表示
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; PengCheng Laboratory(鹏城实验室) ; Sun Yat-sen University(中山大学) ; Shanghai University of Finance(上海财经大学)
AI总结 提出BehaviorVLA框架,通过因果Mamba架构的视觉运动行为编码器和相位条件行为解码器学习时间一致的行为表示,在分布偏移下实现鲁棒操作,在多个基准上达到最优成功率并展现数据效率。
Comments ICML 2026 Oral
Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘
AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。
Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io
因果强迫:自回归扩散蒸馏的正确方法,用于高质量实时交互式视频生成
机构 * Hongzhou Zhu(朱洪洲) ; Min Zhao(赵敏) ; Guande He(何冠德) ; Hang Su(苏hang) ; Chongxuan Li(李崇轩) ; Jun Zhu(朱军)
AI总结 针对双向扩散模型蒸馏为自回归模型时的架构差距问题,提出因果强迫方法,通过自回归教师进行ODE初始化并应用DMD过程,显著提升视频生成质量。
Comments Project page and the code: \href{https://thu-ml.github.io/CausalForcing.github.io/}{https://thu-ml.github.io/CausalForcing.github.io/}; https://github.com/thu-ml/Causal-Forcing. ICML 2026
Dropout 普适性:混沌边缘的缩放定律与最优调度
机构 * Lucas Fernandez Sarmiento
AI总结 提出 dropout 作为临界信号传播扰动的平均场理论,发现前端加载的 dropout 调度在固定预算下可将 MLP 和 Vision Transformer 的测试损失降低 18-35%,并推导出相关缩放定律与普适类。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 36 pages, 11 figures. Camera-ready version
群体相对策略优化中的优势崩塌:诊断与缓解
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对GRPO在可验证奖励强化学习中的优势崩塌问题,提出诊断指标ACR和轻量级扩展方法AVSPO,通过注入虚拟奖励样本减少梯度消失,提升模型推理能力。
Comments Accepted at the International Conference on Machine Learning (ICML 2026). Project page: https://QingyongHu.github.io/AVSPO
自适应梯度方法能否在重尾噪声下收敛?以 AdaGrad 为例
机构 * Zijian Liu(刘子健)
AI总结 本文研究 AdaGrad 在重尾梯度噪声下的收敛性,首次证明当尾指数 p 满足 4/3 < p ≤ 2 时,无需先验知识即可获得非凸优化的收敛率,并给出了算法相关的下界。
Comments ICML 2026. v2: simplification of the proof
LLM引导的通信用于合作多智能体强化学习
机构 * KAIST(韩国科学技术院)
AI总结 提出LMAC框架,利用大语言模型的推理能力设计通信协议,使所有智能体尽可能准确一致地重建底层状态,从而提升多智能体强化学习中的状态重建和性能。
Comments 9 pages for main, 32 pages for total, Accepted to ICML 2026
打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器
机构 * Tsinghua University(清华大学)
AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。
Comments Accepted by ICML 2026
通过Hodge分解保持拓扑的神经算子学习
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文从函数空间视角研究几何网格上物理场方程的解算子,利用Hodge正交性分离不可学习的拓扑自由度与可学习的几何动力学,提出基于Hodge谱对偶的混合欧拉-拉格朗日架构,在保持物理不变量的同时提升几何图上的精度与效率。
Comments Accepted at ICML 2026. Code available at https://github.com/ContinuumCoder/Hodge-Spectral-Duality
走向因果效应识别中选择偏差的整体理解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 研究在观测研究中存在选择偏差时,如何利用弱假设刻画倾向得分和选择概率,给出平均处理效应可识别性的充要条件,扩展了现有图形识别准则。
Comments 9 pages for the main text, ICML 2026
大规模学习哈密顿动力学:一种微分几何方法
机构 * Department of Robotics, Perception, and Learning(机器人、感知与学习系)
AI总结 提出结合哈密顿力学守恒律与模型降阶可扩展性的降阶哈密顿神经网络(RO-HNN),通过几何约束辛自编码器和几何哈密顿神经网络实现高维动力系统的物理一致预测。
Comments 32 pages, 21 figures, Intl. Conference on Machine Learning (ICML), 2026
CLIP Tricks You: 面向大型视觉-语言模型中高效像素定位的无训练令牌剪枝
机构 * KAIST(韩国科学技术院)
AI总结 提出LiteLVLM,一种无需训练、文本引导的令牌剪枝策略,通过反转CLIP视觉-文本相似度排序,保留指代区域令牌并恢复上下文令牌,实现高效像素定位推理,在多种令牌预算下性能提升超5%,保持90%原始性能同时加速22%并减少2.3倍内存。
Comments Accepted by ICML 2026
REALISTA: 引发LLM幻觉的逼真潜在对抗攻击
机构 * University of Waterloo(滑铁卢大学)
AI总结 提出REALISTA框架,通过潜在空间优化语义等价的对抗提示,有效引发大语言模型幻觉,优于现有方法。
Comments Accepted at ICML 2026. Code is available at https://github.com/Buyun-Liang/REALISTA
PATRA: 面向时间序列问答的模式感知对齐与平衡推理
机构 * East China Normal University, Shanghai, China(华东师范大学) ; Aalborg University, Aalborg, Denmark(奥胡斯大学)
AI总结 针对现有LLM方法在时间序列推理中忽略模式提取和简单任务主导学习的问题,提出模式感知对齐与平衡推理模型PATRA,通过提取趋势和季节模式实现深度对齐,并设计任务感知平衡奖励以协调不同难度任务的学习,在多种时间序列问答任务中优于强基线。
Comments Accepted By ICML 2026
理解并加速大型语言模型推理的内存处理流水线
AI总结 本文通过将稀疏注意力、检索增强生成和压缩上下文内存等优化统一为四步内存处理流水线,识别出22%-97%的内存处理开销,并提出使用GPU-FPGA异构系统加速该流水线,实现最高2.2倍加速和4.7倍能效提升。
Comments Accepted by ICML 2026. Code: https://github.com/OswaldHe/HeteroLLM
RADAR:面向多智能体通信结构生成的冗余感知扩散方法
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。
Comments Accepted by ICML 2026 (fix typos)
学习增强的可扩展线性分配问题优化:基于神经对偶热启动
机构 * Department of Electrical and Computer Engineering, Technion -- Israel Institute of Technology, Haifa, Israel(电气与计算机工程系,技术学院——以色列理工学院,海法,以色列)
AI总结 提出一种学习增强框架,通过预测对偶变量热启动精确求解器,并设计轻量级行独立架构RowDualNet避免O(N^2)内存瓶颈,实现可扩展的神经热启动,在保持最优性的同时获得超过2倍加速。
Comments Accepted to ICML 2026. 23 pages, 18 figures
探索和利用潜流匹配中的稳定性
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文证明潜流匹配模型对数据缩减和模型容量收缩具有鲁棒性,并利用这种稳定性提出更高效的训练和推理算法,包括数据节省和超过两倍的推理加速。
Comments Accepted at ICML 2026
基于AI人格先验的自适应查询
机构 * Department of Industrial Engineering and Operations Research and Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究所,哥伦比亚大学) ; Decision, Risk, and Operations Division, Columbia Business School(决策、风险与运营部门,哥伦比亚商学院)
AI总结 提出一种基于AI人格诱导的潜变量模型,利用大语言模型生成响应分布,实现高效贝叶斯设计,用于在有限查询预算下学习用户相关量。
Comments ICML 2026
网格场理论:基于网格的物理的端口-哈密顿形式化
机构 * University of Tokyo(东京大学)
AI总结 提出网格场理论(MeshFT)及其神经实现MeshFT-Net,通过端口-哈密顿形式化分离物理的拓扑与度量结构,实现近零能量漂移和强物理保真度。
Comments 29 pages, 7 figures, 15 tables. Accepted to ICML 2026
一致性扩散语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出多路径离散一致性(MPDC)原则,通过训练去噪器在随机桥上的路径不变性,实现单阶段训练的一致性扩散语言模型(CDLM),在文本生成中达到最先进性能。
Comments ICML 2026
平均流策略优化
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出使用平均流模型作为策略表示,通过最大熵强化学习框架进行软策略迭代,以提升在线强化学习中训练和推理效率,实验表明性能与扩散模型基线相当或更优且时间显著减少。
Comments ICML 2026
过程奖励智能体:引导知识密集型推理
机构 * University of Michigan(密歇根大学)
AI总结 提出过程奖励智能体(PRA),通过在线、分步奖励指导冻结策略模型进行搜索式解码,在医疗推理基准上取得新最优结果,并泛化至不同规模模型。
Comments Accepted to ICML 2026
U-Cast:一种惊人简单且高效的边界概率AI天气预报器
机构 * University of Cambridge(剑桥大学)
AI总结 提出基于标准U-Net骨架的概率天气预报模型U-Cast,通过确定性预训练和短时概率微调,以不到1/10的计算成本匹配或超越GenCast和IFS ENS的预报技能。
Comments ICML 2026. Our code is available at: https://github.com/Rose-STL-Lab/u-cast
处理具有隐状态动态的上下文赌博机的直接方法
AI总结 本文提出一种直接方法处理隐马尔可夫链驱动的线性上下文赌博机,通过简化模型归约到标准线性上下文赌博机,并扩展理论分析以考虑HMM参数估计,同时针对更复杂的隐状态依赖模型引入周期性参数更新算法。
Journal ref ICML 2026 - Forty-Third International Conference on Machine Learning, Jul 2026, Seoul, South Korea, France
CalM:一种用于钙成像数据中群体动力学的自监督基础模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出自监督基础模型CalM,通过双轴自回归Transformer和高效分词器,在钙成像数据上预训练后,可迁移至神经群体动力学预测和行为解码等下游任务,并取得竞争性或更优性能。
Comments ICML accepted version