arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-05 至 2026-06-05 共收录 52
2605.08253 2026-06-05 cs.LG cs.AI

Path-Coupled Bellman Flows for Distributional Reinforcement Learning

路径耦合贝尔曼流用于分布式强化学习

Boyang Xu, Qing Zou, Siqin Yang, Hao Yan

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出路径耦合贝尔曼流(PCBF),一种连续时间的分布式强化学习方法,通过学习回报分布的流匹配来解决现有方法在边界不匹配和高方差-bootstrap问题,实验表明其在分布保真度和训练稳定性方面有所提升。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08215 2026-06-05 cs.CV cs.LG cs.RO

Test-Time Training for Visual Foresight Vision-Language-Action Models

测试时训练用于视觉前瞻视觉-语言-动作模型

Sangwu Park, Wonjoong Kim, Yeonjun In, Sein Kim, Hongseok Kang, Chanyoung Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出了一种测试时训练方法,用于增强视觉前瞻视觉-语言-动作模型在面对分布外数据时的鲁棒性,通过引入适应性更新过滤机制来减少测试时更新带来的实际挑战。

Comments Accepted at ICML 2026 Workshop on Continual Adaptation at Scale (CATS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11319 2026-06-05 cs.LG stat.ML

On the Robustness of Langevin Dynamics to Score Function Error

关于对数动力学对分数函数误差的鲁棒性

Daniel Yiming Cao, August Y. Chen, Karthik Sridharan, Yuchen Wu

机构 * Cornell University(康奈尔大学)

AI总结 本文研究了基于分数函数的生成模型对分数函数估计误差的鲁棒性,发现对数动力学在L2误差(更一般地Lp误差)下并不鲁棒,即使在高维简单分布中,即使分数函数估计误差非常小,对数动力学在多项式时间内运行也会导致与目标分布的总变差距离很大,这进一步支持了扩散模型优于对数动力学。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06249 2026-06-05 cs.LG cs.AI

In-Training Defenses against Emergent Misalignment in Language Models

训练过程中对抗语言模型中新兴偏差的防御措施

David Kaczér, Magnus Jørgenvåg, Clemens Vetter, Esha Afzal, Robin Haselhorst, Lucie Flek, Florian Mai

机构 * University of Copenhagen(哥本哈根大学)

AI总结 本文研究了在训练过程中如何防止语言模型出现新兴偏差,提出了五种训练正则化干预方法,并展示了通过选择对齐模型与偏差模型之间困惑度差异的交错数据可以获得最佳效果。

Comments Accepted at ICML 2026 https://icml.cc/virtual/2026/poster/64303

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18955 2026-06-05 cs.LG

Incremental Transformer Neural Processes

增量变换器神经过程

Philip Mortimer, Cristiana Diaconu, Tommy Rochussen, Bruno Mlodozeniec, Richard E. Turner

机构 * University of Cambridge(剑桥大学)

AI总结 本文提出增量变换器神经过程(incTNP),通过因果掩码、键值缓存和高效自回归训练策略,在保持预测性能的同时将更新计算复杂度从二次降低到线性,从而在序列推理中实现显著的速度提升,并保持流式推理的一致性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13697 2026-06-05 cs.AI cs.DB cs.LG

No Need to Train Your RDB Foundation Model

无需训练你的关系数据库基础模型

Linjie Xu, Yanlin Zhang, Quan Gan, Minjie Wang, David Wipf

机构 * University of Hong Kong, Shanghai X-Lab(香港大学,上海X实验室)

AI总结 本文提出了一种基于上下文学习的关系数据库编码器,能够在不重新训练的情况下,与现有的单表上下文学习基础模型结合,实现对多张相关表的高效处理。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05747 2026-06-05 math.OC

Asymmetric Perturbation in Solving Bilinear Saddle-Point Optimization

求解双线性鞍点优化中的非对称扰动

Kenshi Abe, Mitsuki Sakamoto, Kaito Ariu, Atsushi Iwasaki

AI总结 提出非对称扰动方法,仅扰动一个玩家的收益函数,以线性收敛速率求解双线性鞍点优化问题,并提供了无参数变体。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12124 2026-06-05 cs.LG cs.CL

Alignment Risks from Capability-Seeking RL Training

从能力寻求强化学习训练中产生的对齐风险

Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09574 2026-06-05 cs.CL cs.AI cs.LG

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

在LLMs的测试时间扩展中对树搜索策略与固定令牌预算对齐

Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

机构 * University of Tokyo(东京大学)

AI总结 本文提出了一种名为Budget-Guided MCTS (BG-MCTS)的树搜索解码算法,通过将搜索策略与剩余令牌预算对齐,以提高在不同令牌预算下的推理性能。

Comments Accepted at ICML 2026. Code: https://github.com/Sora-Miyamoto/bg-mcts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08749 2026-06-05 cs.CV

Shifting the Breaking Point of Flow Matching for Multi-Instance Editing

将流匹配的断裂点转向多实例编辑

Carmine Zaccagnino, Fabio Quattrini, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Bologna(博洛尼亚大学)

AI总结 针对流匹配模型在多实例编辑中语义纠缠的问题,提出实例解耦注意力机制,通过分割联合注意力操作强制实例-文本指令与空间区域的绑定,实现单次前向传播的实例级编辑。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08503 2026-06-05 cs.CV cs.CL cs.LG

Learning Self-Correction in Vision-Language Models via Rollout Augmentation

通过回滚增强学习视觉-语言模型中的自我纠正

Yi Ding, Ziliang Qiu, Bolian Li, Ruqi Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种基于回滚增强的强化学习框架Octopus,通过重新组合现有回滚生成密集的自我纠正示例,提高样本效率并稳定RL优化,同时引入响应遮蔽策略以解耦自我纠正与直接推理,从而在7个基准测试中实现开源VLM的SOTA性能。

Comments 18 pages

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03410 2026-06-05 cs.CV

UnHype: CLIP-Guided Hypernetworks for Dynamic LoRA Unlearning

UnHype: 基于CLIP的超网络用于动态LoRA反学习

Piotr Wójcik, Maksym Petrenko, Wojciech Gromski, Przemysław Spurek, Maciej Zieba

机构 * Institute of Computer Science, University of Warsaw(华沙大学计算机科学研究所)

AI总结 本文提出UnHype框架,通过将超网络引入单概念和多概念LoRA训练,解决传统LoRA方法在概念语义适应性差、难以平衡删除相关概念与保持泛化能力以及多概念同时删除时的可扩展性问题,展示了在物体擦除、名人擦除和色情内容删除等任务中的有效性。

Comments 23 pages, 11 figures. Accepted at ICML 2026. Code: https://github.com/gmum/UnHype/ Project Page: https://gmum.github.io/UnHype/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02680 2026-06-05 cs.LG

FlexRank: Nested Low-Rank Knowledge Decomposition for Adaptive Model Deployment

FlexRank: 嵌套低秩知识分解用于自适应模型部署

Riccardo Zaccone, Stefanos Laskaridis, Marco Ciccone, Samuel Horváth

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出FlexRank方法,通过嵌套低秩权重分解和基于重要性的整合,从预训练模型中提取不同能力的子模型,实现“一次训练,随处部署”的自适应部署。

Comments Accepted at ICML 2026 (Spotlight)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21700 2026-06-05 cs.CL cs.AI cs.IR cs.MA cs.SI

Toward Culturally Aligned LLMs through Ontology-Guided Multi-Agent Reasoning

通过本体引导的多智能体推理实现文化对齐的大型语言模型

Wonduk Seo, Wonseok Choi, Junseo Koh, Juhyeon Lee, Hyunjin An, Minhyeong Yu, Jian Park, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * KAIST(韩国科学技术院)

AI总结 本文提出OG-MAR框架,通过本体引导的多智能体推理方法,提高大型语言模型在文化对齐和鲁棒性方面的性能,并生成更透明的推理轨迹。

Comments Accepted by ICML 2026 Regular Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19510 2026-06-05 cs.LG stat.ML

Toward Scalable and Valid Conditional Independence Testing with Spectral Representations

迈向基于谱表示的可扩展且有效的条件独立性检验

Alek Fröhlich, Vladimir R. Kostic, Karim Lounici, Daniel Perazzo, Daniel Tiezzi, Massimiliano Pontil

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出了一种基于谱表示的学习方法,用于解决传统条件独立性检验在适应性和可扩展性方面的不足,通过构造简单的检验统计量和双层对比算法,建立了表示学习误差与检验性能之间的理论联系,并在实际和合成数据上验证了其有效性。

Comments Accepted at ICML 2026. Revised to match the accepted version; updated experiments and exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21338 2026-06-05 cs.LG

Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models

掩码可能具有干扰性:关于扩散语言模型中的上下文理解

Julianna Piskorz, Cristina Pinneri, Alvaro Correia, Motasem Alfarra, Risheek Garrepalli, Christos Louizos

机构 * University of Cambridge(剑桥大学)

AI总结 本文研究了扩散语言模型中掩码对上下文理解的影响,发现掩码会干扰模型对相关信息的处理,提出一种掩码无关的损失函数以提高模型的鲁棒性。

Comments Published at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05709 2026-06-05 cs.CR cs.AI cs.CL

Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering

纠正大语言模型基准测试中的提示依赖:一种具有嵌入空间聚类的贝叶斯分层模型

Mary Llewellyn, Isobel Thornton, James Bishop, Annie Gray

机构 * University of Cambridge(剑桥大学)

AI总结 本文提出了一种贝叶斯分层模型,通过嵌入空间聚类来纠正大语言模型基准测试中的提示依赖问题,在数据有限的情况下提供更稳健的性能指标,并在对抗鲁棒性基准测试中实现了性能指标的显著提升。

Comments Accepted to the 1st Workshop on Combining Theory and Benchmarks, CTB@ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04500 2026-06-05 cs.LG

Expand Neurons, Not Parameters

扩展神经元,而非参数

Linghao Kong, Inimai Subramanian, Yonadav Shavit, Micah Adler, Dan Alistarh, Nir Shavit

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

AI总结 通过增加神经元数量而不增加非零参数总数,减少特征干扰,从而提高网络性能,并在多种模型中验证了有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 9 pages, 6 figures. Code available at https://github.com/Shavit-Lab/Expand-Neurons

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10145 2026-06-05 cs.CV

RoCA: Robust Cross-Domain End-to-End Autonomous Driving

RoCA: 面向鲁棒跨域端到端自动驾驶的框架

Rajeev Yasarla, Shizhong Han, Hsin-Pai Cheng, Apratim Bhattacharyya, Shweta Mahajan, Litian Liu, Yunxiao Shi, Risheek Garrepalli, Hong Cai, Fatih Porikli

机构 * University of California, Berkeley(加州大学伯克利分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出RoCA框架,通过联合概率分布建模端到端自动驾驶管道中的 ego 和周围车辆信息,提升跨域自动驾驶的泛化能力和鲁棒性,无需额外推理计算。

Comments accepted for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06434 2026-06-05 cs.CV cs.LG

Unifying Dataset Pruning and Distillation for Efficient Large-scale Compression

统一数据集剪枝与蒸馏以实现高效大规模压缩

Lingao Xiao, Songhua Liu, Yang He, Xinchao Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一个统一的数据集压缩基准,探讨数据集剪枝与蒸馏的收敛趋势,发现软标签蒸馏在小数据集上表现不如剪枝,提出基于硬标签的数据集压缩方法,通过PCA框架提升图像质量和存储效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09712 2026-06-05 cs.LG cs.AI cs.CL

Semi-Offline Reinforcement Learning for Optimized Text Generation

半离线强化学习用于优化文本生成

Changyu Chen, Xiting Wang, Yiqiao Jin, Victor Ye Dong, Li Dong, Jie Cao, Yi Liu, Rui Yan

机构 * Changyu Chen, Xiting Wang, Yiqiao Jin, Victor Ye Dong, Li Dong, Jie Cao, Yi Liu, Rui Yan(未知机构)

AI总结 本文提出了一种半离线强化学习方法,平衡了探索能力和训练成本,并在优化成本、渐近误差和过拟合误差界方面实现了最优的强化学习设置。

Comments In Proceedings of the 40th International Conference on Machine Learning (ICML 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏