arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 712
2602.15829 2026-06-09 cs.LG 版本更新

Operationalising the Superficial Alignment Hypothesis via Task Complexity

通过任务复杂度操作化浅层对齐假设

Tomás Vergara-Browne, Darshan Patil, Ivan Titov, Siva Reddy, Tiago Pimentel, Marius Mosbach

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Edinburgh(爱丁堡大学)

AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08733 2026-06-09 cs.LG 版本更新

Foundation Inference Models for Ordinary Differential Equations

常微分方程的基础推理模型

Maximilian Mauel, Johannes R. Hübers, David Berghaus, Patrick Seifner, Ramses J. Sanchez

机构 * University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出FIM-ODE,一种预训练的基础推理模型,通过单次前向传播从含噪轨迹直接预测向量场,实现零样本性能匹配并超越ODEFormer,微调后优于现代神经和GP基线。

Comments Published in ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08235 2026-06-09 cs.CL cs.AI cs.CR 版本更新

When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents

当良性输入导致严重危害:引发计算机使用代理的不安全意外行为

Jaylen Jones, Zhehao Zhang, Yuting Ning, Eric Fosler-Lussier, Pierre-Luc St-Charles, Yoshua Bengio, Dawn Song, Yu Su, Huan Sun

机构 * DeepMind, London, UK(深度Mind,伦敦,英国) Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)

AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。

Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04402 2026-06-09 stat.ML cs.AI cs.CY cs.LG math.ST stat.TH 版本更新

Performative Learning Theory

表现性学习理论

Julian Rodemann, Unai Fischer-Abaigar, James Bailie, Krikamol Muandet

机构 * University of Cambridge(剑桥大学)

AI总结 将表现性预测嵌入统计学习理论,证明在样本和总体表现性效应下的泛化界,揭示模型影响数据越多则学习越少的权衡,并提出通过再训练改善泛化保证。

Comments ICML 2026. v2: corrected typo in author list; v3: added explanation of condition 3.2, modified condition 3.3 and fixed lemma 3.4, added examples and explanations in sections 2, 5, and 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02572 2026-06-09 cs.LG cs.AI 版本更新

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

奖励塑形用于(推理时)对齐:一个Stackelberg博弈视角

Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

机构 * University of Southern California(南加州大学)

AI总结 针对KL正则化导致LLM继承基策略偏见的问题,提出将奖励模型优化形式化为Stackelberg博弈,并通过简单奖励塑形方案近似最优奖励模型,在推理时对齐中持续提升平均奖励并达到超过66%的胜率。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02431 2026-06-09 stat.ML cs.LG 版本更新

Full-Batch Gradient Descent Outperforms One-Pass SGD: Sample Complexity Separation in Single-Index Learning

全批量梯度下降优于单次SGD:单索引学习中的样本复杂度分离

Filip Kovačević, Hong Chang Ji, Denny Wu, Mahdi Soltanolkotabi, Marco Mondelli

机构 * Institute of Science and Technology Austria(奥地利科学与技术研究所) Sung Kyun Kwan University(顺天妇女大学) New York University and Flatiron Institute(纽约大学和Flatiron研究所) University of Southern California(南加州大学)

AI总结 研究单索引学习中全批量GD与单次SGD的样本复杂度差异,发现通过截断激活函数,全批量GD在n≃d样本时实现弱恢复,优于单次SGD的n≳d log d样本需求。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22859 2026-06-09 cs.SE cs.AI 版本更新

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

MEnvAgent:可扩展的多语言环境构建用于可验证软件工程

Chuanzhe Guo, Jingjing Wu, Sijun He, Yang Chen, Zhaoqi Kuang, Shilong Fan, Bingjin Chen, Siqi Bao, Jing Liu, Hua Wu, Qingfu Zhu, Wanxiang Che, Haifeng Wang

机构 * Tsinghua University(清华大学)

AI总结 提出MEnvAgent框架,通过多智能体规划-执行-验证架构和环境复用机制,自动构建多语言可执行环境,生成可验证任务实例,在10种语言1000个任务上提升F2P率8.6%并降低时间成本43%。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20137 2026-06-09 cs.LG cs.AI 版本更新

ePC: Fast and Deep Predictive Coding in Digital Simulation

ePC:数字仿真中的快速深度预测编码

Cédric Goemaere, Gaspard Oliviers, Rafal Bogacz, Thomas Demeester

机构 * IDLab, Ghent University -- imec, Belgium(ID实验室,根特大学——imec,比利时) Brain Network Dynamics Unit, University of Oxford, UK(脑网络动力学单位,牛津大学,英国)

AI总结 提出误差预测编码(ePC),通过重新参数化解决标准状态预测编码(sPC)在数字仿真中的指数信号衰减问题,实现与反向传播相当的深度模型训练速度。

Comments Accepted at ICML 2026 - Main Track. All code available at https://github.com/cgoemaere/error_based_PC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00797 2026-06-09 stat.ML cs.LG 版本更新

Zero-Flow Encoders

零流编码器

Yakun Wang, Leyang Wang, Song Liu, Taiji Suzuki

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种基于流的表示学习框架,通过零流准则验证条件独立性,从而在生成模型中提取充分信息,并在图模型和自监督学习任务中学习近似马尔可夫毯和潜在表示。

Comments Yakun Wang and Leyang Wang contributed equally to this work; As published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23231 2026-06-09 eess.IV cs.LG 版本更新

Solving Inverse Problems with Flow-based Models via Model Predictive Control

基于模型预测控制的流模型逆问题求解

George Webber, Alexander Denker, Riccardo Barbano, Andrew J Reader

机构 * University of Cambridge(剑桥大学)

AI总结 提出MPC-Flow框架,将流模型逆问题求解转化为序列控制子问题,实现无需训练的推理时引导,理论联系最优控制,在图像修复任务中表现优异。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19857 2026-06-09 cs.LG quant-ph 版本更新

Quantum latent distributions in deep generative models

深度生成模型中的量子潜在分布

Omar Bacarreza, Thorin Farnsworth, Alexander Makarovskiy, Hugo Wallner, Tessa Hicks, Santiago Sempere-Llagostera, John Price, Robert J. A. Francis-Jones, William R. Clements

机构 * ORCA Computing(ORCA计算公司)

AI总结 研究量子处理器产生的潜在分布何时及为何能提升生成模型性能,理论上证明其可生成经典分布无法高效产生的数据分布,并在合成和分子数据集上验证了量子干涉统计带来的性能优势。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22211 2026-06-09 cs.LG 版本更新

Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions

面向组合动作强化学习的潜在球形流策略

Lingkai Kong, Anagha Satish, Hezi Jiang, Akseli Kangaslahti, Andrew Ma, Wenbo Chen, Mingxiao Song, Lily Xu, Milind Tambe

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出LSFlow方法,通过球形流匹配在紧凑连续潜在空间中学习随机策略,并利用组合优化求解器保证动作可行性,引入平滑贝尔曼算子解决不连续值函数问题,在多个组合RL任务上平均超越基线20.6%。

Comments ICML'26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21816 2026-06-09 cs.LG 版本更新

Nonparametric LLM Evaluation from Preference Data

基于偏好数据的非参数化LLM评估

Dennis Frauen, Athiya Deviyani, Mihaela van der Schaar, Stefan Feuerriegel

AI总结 提出非参数统计框架DMLRank,通过去偏机器学习从偏好数据中比较和排名大语言模型,引入广义平均排名分数,具有统计高效、兼容黑箱方法、结合预训练评估器和优化数据收集策略等优势。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10534 2026-06-09 cs.LG cs.AI cs.CL 版本更新

Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings

解耦“什么”和“哪里”:极坐标位置嵌入

Anand Gopalakrishnan, Robert Csordás, Jürgen Schmidhuber, Michael C. Mozer

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

AI总结 提出极坐标位置嵌入(PoPE)以解耦Transformer注意力机制中的内容和位置,在诊断任务、序列建模和语言模型中优于RoPE,并展现零样本长度外推能力。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01930 2026-06-09 cs.LG cs.AI 版本更新

SVRG and Beyond via Posterior Correction

SVRG及其后验校正扩展

Nico Daheim, Thomas Möllenhoff, Ming Liang Ang, Mohammad Emtiyaz Khan

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文揭示SVRG与后验校正方法的深层联系,证明SVRG是各向同性高斯后验校正的特例,并通过灵活指数族后验自动导出牛顿型和Adam型新变体。

Comments ICML 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01467 2026-06-09 cs.LG cs.AR cs.SC 版本更新

Differentiable Weightless Controllers: Learning Logic Circuits for Continuous Control

可微无权重控制器:学习连续控制的逻辑电路

Fabian Kresse, Christoph H. Lampert

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

AI总结 提出可微无权重控制器(DWC),一种符号可微架构,通过梯度训练学习高效控制策略,编译为低延迟、低能耗的FPGA电路,在MuJoCo基准上达到与深度策略竞争的性能,并具有稀疏可解释的连接模式。

Comments Accepted at Forty-third International Conference on Machine Learning (ICML), 19 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00239 2026-06-09 cs.LG stat.ML 版本更新

Self-Supervised Dynamical System Representations for Physiological Time-Series

生理时间序列的自监督动力系统表示

Yenho Chen, Maxwell A. Xu, James M. Rehg, Christopher J. Rozell

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07317 2026-06-09 cs.CL cs.LG 版本更新

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RLVE: 利用自适应可验证环境扩展语言模型的强化学习

Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学)

AI总结 提出RLVE方法,通过程序化生成问题并提供可验证奖励的可验证环境,自适应调整难度以扩展语言模型的强化学习,在400个环境中联合训练使六个推理基准平均提升3.37%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13554 2026-06-09 cs.CL cs.LG 版本更新

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化

Yang Li, Zhichen Dong, Yuhan Sun, Weixun Wang, Shaopan Xiong, Yijia Luo, Jiashun Liu, Han Lu, Jiamang Wang, Wenbo Su, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。

Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19094 2026-06-09 q-bio.NC cs.CE 版本更新

Accurate identification of communication between multiple interacting neural populations

多个相互作用的神经群体之间通信的准确识别

Belle Liu, Jacob Sacks, Matthew D. Golub

AI总结 提出MR-LFADS模型,通过顺序变分自编码器分离区域间通信、未观测区域输入和局部神经动态,在模拟和真实数据中优于现有方法,可预测电路扰动效应。

Journal ref Forty-second International Conference on Machine Learning (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13930 2026-06-09 cs.CL 版本更新

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

语言裙带关系:多语言RAG中为语言偏好牺牲质量

Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

机构 * University of Washington(华盛顿大学)

AI总结 研究多语言RAG系统中模型对英语源文档的偏好,发现模型会牺牲文档相关性以迎合语言偏好,尤其在低资源语言中更明显。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24467 2026-06-09 cs.LG stat.ML 版本更新

Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation

通过表征地标和Nyström近似的可解释自监督学习

Maedeh Zarvandi, Michael Timothy, Theresa Wasserer, Debarghya Ghoshdastidar

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich, TUM School of Computation, Information and Technology(慕尼黑技术大学,TUM计算、信息与技术学院)

AI总结 提出KREPES框架,利用表征地标和Nyström近似,对自监督学习目标(SimCLR、BYOL、VICReg)学到的表征进行可解释性分析,并引入新指标量化透明度。

Comments 24 pages, 10 figures. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06891 2026-06-09 cs.LG cs.CR 版本更新

Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks

奖励投毒攻击下的鲁棒上下文强化学习

Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada.(阿尔伯塔大学计算机科学系,加拿大埃德蒙顿) Alberta Machine Intelligence Institute (Amii), Edmonton, Canada.(阿尔伯塔机器智能研究所(Amii),加拿大埃德蒙顿)

AI总结 针对奖励投毒攻击,提出对抗训练框架AT-DPT,通过同时训练攻击者和DPT模型,显著提升上下文强化学习在赌博机环境下的鲁棒性,并泛化到MDP等复杂场景。

Comments ICML 2026, code available at https://github.com/PauliusSasnauskas/AT-DPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10341 2026-06-09 cs.LG cs.CL 版本更新

Formalizing Learning from Language Feedback with Provable Guarantees

从语言反馈中学习的形式化与可证明保证

Wanqiao Xu, Allen Nie, Ruijie Zheng, Aditya Modi, Adith Swaminathan, Ching-An Cheng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06295 2026-06-09 cs.LG cs.AI cs.CL 版本更新

dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching

dLLM-Cache:基于自适应缓存的扩散大语言模型加速

Zhiyuan Liu, Yicun Yang, Yaojie Zhang, Junjie Chen, Chang Zou, Qingyan Wei, Shaobo Wang, Yichen Zhu, Linfeng Zhang

机构 * Zhejiang University(浙江大学)

AI总结 针对扩散大语言模型推理延迟高的问题,提出一种无需训练的自适应缓存框架dLLM-Cache,通过长间隔提示缓存和基于特征相似性的部分响应更新,实现高效中间计算复用,在保持输出质量的同时大幅降低FLOPs。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06287 2026-06-08 quant-ph cs.DS 版本更新

Quantum Algorithms for Triangle Cut Sparsification

三角形割稀疏化的量子算法

Shan Jiang, Pan Peng

AI总结 研究三角形割稀疏化问题,提出基于三角形列举的量子算法,在广泛参数范围内优于经典算法,并构造了ε-三角形割稀疏化器。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05919 2026-06-08 stat.ML cs.LG econ.EM stat.CO 版本更新

Finding Most Influential Sets

寻找最具影响力的集合

Lucas D. Konrad, Nikolas Kuschnig

机构 * Vienna University of Economics and Business(维也纳经济与商业大学) Monash University(墨尔本大学)

AI总结 针对具有线性分式留出效应的估计量,提出一种基于Dinkelbach方法的高效算法,将最具影响力集合的选择转化为一个单参数序列的top-k问题,实现全局最优解。

Comments Published as a conference paper at ICML 2026, fixed ref

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04373 2026-06-08 cs.CV cs.AI 版本更新

Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers

解耦信息区域的选择性耦合:用于视觉Transformer无数据量化的掩码注意力对齐

Biao Qian, Yang Wang, Yong Wu, Jungong Han

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出MaskAQ方法,通过解耦合成样本中的信息区域并利用掩码注意力对齐全精度模型与量化模型,解决无数据量化中分布不匹配问题。

Comments Accepted to appear at ICML 2026, Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏