arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-09 至 2026-06-09 共收录 107
2601.22211 2026-06-09 cs.LG 版本更新

Latent Spherical Flow Policy for Reinforcement Learning with Combinatorial Actions

面向组合动作强化学习的潜在球形流策略

Lingkai Kong, Anagha Satish, Hezi Jiang, Akseli Kangaslahti, Andrew Ma, Wenbo Chen, Mingxiao Song, Lily Xu, Milind Tambe

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出LSFlow方法,通过球形流匹配在紧凑连续潜在空间中学习随机策略,并利用组合优化求解器保证动作可行性,引入平滑贝尔曼算子解决不连续值函数问题,在多个组合RL任务上平均超越基线20.6%。

Comments ICML'26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21816 2026-06-09 cs.LG 版本更新

Nonparametric LLM Evaluation from Preference Data

基于偏好数据的非参数化LLM评估

Dennis Frauen, Athiya Deviyani, Mihaela van der Schaar, Stefan Feuerriegel

AI总结 提出非参数统计框架DMLRank,通过去偏机器学习从偏好数据中比较和排名大语言模型,引入广义平均排名分数,具有统计高效、兼容黑箱方法、结合预训练评估器和优化数据收集策略等优势。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10534 2026-06-09 cs.LG cs.AI cs.CL 版本更新

Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings

解耦“什么”和“哪里”:极坐标位置嵌入

Anand Gopalakrishnan, Robert Csordás, Jürgen Schmidhuber, Michael C. Mozer

机构 * DeepMind, London, UK(深度Mind,伦敦,英国)

AI总结 提出极坐标位置嵌入(PoPE)以解耦Transformer注意力机制中的内容和位置,在诊断任务、序列建模和语言模型中优于RoPE,并展现零样本长度外推能力。

Comments ICML 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01930 2026-06-09 cs.LG cs.AI 版本更新

SVRG and Beyond via Posterior Correction

SVRG及其后验校正扩展

Nico Daheim, Thomas Möllenhoff, Ming Liang Ang, Mohammad Emtiyaz Khan

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文揭示SVRG与后验校正方法的深层联系,证明SVRG是各向同性高斯后验校正的特例,并通过灵活指数族后验自动导出牛顿型和Adam型新变体。

Comments ICML 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01467 2026-06-09 cs.LG cs.AR cs.SC 版本更新

Differentiable Weightless Controllers: Learning Logic Circuits for Continuous Control

可微无权重控制器:学习连续控制的逻辑电路

Fabian Kresse, Christoph H. Lampert

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

AI总结 提出可微无权重控制器(DWC),一种符号可微架构,通过梯度训练学习高效控制策略,编译为低延迟、低能耗的FPGA电路,在MuJoCo基准上达到与深度策略竞争的性能,并具有稀疏可解释的连接模式。

Comments Accepted at Forty-third International Conference on Machine Learning (ICML), 19 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00239 2026-06-09 cs.LG stat.ML 版本更新

Self-Supervised Dynamical System Representations for Physiological Time-Series

生理时间序列的自监督动力系统表示

Yenho Chen, Maxwell A. Xu, James M. Rehg, Christopher J. Rozell

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07317 2026-06-09 cs.CL cs.LG 版本更新

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RLVE: 利用自适应可验证环境扩展语言模型的强化学习

Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学)

AI总结 提出RLVE方法,通过程序化生成问题并提供可验证奖励的可验证环境,自适应调整难度以扩展语言模型的强化学习,在400个环境中联合训练使六个推理基准平均提升3.37%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13554 2026-06-09 cs.CL cs.LG 版本更新

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

注意力揭示大语言模型推理:预规划与锚定节奏实现细粒度策略优化

Yang Li, Zhichen Dong, Yuhan Sun, Weixun Wang, Shaopan Xiong, Yijia Luo, Jiashun Liu, Han Lu, Jiamang Wang, Wenbo Su, Bo Zheng, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文通过注意力机制揭示大语言模型推理中的预规划与锚定节奏,并据此提出三种细粒度强化学习策略,在多种推理任务上取得一致性能提升。

Comments 31 pages, 9 figures, 20 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19094 2026-06-09 q-bio.NC cs.CE 版本更新

Accurate identification of communication between multiple interacting neural populations

多个相互作用的神经群体之间通信的准确识别

Belle Liu, Jacob Sacks, Matthew D. Golub

AI总结 提出MR-LFADS模型,通过顺序变分自编码器分离区域间通信、未观测区域输入和局部神经动态,在模拟和真实数据中优于现有方法,可预测电路扰动效应。

Journal ref Forty-second International Conference on Machine Learning (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13930 2026-06-09 cs.CL 版本更新

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

语言裙带关系:多语言RAG中为语言偏好牺牲质量

Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

机构 * University of Washington(华盛顿大学)

AI总结 研究多语言RAG系统中模型对英语源文档的偏好,发现模型会牺牲文档相关性以迎合语言偏好,尤其在低资源语言中更明显。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24467 2026-06-09 cs.LG stat.ML 版本更新

Interpretable Self-Supervised Learning via Representer Landmarks and Nyström Approximation

通过表征地标和Nyström近似的可解释自监督学习

Maedeh Zarvandi, Michael Timothy, Theresa Wasserer, Debarghya Ghoshdastidar

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich, TUM School of Computation, Information and Technology(慕尼黑技术大学,TUM计算、信息与技术学院)

AI总结 提出KREPES框架,利用表征地标和Nyström近似,对自监督学习目标(SimCLR、BYOL、VICReg)学到的表征进行可解释性分析,并引入新指标量化透明度。

Comments 24 pages, 10 figures. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06891 2026-06-09 cs.LG cs.CR 版本更新

Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks

奖励投毒攻击下的鲁棒上下文强化学习

Paulius Sasnauskas, Yiğit Yalın, Goran Radanović

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada.(阿尔伯塔大学计算机科学系,加拿大埃德蒙顿) Alberta Machine Intelligence Institute (Amii), Edmonton, Canada.(阿尔伯塔机器智能研究所(Amii),加拿大埃德蒙顿)

AI总结 针对奖励投毒攻击,提出对抗训练框架AT-DPT,通过同时训练攻击者和DPT模型,显著提升上下文强化学习在赌博机环境下的鲁棒性,并泛化到MDP等复杂场景。

Comments ICML 2026, code available at https://github.com/PauliusSasnauskas/AT-DPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02606 2026-06-09 cs.SD cs.AI cs.CR cs.LG eess.AS

De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks

De-AntiFake:重新思考对抗语音克隆攻击的保护扰动

Wei Fan, Kejiang Chen, Chang Liu, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一种两阶段净化方法,旨在提升对抗语音克隆攻击的防御效果,通过净化扰动语音并利用音素指导进行优化,实验表明其优于现有方法。

Comments Accepted by ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10341 2026-06-09 cs.LG cs.CL 版本更新

Formalizing Learning from Language Feedback with Provable Guarantees

从语言反馈中学习的形式化与可证明保证

Wanqiao Xu, Allen Nie, Ruijie Zheng, Aditya Modi, Adith Swaminathan, Ching-An Cheng

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09252 2026-06-09 cs.LG

On the Importance of Embedding Norms in Self-Supervised Learning

关于嵌入范数在自监督学习中的重要性

Andrew Draganov, Sharvaree Vadgama, Sebastian Damrich, Jan Niklas Böhm, Lucas Maes, Dmitry Kobak, Erik Bekkers

机构 * University of Amsterdam(阿姆斯特丹大学)

AI总结 本文研究了嵌入范数在自监督学习中的作用,通过理论分析和实验表明范数影响收敛速度和网络置信度,且较小的范数对应意外样本。

Journal ref International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06295 2026-06-09 cs.LG cs.AI cs.CL 版本更新

dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching

dLLM-Cache:基于自适应缓存的扩散大语言模型加速

Zhiyuan Liu, Yicun Yang, Yaojie Zhang, Junjie Chen, Chang Zou, Qingyan Wei, Shaobo Wang, Yichen Zhu, Linfeng Zhang

机构 * Zhejiang University(浙江大学)

AI总结 针对扩散大语言模型推理延迟高的问题,提出一种无需训练的自适应缓存框架dLLM-Cache,通过长间隔提示缓存和基于特征相似性的部分响应更新,实现高效中间计算复用,在保持输出质量的同时大幅降低FLOPs。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏