arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-02 至 2026-06-02 共收录 220
2510.03259 2026-06-02 cs.LG cs.AI

Verifying Meta-Awareness via Predictive Rewards in Reasoning Models

通过推理模型中的预测奖励验证元意识

Yoonjeon Kim, Doohyuk Jang, Eunho Yang

机构 * Yoonjeon Kim, Doohyuk Jang, Eunho Yang

AI总结 提出 MAPR 方法,利用自生成任务预测推理统计量(长度、通过率、概念)来增强模型的元意识,从而在多个数学推理基准上显著提升准确率和训练效率。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24808 2026-06-02 cs.AI

Query Circuits: Explaining How Language Models Answer User Prompts

查询电路:解释语言模型如何回答用户提示

Tung-Yu Wu, Fazl Barez

机构 * University of Oxford(牛津大学)

AI总结 提出查询电路方法,通过直接追踪模型内部信息流来忠实解释特定输入如何产生输出,并引入归一化偏差忠实度(NDF)度量及采样方法实现稀疏电路发现。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24696 2026-06-02 cs.LG cs.AI

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP:基于在线偏好反馈的测试时个性化

Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Shenzhen Loop Area Institute(深圳河套学院) Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03456 2026-06-02 stat.ML cs.LG

Off-Policy Learning in Large Action Spaces: Optimization Matters More Than Estimation

大动作空间中的离线策略学习:优化比估计更重要

Imad Aouali, Otmane Sakhi

机构 * Criteo AI Lab(Criteo AI实验室)

AI总结 本文研究离线上下文强盗中的离线策略学习,发现现有方法在大动作空间中面临严重优化问题,提出使用加权对数似然目标可改善优化并取得竞争性策略。

Comments ICML '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05641 2026-06-02 cs.CL cs.AI cs.LG

Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills

基于技能的混合专家模型:通过推断技能实现异构推理的自适应路由

Justin Chih-Yao Chen, Sukwon Yun, Elias Stengel-Eskin, Tianlong Chen, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出Skill-MoE框架,通过推断查询所需技能进行实例级专家选择,并采用批推理策略降低开销,在单GPU上集成16个专家模型,在多个推理基准上平均提升8.15%。

Comments ICML 2026 (Camera-Ready). The first three authors contributed equally. Project Page: https://skill-moe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10882 2026-06-02 cs.LG stat.ML

Global Convergence of Adaptive Sensing for Principal Eigenvector Estimation

主特征向量估计的自适应传感的全局收敛性

Alex Saad-Falcon, Brighton Ancelin, Justin Romberg

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA, USA(电子与计算机工程学院,佐治亚理工学院,亚特兰大,GA,USA)

AI总结 本文分析Oja算法的一种压缩变体,利用每样本两个自适应测量估计协方差矩阵的主特征向量,证明了期望正弦平方误差的收敛速率并给出信息论下界,揭示了压缩带来的维度代价。

Comments Accepted at ICML 2026. 34 pages (9 main text + appendices), 4 figures, 2 tables. v2 (camera-ready) adds a matching information-theoretic lower bound and a non-adaptive lower-bound separation across three powers of d; substantially revised from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20016 2026-06-02 cs.LG

Position: Neglecting the Sustainability of AI is Fuelling a Global AI Arms Race

立场:忽视人工智能的可持续性正在助长全球人工智能军备竞赛

Pedram Bakhtiarifard, Pınar Tözün, Christian Igel, Raghavendra Selvan

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Robotics Section, IT University of Copenhagen, Denmark(丹麦哥本哈根IT大学机器人学系)

AI总结 本文指出当前AI可持续性讨论忽视经济和社会维度,提出通过调和气候意识与资源意识、引入CARAML框架来遏制全球AI军备竞赛。

Comments Accepted to be presented at ICML 2026. Source code at https://github.com/saintslab/caraml

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04512 2026-06-02 cs.AI

Safety Must Precede the Deployment of Open-Ended AI

安全必须优先于开放式AI的部署

Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi, Ruta Binkyte, Mario Fritz

机构 * CISPA-Helmholtz Center of Information Security(CISPA-海德堡信息安全中心) MPI for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(智能系统Max Planck研究所、图宾根ELLIS研究所、图宾根人工智能中心)

AI总结 本文提出开放式AI系统因自主无限生成新行为而带来预测性丧失、新兴错位和控制困难等独特安全挑战,需在部署前主动研究,并给出挑战分类和研究方向。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06308 2026-06-02 cs.LG cs.AI

Stability Analysis of Sharpness-Aware Minimization

锐度感知最小化的稳定性分析

Hoki Kim, Jinseong Park, Yujin Choi, Jaewook Lee

机构 * Chung-Ang University, South Korea(Chung-Ang 大学,韩国) Korea Institute for Advanced Study, South Korea(韩国高级研究院) Ulsan National Institute of Science(乌山国家科学研究院) Nanyang Technological University (NTU), Singapore(南洋理工大学(NTU),新加坡) Seoul National University, South Korea(首尔国立大学,韩国)

AI总结 研究SAM在鞍点附近的收敛不稳定性,通过动力系统理论证明鞍点成为吸引子,并发现动量与批次大小可缓解该问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏