arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-21 至 2026-05-21 共收录 47
2605.21488 2026-05-21 cs.LG

Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning

平衡推理器:学习吸引子使推理可扩展

Benhao Huang, Zhengyang Geng, Zico Kolter

机构 * CMU(卡内基梅隆大学)

AI总结 本文提出平衡推理器(EqR),通过学习任务条件的吸引子来实现可扩展推理,该方法在测试时无需外部验证器或任务特定先验,通过增加深度和广度实现推理能力的提升,从而在Sudoku-Extreme上将准确率从2.6%提升至超过99%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21475 2026-05-21 cs.LG

Is Fixing Schema Graphs Necessary? Full-Resolution Graph Structure Learning for Relational Deep Learning

关系预测任务是否需要固定模式图?关系深度学习中的全分辨率图结构学习

Yi Huang, Qingyun Sun, Jia Li, Xingcheng Fu, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University, Beijing, China(信息与电子学院,北京航空航天大学,北京,中国) Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University, Guilin, China(教育区块链与智能技术重点实验室,教育部,广西师范大学,桂林,中国)

AI总结 本文提出了一种全分辨率且可优化的图结构学习框架FROG,用于关系深度学习,将关系结构学习建模为可学习的表角色建模问题,允许表作为节点和边在信息传递中发挥作用,并设计了基于角色的信息传递机制,以捕捉关系语义,同时通过功能依赖约束确保语义一致性,实验表明该方法在多个下游任务中优于现有方法。

Comments Accepted by the Forty-third International Conference on Machine Learning (ICML2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21343 2026-05-21 cs.CV

OcclusionFormer: Arranging Z-Order for Layout-Grounded Image Generation

OcclusionFormer: 布局导向图像生成中的Z轴顺序安排

Ziye Li, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China(大数据研究院,计算机科学与人工智能学院,复旦大学,中国)

AI总结 本文提出OcclusionFormer,一种基于Z轴顺序的扩散变换框架,通过解耦实例并利用体积渲染进行合成,以解决布局到图像模型中物体间遮挡问题,并通过查询对齐损失提升空间精度和语义一致性。

Comments ICML 2026, Project Page: https://henghuiding.com/OcclusionFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21308 2026-05-21 cs.CV cs.AI

Deformba: Vision State Space Model with Adaptive State Fusion

Deformba:具有自适应状态融合的视觉状态空间模型

Hongyu Ke, Jack Morris, Yongkang Liu, Satoshi Kitai, Kentaro Oguchi, Yi Ding, Haoxin Wang

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

AI总结 本文提出Deformba,一种能够动态增强空间结构信息并保持状态空间模型线性复杂度的自适应方法,通过多模态融合(如交叉注意力)提升视觉任务的性能,展示了在2D和3D视觉任务中的广泛适用性。

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21280 2026-05-21 cs.CV

Let EEG Models Learn EEG

让EEG模型学习EEG

Yifan Wang, Yijia Ma, Wen Li, Chenyu You

机构 * Stony Brook University(石溪大学) University of Texas Health Center at Houston(德克萨斯大学健康中心(休斯顿))

AI总结 本文提出了一种基于条件流匹配的生成框架JET,通过直接建模神经信号的连续演化来生成高质量的EEG信号,解决了传统离散去噪方法在捕捉长期时间依赖性和保持频谱结构方面的不足,实现了在多个基准测试中优于现有方法的性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21241 2026-05-21 cs.LG

Divide and Contrast: Learning Robust Temporal Features without Augmentation

划分与对比:无需增强学习鲁棒的时间特征

Abdul-Kazeem Shamba, Kerstin Bach, Gavin Taylor

机构 * Department of Computer Science, Norwegian University of Science(挪威科学与技术大学计算机科学系) Department of Computer Science, United States Naval Academy(美国海军学院计算机科学系)

AI总结 本文提出Di-COT框架,通过对比时间窗口内的信息子结构而非单个时间步,实现了无需数据增强和多编码器传递的自监督学习,从而在六个大规模真实世界数据集和UCR/UEA基准上取得了最先进的性能,同时显著减少了训练时间。

Comments Published in the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21094 2026-05-21 cs.LG

UOTIP: Unbalanced Optimal Transport Map for Unpaired Inverse Problems

UOTIP:用于无配对逆问题的不平衡最优传输映射

Donggyu Lee, Taekyung Lee, Jaewoong Choi

机构 * Sungkyunkwan University(成均馆大学) IPAI (Interdisciplinary Program in Artificial Intelligence, Seoul National University)(人工智能跨学科项目(Seoul National University)) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

AI总结 本文提出了一种基于不平衡最优传输的逆问题求解器UOTIP,通过引入基于似然的成本函数,将重建任务建模为从噪声测量分布到干净信号分布的学习过程,从而在无配对逆问题上实现了最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21082 2026-05-21 cs.AI

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21070 2026-05-21 cs.LG

Towards Understanding Self-Pretraining for Sequence Classification

向序列分类中的自预训练理解迈进

Omar Coser, Loredana Zollo, Paolo Soda, Antonio Orvieto

机构 * Unit of Artificial Intelligence & Computer Systems, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,罗马生物医学学院) Unit of Advanced Robotics and Human-Centered Technologies, Università Campus Bio-Medico di Roma(先进机器人与以人为本技术单位,罗马生物医学学院) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入部门,辐射物理,生物医学工程,乌梅拉大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 本文通过复制和系统消融Amos等人的研究,揭示了自预训练(SPT)在序列分类中提升性能的关键因素,发现标签监督在学习有用的查询-键注意力模式方面存在瓶颈,并通过简化理论框架证明了自预训练通过学习接近性交互来提升性能。

Comments v1: Preliminary, extension of the version accepted at ICML 2025 Workshop MOSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20965 2026-05-21 cs.CV cs.AI

Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

在不遗忘的情况下寻找正确的视觉证据:通过层间视觉注意力差异减轻LVLMs中的幻觉

Yutong Xie, Zhenglin Hua, Ran Wang, Wing W. Y. Ng, Xizhao Wang, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Artificial Intelligence, Shenzhen University, Shenzhen, China(深圳大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China(深圳大学计算机科学与软件工程学院) Engineering, South China University of Technology, Guangzhou, China(华南理工大学工程学院) National Engineering Laboratory for Big Data Systems Computing Technology, Shenzhen University, Shenzhen, China(深圳大学大数据系统计算技术国家工程实验室) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),中华人民共和国教育部)

AI总结 本文提出了一种基于层间视觉注意力差异的幻觉缓解方法,通过增强视觉证据的注意力来减少视觉遗忘,从而在不遗忘的情况下找到正确的视觉证据。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20839 2026-05-21 cs.CV cs.LG

Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models

无需激活的图像识别回骨:在MetaFormer风格视觉模型中的多项式替代方案

Jeffrey Wang, Jonathan Gregory, Grigorios G. Chrysos

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出无需激活函数的多项式替代方法,用于在MetaFormer风格的视觉模型中实现图像识别,展示了多项式模块在多个数据集上的优越性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20821 2026-05-21 cs.CV cs.RO

VSCD: Video-based Scene Change Detection in Unaligned Scenes

VSCD: 基于视频的非对齐场景变化检测

Jiae Yoon, Ue-Hwan Kim

机构 * Department of AI Convergence, Gwangju Institute of Science(人工智能融合系,全州科学研究院) GIST InnoCORE AI-Nano Convergence Institute for Early Detection of Neurodegenerative Diseases, Gwangju Institute of Science(全州科学研究院AI-纳米融合研究所,用于早期检测神经退行性疾病的机构)

AI总结 本研究提出VSCD,一种用于非对齐场景中视频基变化检测的方法,通过查询帧生成像素级变化掩码,利用多参考模型和局部补丁对应来对齐参考特征,并融合候选变化特征以生成高分辨率掩码,实现了优于现有图像和视频基基线的性能。

Comments 18 pages, 7 figures. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20758 2026-05-21 cs.AI cs.CV cs.LG cs.RO

Conflict-Aware Additive Guidance for Flow Models under Compositional Rewards

面向组合奖励的冲突感知加法引导:流模型中的对抗性生成

Xuehui Yu, Fucheng Cai, Meiyi Wang, Xiaopeng Fan, Harold Soh

机构 * Smart Systems Institute, National University of Singapore, Singapore(新加坡国立大学智能系统研究所) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 本文提出了一种面向组合奖励的冲突感知加法引导方法,用于在流模型中处理对抗性生成问题,通过动态检测和解决梯度冲突来纠正离曼福德漂移,提升了生成保真度。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20723 2026-05-21 cs.LG

Memory-Efficient Partitioned DNN Inference on Resource-Constrained Android Crowds

在资源受限的Android蜂窝中实现内存高效的分区DNN推理

Lakshani Manamperi, Disumi Pathirana, Thiwanka Pathirana, Nipun Premarathna, Kutila Gunasekera

机构 * Department of Computer Science and Engineering, University of Moratuwa, Moratuwa, Sri Lanka(计算机科学与工程系,莫图瓦大学,莫图瓦,斯里兰卡)

AI总结 本文提出了一种在资源受限的Android设备上实现高效DNN推理的方法,通过五个机制将内存压力分散到多个设备上,从而在不修改模型的情况下实现ONNX推理,显著降低了电池消耗和延迟。

Comments 6 pages, 3 figures, 4 tables. Accepted at the ICML 2026 Workshop on Machine Learning for the Global South

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20678 2026-05-21 cs.LG cs.AI

Dynamic TMoE: A Drift-Aware Dynamic Mixture of Experts Framework for Non-Stationary Time Series Forecasting

动态TMoE:一种针对非平稳时间序列预测的漂移感知动态专家混合框架

Jiawen Zhu, Shuhan Liu, Di Weng, Yingcai Wu

机构 * School of Software Technology, Zhejiang University, Ningbo, China State Key Lab of CAD\&CG, Zhejiang University, Hangzhou, China

AI总结 本文提出Dynamic TMoE框架,通过动态构建异构专家和剪枝冗余专家来优化容量,并利用时间记忆路由器确保稳定且上下文感知的专家选择,从而在非平稳时间序列预测中实现更优性能。

Comments 27 pages, 7 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20642 2026-05-21 cs.LG

Same Target, Different Basins: Hard vs. Soft Labels for Annotator Distributions

相同目标,不同盆地:标注者分布中的硬标签与软标签

Mirerfan Gheibi, Gashin Ghazizadeh

机构 * Independent Researcher(独立研究者)

AI总结 本文研究了在标注者分布中硬标签与软标签的区别,发现当每个示例的标注数量较少时,硬标签方法在性能上优于软标签训练,尤其是在稀疏经验目标远离完整标注者分布时效果更佳。

Comments 14 pages, 12 figures. Accepted to the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML @ ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20581 2026-05-21 cs.LG cond-mat.mtrl-sci

TriForces: Augmenting Atomistic GNNs for Transferable Representations

TriForces: 为可迁移表示增强原子istic GNNs

Ali Ramlaoui, Alexandre Duval, Hannah Bull, Victor Schmidt, Hugues Talbot, Fragkiskos D. Malliaros, Joseph Musielewicz

机构 * Université Paris-Saclay, CentraleSupélec, Inria, Gif-sur-Yvette, France(巴黎-萨克雷大学,中央超算研究所,法国国家信息与自动化技术研究院,法国吉夫-sur-耶vette)

AI总结 TriForces通过分离组成和结构信息并结合自监督学习,提升MatBench和QM9的性能,无需DFT标签,并在OMat24上实现高效相似结构检索。

Comments 28 pages, 11 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13475 2026-05-21 cs.CV

FedHPro: Federated Hyper-Prototype Learning via Gradient Matching

FedHPro: 通过梯度匹配实现联邦超原型学习

Huan Wang, Jun Shen, Haoran Li, Zhenyu Yang, Jun Yan, Ousman Manjang, Yanlong Zhai, Di Wu, Guansong Pang

机构 * School of Computing and Information Technology, University of Wollongong, Wollongong, Australia(计算机与信息科技学院,沃尔灵戈大学,澳大利亚) School of Computing and Information Systems, Singapore Management University, Singapore, Singapore(计算机与信息系统学院,新加坡管理大学,新加坡) Monash University, Australia(莫纳什大学,澳大利亚) Macquarie University, Australia(麦考瑞大学,澳大利亚) Beijing Institute of Technology, China(北京理工大学,中国) La Trobe University, Australia(拉筹伯大学,澳大利亚)

AI总结 本文提出FedHPro框架,通过引入超原型和梯度匹配来提升联邦学习中的类别分离度和类别内一致性,实验表明其在多个基准数据集上达到最优性能。

Comments 23 pages, ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10603 2026-05-21 cs.CV

Segment Anything with Robust Uncertainty-Accuracy Correlation

具有鲁棒不确定性和准确性相关性的分割任何东西

Hongyou Zhou, Marc Toussaint, Ling Shao, Zihan Ye

机构 * Technical University of Berlin(柏林技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出了一种名为RUAC的分割方法,通过引入轻量级不确定性头和对抗性训练,提高在外观和形变转移下的像素级不确定性估计,从而提升分割质量和不确定性准确性相关性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29183 2026-05-21 cs.LG cs.AI

IMPACT: Influence Modeling for Open-Set Time Series Anomaly Detection

IMPACT: 开集时间序列异常检测中的影响建模

Xiaohui Zhou, Yijie Wang, Hongzuo Xu, Weixuan Liang, Xiaoli Li, Guansong Pang

机构 * National Key Laboratory of Parallel and Distributed Computing(国家级并行与分布式计算实验室) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室(IGDL)) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

AI总结 本文提出IMPACT框架,通过影响建模方法解决开集时间序列异常检测中的挑战,通过学习影响函数生成真实异常模式并净化训练数据。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14392 2026-05-21 cs.LG cs.RO

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems

WestWorld: 一种知识编码的可扩展轨迹世界模型用于多样化机器人系统

Yuchen Wang, Jiangtao Kong, Sizhe Wei, Xiaochang Li, Haohong Lin, Hongjue Zhao, Tianyi Zhou, Lu Gan, Huajie Shao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出WestWorld,一种知识编码的可扩展轨迹世界模型,用于多样化机器人系统,通过引入系统感知的混合专家(Sys-MoE)和结构嵌入来提升可扩展性和零样本泛化能力,实现了在多种机器人环境中的高效轨迹预测和控制。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18532 2026-05-21 cs.CV cs.AI cs.RO

VLANeXt: Recipes for Building Strong VLA Models

VLANeXt: 构建强大VLA模型的配方

Xiao-Ming Wu, Bin Fan, Kang Liao, Jian-Jian Jiang, Runze Yang, Yihang Luo, Zhonghua Wu, Wei-Shi Zheng, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文通过统一框架和评估设置重新审视VLA设计空间,系统分析了基础组件、感知要素和动作建模视角,总结出12项关键发现,提出了一种简单有效的VLA模型VLANeXt,并在LIBERO和LIBERO-plus基准测试中超越了现有方法,同时提供了易于使用的代码库。

Comments Accepted in ICML 2026, Project Page: https://dravenalg.github.io/VLANeXt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06862 2026-05-21 cs.CV

Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing

参数作为专家:通过动态参数路由适应视觉模型

Meng Lou, Stanley Yu, Yizhou Yu

机构 * The University of Hong Kong(香港大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出ParaX方法,通过动态参数路由机制实现视觉模型的高效微调,以生成更定制化和强大的特征表示,从而在多种视觉识别任务中取得优越性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06500 2026-05-21 cs.LG

Can Microcanonical Langevin Dynamics Leverage Mini-Batch Gradient Noise?

微 canonical 动力学能否利用小批量梯度噪声?

Emanuel Sommer, Kangning Diao, Jakob Robnik, Uros Seljak, David Rügamer

机构 * Department of Statistics, LMU Munich(统计系,慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Physics, University of California, Berkeley(伯克利大学物理系) Department of Astronomy, Tsinghua University(清华大学天文系) Physics Division, Lawrence Berkeley National Lab(伯克利国家实验室物理部)

AI总结 本文研究了微 canonical 动力学能否有效利用小批量梯度噪声,提出了一种梯度噪声预条件化方案和能量方差基于的自适应调节器,从而开发出一种鲁棒且可扩展的微 canonical 采样器,实现了在高维推断任务中的最佳性能。

Comments In Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02660 2026-05-21 cs.AI

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS:模块化代理与反思搜索用于自动化AI研究

Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究)

AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。

Comments Paper published at International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01273 2026-05-21 cs.CV

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。

Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21662 2026-05-21 cs.LG

Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching

通过黎曼流匹配对预训练视觉语言模型进行知识不确定性量化

Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学信息科技系) Science for Life Laboratory, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学生命科学实验室)

AI总结 本文提出REPVLM方法,通过黎曼流匹配在视觉语言模型嵌入的超球面流形上计算概率密度,以量化模型的知识不确定性,并在分类和异常检测中取得显著效果。

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18577 2026-05-21 cs.CV cs.LG

Self-Refining Video Sampling

自 refining 视频采样

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Saining Xie, Jaehong Yoon, Sung Ju Hwang

AI总结 本文提出了一种自 refining 视频采样方法,通过预训练的视频生成器作为自身 refine 器,无需外部验证器或额外训练,在推理时实现迭代内部循环 refine,提高了运动一致性和物理对齐性。

Comments ICML 2026. Project page: https://agwmon.github.io/self-refine-video/

详情

展开后加载摘要…

URL PDF HTML 收藏