arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11791
2605.18354 2026-05-19 cs.LG

Decoupled Conformal Optimisation: Efficient Prediction Sets via Independent Tuning and Calibration

解耦的符合优化:通过独立调优和校准实现高效的预测集

Fanyi Wu, Lihua Niu, Samuel Kaski, Michele Caprio

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) UKRI AI Centre for Doctoral Training in Decision Making for Complex Systems(UKRI人工智能博士培训中心(复杂系统决策)) Department of Computer Science, Aalto University(艾尔沃斯大学计算机科学系) ELLIS Institute, Finland(芬兰ELLIS研究所)

AI总结 本文提出了解耦的符合优化(DCO),通过独立的调优和校准步骤,实现了更高效的预测集生成,无需使用相同的验证数据进行调优和校准,从而在保证有限样本边际符合覆盖的同时,减少了预测集的大小或区间宽度。

Comments 33 pages, 6 figures, accepted by ICML 2026 Workshop: Epistemic Intelligence in Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18287 2026-05-19 cs.CV cs.RO

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

StableVLA: 向无额外数据的鲁棒视觉-语言-动作模型迈进

Yiyang Fu, Chubin Zhang, Shukai Gong, Yufan Deng, Kaiwei Sun, Qiyang Min, Qibin Hou, Yansong Tang, Jianan Wang, Daquan Zhou

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Nankai University(南开大学)

AI总结 本文研究了在未见真实世界视觉扰动下视觉-语言-动作(VLA)模型的鲁棒性问题,提出了一种基于信息理论的轻量级适配模块IB-Adapter,有效提升模型性能,同时保持高效和效果。

Comments Accepted by ICML 2026. Code: https://github.com/DAGroup-PKU/HumanNet. Project website: https://dagroup-pku.github.io/StableVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18233 2026-05-19 cs.CV

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

增强无列车无限帧生成以实现一致的长视频

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)

AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。

Comments Accepted by ICML 2026~

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20216 2026-05-19 cs.CL cs.AI cs.LG

Locally Coherent Parallel Decoding in Diffusion Language Models

局部相干并行解码在扩散语言模型中

Michael Hersche, Nicolas Menet, Ronan Tanios, Abbas Rahimi

机构 * IBM Research - Zurich(IBM瑞士研究实验室)

AI总结 本文提出CoDiLA方法,通过引入小型辅助自回归模型来解决扩散语言模型在并行解码中的相干性问题,从而在代码生成任务中实现更高的准确性和速度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10134 2026-05-19 cs.CR cs.AI cs.CL

Reverse-Engineering Model Editing on Language Models

语言模型上的逆向工程模型编辑

Zhiyu Sun, Minrui Luo, Yu Wang, Zhili Chen, Tianxing He

AI总结 本文研究了语言模型中参数编辑的漏洞,提出了一种名为KSTER的逆向工程攻击方法,通过利用参数更新的低秩结构恢复编辑数据,并提出subspace camouflage防御策略以降低重建风险。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00360 2026-05-19 cs.MA cs.AI cs.CY

Mapping Human Anti-collusion Mechanisms to Multi-agent AI Systems

将人类反串通机制映射到多智能体AI系统

Jamiu Idowu, Ahmed Almasoud, Ayman Alfahid

机构 * Sahel AI, Sahel Group Inc.(萨赫尔人工智能,萨赫尔集团有限公司) Prince Sultan University(普林斯顿国王大学) Majmaah University(马吉玛大学)

AI总结 本文研究如何将人类长期积累的反串通机制应用于多智能体AI系统,通过建立机制分类并提出实现方法,同时指出开放挑战如责任归属、身份流动性、边界问题和对抗性适应等。

Comments Accepted to ICML 2026 Workshop on Technical AI Governance Research (TAIGR); Published in Knowledge-Based Systems Journal

Journal ref Idowu, J., Almasoud, A. S., & Alfahid, A. (2026). Mapping human anti-collusion mechanisms to multi-agent AI systems. Knowledge-Based Systems, 344(116067), 116067. https://doi.org/10.1016/j.knosys.2026.116067

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01537 2026-05-19 cs.SD cs.AI cs.IT cs.LG eess.SP math.IT

Two-Dimensional Quantization for Geometry-Aware Audio Coding

二维量化用于几何感知的音频编码

Tal Shuster, Eliya Nachmani

机构 * School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Be’er Sheva, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)

AI总结 本文提出了一种二维量化方法Q2D2,通过将特征对投影到结构化的2D网格上,提高了音频压缩效率,同时保持了最先进的重建质量。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26745 2026-05-19 cs.LG cs.AI cs.CL stat.ML

Deep sequence models tend to memorize geometrically; it is unclear why

深度序列模型倾向于记忆几何学;不清楚为何

Shahriar Noroozizadeh, Vaishnavh Nagarajan, Elan Rosenfeld, Sanjiv Kumar

机构 * Machine Learning Department \& Heinz College, Carnegie Mellon University, Pittsburgh, PA, USA Google Research, NY, USA

AI总结 研究探讨了深度序列模型中原子事实的存储机制,发现几何记忆能编码全局关系,即使在训练中未共现的实体间也能建立联系,挑战了传统关联记忆的观点。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05482 2026-05-19 cs.LG stat.ML

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Van Khoa Nguyen, Lionel Blondé, Alexandros Kalousis

机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系)

AI总结 本文提出了一种基于Stein扩散引导的训练自由后验校正方法,用于在高密度区域之外进行采样。该方法结合了随机最优控制和Stein变分推断,通过引入新的理论界和运行成本函数,实现了在低密度区域的有效引导。

Comments Revised version accepted to the ICML 2026 main track; prior version accepted to two ICLR 2026 workshops: ReALM-GEN and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02463 2026-05-19 stat.ML cs.LG

Distribution Transformers: Fast Approximate Bayesian Inference With On-The-Fly Prior Adaptation

分布变换器:通过实时先验适应实现快速近似贝叶斯推断

George Whittle, Juliusz Ziomek, Jacob Rawling, Maike A. Osborne

机构 * Mind Foundry Ltd(Mind Foundry有限公司)

AI总结 本文提出分布变换器,一种能够学习任意分布到分布映射的新型架构,通过实时先验适应实现快速近似贝叶斯推断,显著降低计算时间并达到与现有方法相当或更优的对数似然性能。

Comments Spotlight acceptance at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18072 2026-05-19 cs.SD

MusicDET: Zero-Shot AI-Generated Music Detection

MusicDET: 零样本AI生成音乐检测

Chaolei Han, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院,南京210096,中国) School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院,南京210096,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),教育部,中国) Purple Mountain Laboratories, Nanjing 210000, China(紫金山实验室,南京210000,中国) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education, China(区块链应用、监督与管理工程研究中心(东南大学),教育部,中国)

AI总结 本文提出MusicDET框架,通过频率引导的归一化流模型在无生成样本情况下实现零样本AI生成音乐检测,有效识别非分布音乐信号。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18055 2026-05-19 cs.LG cs.AI

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: 通过图结构的潜在扩散对齐实现基础模型表示以空间基因表达预测

Qi Si, Penglei Wang, Yushuai Wu, Yifeng Jiao, Xuyang Liu, Xin Guo, Yuan Qi, Yuan Cheng

机构 * Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China.(上海交通大学生物医学工程学院) Incubation Institute, Fudan University, Shanghai, China.(复旦大学孵化院)

AI总结 本文提出FLAG框架,通过图结构的潜在扩散对齐方法,解决空间基因表达预测中的基因协调和空间分布关系问题,并引入基因维度诅咒的概念,通过空间图编码器和基因基础模型对齐来提升模型的结构一致性与基因间保真度。

Comments 9 pages for main text, 3 pages for references, 19 pages for appendix. accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18028 2026-05-19 cs.LG cs.AI

FedSDR: Federated Self-Distillation with Rectification

FedSDR: 带校正的联邦自我蒸馏

Ziheng Ren, Zhanming Shen, Hao Wang, Ning Liu, You Song

机构 * Beijing University of Aeronautics(北京航空航天大学) Zhejiang University(浙江大学) Shandong University(山东大学) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本文提出FedSDR,一种改进的联邦自我蒸馏方法,通过引入双重流机制来解决联邦学习中数据分布不匹配和幻觉问题,提升模型的准确性和一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18004 2026-05-19 cs.LG

RL4RLA: Teaching ML to Discover Randomized Linear Algebra Algorithms Through Curriculum Design and Graph-Based Search

RL4RLA: 通过课程设计和基于图的搜索教机器学习发现随机线性代数算法

Jinglong Xiong, Xiaotian Liu, Ruoxin Wang, Zihang Liu, Yefan Zhou, Yujun Yan, Yaoqing Yang

机构 * Pratt School of Engineering, Duke University, Durham, NC, USA(杜克大学工程学院) Department of Computer Science, Dartmouth College, Hanover, NH, USA(达特茅斯学院计算机科学系)

AI总结 本文提出RL4RLA框架,通过课程设计和基于图的搜索自动化发现可解释的符号随机线性代数算法,展示了其在重发现状态-of-the-art方法和优化算法性能方面的贡献。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 9 pages main text; 21 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17989 2026-05-19 cs.CL cs.AI

Predictive Prefetching for Retrieval-Augmented Generation

检索增强生成的预测预取

Wuyang Zhang, Shichao Pei

机构 * Department of Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系)

AI总结 本文提出了一种先进的异步检索框架,通过预测检索触发时机和所需信息,以减少延迟并提高生成效率,同时保持回答质量。

Comments Accepted by Forty-third International Conference on Machine Learning ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17850 2026-05-19 stat.ML cs.CV cs.LG cs.NA math.NA math.PR

Simple Approximation and Derivative Free Inference-Time Scaling for Diffusion Models via Sequential Monte Carlo on Path Measures

通过路径测度的序列蒙特卡洛实现扩散模型的简单近似与无导数推理时间缩放

Chenyang Wang, Weizhong Wang, Yinuo Ren, Jose Blanchet, Yiping Lu

机构 * School of Mathematical Sciences, Peking University, Beijing, China School of Mathematical Sciences, Fudan University, Shanghai, China Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Management Science \& Engineering, Stanford University, Stanford, CA, United States

AI总结 本文提出URGE算法,一种无需梯度的推理时间缩放方法,通过路径重要性重加权提升扩散模型样本质量,同时在合成测试和扩散模型基准中表现出色,且实现简单且无梯度依赖。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17827 2026-05-19 cs.LG cs.AI

Content-Style Identification via Differential Independence

通过微分独立性进行内容-风格识别

Subash Timilsina, Hoang-Son Nguyen, Sagar Shrestha, Xiao Fu

机构 * School of Electrical Engineering and Computer Science, Oregon State University, Corvallis, Oregon, USA(电气工程与计算机科学学院,俄勒冈州立大学,科瓦利斯,俄勒冈,美国)

AI总结 本文提出了一种新的结构条件,即内容-风格微分独立性(CSDI),用于在内容和风格可能依赖的情况下实现生成分析中的可识别性,通过在雅可比子空间上施加块状正交约束,并设计了基于数值雅可比近似的随机正则化器以支持高维生成模型。

Comments 24 pages, 15 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15622 2026-05-19 cs.LG

Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered

位置:深度学习中零阶优化被低估,而非无能

Sijia Liu, Yicheng Lang, Soumyadeep Pal, Changsheng Wang, Yancheng Huang, Chongyu Fan, James Diffenderfer, Bhavya Kailkhura, Yihua Zhang

机构 * OPTML Lab, Michigan State University, USA(密歇根州立大学OPTML实验室) Lawrence Livermore National Laboratory, USA(劳伦斯利弗莫尔国家实验室)

AI总结 本文探讨了深度学习中零阶优化(ZO)的局限性,指出其被低估而非无能,并提出了六个涵盖算法、系统和评估层面的立场,强调通过控制方差、方差-查询权衡和方向导数视角重新审视ZO方法的可行性,同时指出三个未被充分利用的机会,包括子空间和谱观点、ZO作为系统优势的通信效率以及去模糊化ZO评估与任务复杂性之间的关系。

Comments Accepted by ICML 2026 Position Paper Track as a Spotlight Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15487 2026-05-19 cs.LG cs.CV eess.IV

Learning Normalized Energy Models for Linear Inverse Problems

学习归一化能量模型以解决线性逆问题

Nicolas Zilberstein, Santiago Segarra, Eero Simoncelli, Florentin Guth

机构 * Rice University(里士满大学) Flatiron Institute(Flatiron研究所) New York University(纽约大学)

AI总结 本文提出了一种新的能量模型,用于解决线性逆问题,通过引入基于协方差的正则化项来提高不同测量条件下的一致性,从而计算出归一化的后验密度,无需额外训练或微调,同时实现了能量引导的自适应采样、无偏的Metropolis-Hastings修正步骤以及通过贝叶斯规则估计退化算子。

Comments ICML 2026

Journal ref Int'l Conf Machine Learning (ICML), Jul 2026. https://openreview.net/forum?id=PlFJwgaaDK

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11975 2026-05-19 cs.LG

Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning

随机最小成本到达-避免强化学习

Jingduo Pan, Taoran Wu, Yiling Xue, Bai Xue

机构 * Key Laboratory of System Software (Chinese Academy of Sciences), Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院系统软件重点实验室,软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学交叉学科学院,中国科学院大学,北京,中国)

AI总结 本文研究了随机最小成本到达-避免强化学习问题,提出了一种新的方法来在满足概率至少p的到达-避免约束的同时最小化预期累积成本。通过引入到达-避免概率证书(RAPCs)和基于收缩的Bellman公式,该方法能够将到达-避免考虑整合到强化学习中,并在概率约束下实现成本优化。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11817 2026-05-19 cs.RO cs.CV

See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

Yixu Feng, Zinan Zhao, Yanxiang Ma, Chenghao Xia, Chengbin Du, Yunke Wang, Chang Xu

机构 * The University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出了一种基于可微网格采样的视觉-语言-动作模型压缩方法,通过连续的token重采样保留关键空间信息,实现高达90%的计算量减少而不影响性能。

Journal ref Proceedings of the Forty-third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17487 2026-05-19 cs.CL

Answer Only as Precisely as Justified: Calibrated Claim-Level Specificity Control for Agentic Systems

仅在必要时精确回答:用于代理系统的校准断言特异性控制

Tianyi Huang, Samuel Xu, Jason Tansong Dang, Samuel Yan, Kimberley Yin

AI总结 本文研究了代理系统因过于精确而失败的问题,提出了一种称为组合选择性特异性(CSS)的方法,通过分解回答为断言、提出更粗略的退化方案,并在最合适的校准级别发出每个断言,从而提高风险-效用权衡。

Comments Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16429 2026-05-19 cs.LG cs.AI cs.CV physics.ao-ph

(Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models

(稀疏) 注意细节:在基于机器学习的天气预测模型中保持频谱保真度

Maksim Zhdanov, Ana Lucic, Max Welling, Jan-Willem van de Meent

机构 * AMLab(AM实验室) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文提出Mosaic模型,通过学习功能扰动生成集合成员,并利用网格对齐的块稀疏注意力机制,在原分辨率网格上操作,以线性成本捕捉长距离依赖关系,从而在1.5°分辨率下达到或超越更精细分辨率模型的性能,实现了状态-of-the-art结果。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03308 2026-05-19 cs.CL cs.AI

Old Habits Die Hard: How Conversational History Geometrically Traps LLMs

旧习惯难改:对话历史如何几何学地困住大语言模型

Adi Simhi, Fazl Barez, Martin Tutek, Yonatan Belinkov, Shay B. Cohen

机构 * Technion - Israel Institute of Technology(技术ion-以色列理工学院) University of Oxford(牛津大学) University of Zagreb, FER(Zagreb大学,FER) Kempner Institute, Harvard University(Kempner研究所,哈佛大学) University of Edinburgh(爱丁堡大学)

AI总结 研究探讨对话历史如何通过几何陷阱影响大语言模型的后续表现,提出History-Echoes框架从概率和几何两个角度分析对话历史偏差,并揭示行为持续性在潜在空间中的几何陷阱。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21841 2026-05-19 cs.CL

Embodied Task Planning via Graph-Informed Action Generation with Large Language Models

通过大型语言模型的图引导动作生成进行具身任务规划

Xiang Li, Ning Yan, Masood Mortazavi

机构 * Purdue University(普渡大学) Futurewei Technologies(未来科技)

AI总结 本文提出GiG框架,通过图神经网络编码环境状态并构建动作连接执行轨迹图,结合有限前瞻性模块提升具身代理的规划能力,在三个具身规划基准测试中取得显著性能提升。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06163 2026-05-19 cs.CV cs.LG

Forget-It-All: Multi-Concept Machine Unlearning via Concept-Aware Neuron Masking

Forget-It-All: 通过概念感知神经元掩码实现多概念机器去学习

Kaiyuan Deng, Bo Hui, Gen Li, Jie Ji, Minghai Qin, Geng Yuan, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) The University of Tulsa(塔尔萨大学) Clemson University(克莱姆森大学) Western Digital Corporation(西部数据公司) University of Georgia(佐治亚大学)

AI总结 该研究提出Forget-It-All框架,通过利用模型稀疏性,解决多概念去学习问题,有效提升去学习效果并保持生成质量。

Comments Accepted to ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11089 2026-05-19 stat.ML cs.LG

TPV: Parameter Perturbations Through the Lens of Test Prediction Variance

TPV:通过测试预测方差的透镜进行参数扰动分析

Devansh Arpit

机构 * Modelable AI(可建模人工智能)

AI总结 本文引入测试预测方差(TPV)作为分析训练后鲁棒性的统一框架,通过研究参数扰动对模型输出的一阶敏感性,揭示了SGD噪声、标签噪声、量化和剪枝等机制的统一视角,并提出了基于TPV的剪枝准则和模型选择方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16309 2026-05-19 cs.CV cs.LG

Sparse Autoencoders are Topic Models

稀疏自编码器是主题模型

Leander Girrbach, Zeynep Akata

机构 * Technical University of Munich (TUM), Munich Center for Machine Learning (MCML), Helmholtz Munich(慕尼黑技术大学(TUM)、慕尼黑机器学习中心(MCML)、海德堡-慕尼黑研究所)

AI总结 本文提出将稀疏自编码器(SAEs)视为主题模型的新视角,通过构建连续主题模型(CTM)来解释嵌入空间,并推导出SAE的目标作为最大后验估计器,从而揭示SAE特征是主题性组件而非可调节方向。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏