arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-06-01 至 2026-06-01 共收录 158
2605.26121 2026-06-01 cs.LG cs.AI

GEM: Geometric Entropy Mixing for Optimal LLM Data Curation

GEM: 用于最优LLM数据策展的几何熵混合

Yue Min, Ziyun Qiao, Ruining Chen, Yujun Li

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) Peking University, Beijing, China(北京大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25134 2026-06-01 cs.LG cs.AI

Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate

重参数化、权重衰减和自适应学习率下稀疏优化的理论分析

Huangyu Xu, Jingqin Yang, Qianqian Xu, Jiaye Teng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国) Beijing Academy of Artificial Intelligence (BAAI), Beijing, China(北京人工智能研究院(BAAI),北京,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能院,北京,中国) School of Statistics and Management, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学统计与管理学院,上海,中国) Institute of Data Science and Statistics, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学数据科学与统计研究所,上海,中国)

AI总结 针对稀疏优化中的不稳定问题,提出基于重参数化、权重衰减和自适应学习率的ReWA方法,通过改善优化景观实现比ℓ1正则化更好的稀疏性,同时保持测试精度。

Comments 32 pages, 5 figures. Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20176 2026-06-01 q-bio.BM cs.LG

Cross-Chirality Generalization by Axial Vectors for Hetero-Chiral Protein-Peptide Interaction Design

通过轴向向量实现异手性蛋白质-肽相互作用设计的跨手性泛化

Ziyi Yang, Zitong Tian, Yinjun Jia, Tianyi Zhang, Jiqing Zheng, Hao Wang, Yubu Su, Juncai He, Lei Liu, Yanyan Lan

机构 * Department of Chemistry, Tsinghua University, Beijing, China(清华大学化学系) School of Life Sciences, Tsinghua University, Beijing, China(清华大学生命科学学院) Anew Labs, Shanghai, China(Anew实验室) Tsinghua-Peking Center for Life Sciences, Beijing, China(清华大学-北京大学生命科学中心) Ministry of Education Key Laboratory of Bioorganic Phosphorus Chemistry and Chemical Biology, Tsinghua University, Beijing, China(教育部生物有机磷化学与化学生物学重点实验室) Center for Synthetic and Systems Biology, Tsinghua University, Beijing, China(合成与系统生物学中心) Beijing Frontier Research Center for Biological Structure, Tsinghua University, Beijing, China(北京生物结构前沿研究中心) Qiuzhen College, Tsinghua University, Beijing, China(齐臻学院) Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(叶德平数学科学中心) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学) AI Industry Research Innovation Center,Wuxi Research Institute for Applied Technologies, Tsinghua University(人工智能产业研究创新中心,无锡应用技术研究院,清华大学)

AI总结 提出向E(3)等变(极)向量特征注入轴向特征的方法,结合潜在扩散模型实现从同手性训练数据到异手性设计任务的跨手性泛化,首次通过湿实验验证了生成式AI从头设计D-肽结合物的有效性。

Comments v3: Revised acknowledgements only. The paper has been accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07482 2026-06-01 cs.LG cs.AI

How does Bayesian Sampling help Membership Inference Attacks?

贝叶斯采样如何帮助成员推断攻击?

Zhenlong Liu, Wenyu Jiang, Feng Zhou, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Nanjing University(南京大学计算机科学系) Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和统计学系,中国人民大学)

AI总结 提出贝叶斯成员推断攻击(BMIA),通过拉普拉斯近似对单个参考模型进行贝叶斯采样以估计条件分数分布,理论证明降低模型内方差从而提升攻击性能,并在多模态数据集上实现最先进的效果与效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24535 2026-06-01 cs.CR cs.LG

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21470 2026-06-01 cs.LG cs.AI

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

面向延迟优化的Web Agent规划与调度的Agent即时编译

Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

机构 * Stanford University(斯坦福大学)

AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21108 2026-06-01 cs.LG cs.AI

Efficient Learning of Deep State Space Models via Importance Smoothing

通过重要性平滑高效学习深度状态空间模型

John-Joseph Brady, Nikolas Nusken, Yunpeng Li

机构 * Centre for Oral, Clinical and Translational Sciences, King's College London, London, United Kingdom(口腔、临床与转化科学中心,伦敦国王学院,伦敦,英国) Department of Mathematics, King's College London, London, United Kingdom(数学系,伦敦国王学院,伦敦,英国)

AI总结 提出并行变分蒙特卡洛(PVMC)方法,结合变分推断和序贯蒙特卡洛,实现深度状态空间模型在判别与生成任务上的高效训练,速度提升10倍。

Comments Accepted to the proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18024 2026-06-01 cs.LG cs.AI cs.MA

Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning

交互破坏对抗学习框架用于鲁棒多智能体强化学习

Sunwoo Lee, Mingu Kang, Yonghyeon Jo, Seungyul Han

机构 * Graduate School of Artificial Intelligence, UNIST, Ulsan, South Korea(人工智能研究生院,UNIST,乌山,韩国)

AI总结 提出交互破坏对抗学习框架,从信息论角度构建攻击破坏智能体间交互,并训练智能体在干扰下可靠执行,提升鲁棒性。

Comments 9 pages for main, 33 pages for total, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17126 2026-06-01 stat.ML cs.LG stat.ME

Multi-task Linear Regression without Eigenvalue Lower Bounds: Adaptivity, Robustness, and Safety

无需特征值下界的多任务线性回归:自适应性、鲁棒性与安全性

Seok-Jin Kim

机构 * Columbia(哥伦比亚大学)

AI总结 针对存在污染任务的多任务线性回归问题,提出基于矩阵加权范数正则化的估计器,引入相对平衡条件,在弱谱假设下达到与现有方法相当的预测误差界,并具备安全性保证。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00747 2026-06-01 cs.CL cs.AI

Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training

将搜索与训练解耦:通过模型合并实现大规模语言模型预训练的数据混合缩放

Shengrui Li, Fei Zhao, Kaiyan Zhao, Jieying Ye, Haifeng Liu, Fangcheng Shi, Zheyong Xie, Yao Hu, Shaosheng Cao

机构 * NLP Team, Xiaohongshu Inc., Shanghai, China(小红书自然语言处理团队,小红书公司,上海,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

AI总结 提出DeMix框架,通过模型合并预测最优数据配比,在降低搜索成本的同时提升基准性能。

Comments 18 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15197 2026-06-01 cs.AI cs.CL cs.CV cs.RO

LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries

LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解

Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Zhongguancun Academy(北京中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhengzhou University(郑州大学) Beihang University(北航) East China Normal University(东华大学) DeepCybot Co., Ltd.(DeepCybot有限公司)

AI总结 针对VLA模型在训练中因数据偏差导致语言信息被忽略的问题,提出LangForce框架,通过贝叶斯分解和潜在动作查询构建双分支架构,最大化动作与指令的点互信息,无需新数据即可显著提升泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12579 2026-06-01 cs.LG

EEG-Based Multimodal Learning via Hyperbolic Mixture-of-Curvature Experts

基于EEG的多模态学习:曲率混合专家双曲空间方法

Runhe Zhou, Shanglin Li, Guanxiang Huang, Xinliang Zhou, Qibin Zhao, Motoaki Kawanabe, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) BIFOLD, Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) University of Cambridge, Cambridge, UK(剑桥大学)

AI总结 提出EEG-MoCE框架,通过可学习曲率的双曲空间为每个模态分配专家,并采用曲率感知融合策略,实现层次结构建模,在情绪识别、睡眠分期和认知评估任务上达到最优性能。

Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16165 2026-06-01 cs.LG cs.AI

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER: 具有显式信用分配的分层强化学习用于大型语言模型智能体

Jiangweizhi Peng, Yuanxin Liu, Ruida Zhou, Charles Fleming, Zhaoran Wang, Alfredo Garcia, Mingyi Hong

机构 * University of Minnesota Northwestern University Amazon AGI Texas A\&M University Cisco Research

AI总结 针对稀疏奖励长程任务中LLM智能体信用分配困难的问题,提出HiPER分层规划-执行框架,通过分层优势估计(HAE)在规划和执行层面显式分配信用,在ALFWorld和WebShop上达到97.4%和83.3%的成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06831 2026-06-01 cs.LG cs.AI

Why DDIM Hallucinates More Than DDPM: A Theoretical Analysis of Reverse Dynamics

为什么DDIM比DDPM更容易产生幻觉:反向动力学的理论分析

Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 通过理论分析高斯混合目标下的反向ODE(DDIM)和SDE(DDPM),证明在临界时间τ后DDIM会卡在两个最近模式之间的线段上,而DDPM的随机性帮助其脱离该区域从而避免幻觉。

Comments Accepted in ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05520 2026-06-01 cs.LG stat.AP stat.ML

Bayesian Rain Field Reconstruction using Commercial Microwave Links and Diffusion Model Priors

使用商业微波链路和扩散模型先验的贝叶斯雨场重建

Badr Moufad, Albina Ilina, Hai Victor Habi, Salem Lahlou, Yazid Janati, Hagit Messer, Eric Moulines

机构 * School of Electrical and Computer Engineering, Tel Aviv University, Tel Aviv, Israel(电气与计算机工程学院,特拉维夫大学,特拉维夫,以色列)

AI总结 提出将雨场重建视为贝叶斯逆问题,利用扩散模型作为高保真空间先验,通过无需训练的后验采样方法(如即插即用、序贯蒙特卡洛和副本交换)实现优于传统方法的性能。

Comments Added link to source code

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00265 2026-06-01 cs.LG

Polaris: Coupled Orbital Polar Embeddings for Hierarchical Concept Learning

Polaris: 用于层次概念学习的耦合轨道极坐标嵌入

Sahil Mishra, Srinitish Srinivasan, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校,新德里,印度) Indian Institute of Technology Delhi, Abu Dhabi, UAE(印度理工学院德里分校,阿布扎比,阿联酋) KDM Lab, Dhirubhai Ambani University Gandhinagar, Gujarat, India(KDM实验室,迪鲁布希阿姆巴尼大学冈丁加尔,古吉拉特邦,印度)

AI总结 提出Polaris极坐标超球面嵌入框架,通过角度和半径分离语义与层次,结合局部约束、全局正则化和不确定性感知非对称目标,在多种层次结构扩展任务中显著提升检索性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03216 2026-06-01 cs.CL cs.LG

Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection

Token Sparse Attention: 交错令牌选择的高效长上下文推理

Dongwon Jo, Beomseok Kang, Jiwon Song, Jae-Joon Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国)

AI总结 提出Token Sparse Attention,一种轻量级动态令牌级稀疏化机制,通过交错选择令牌并在注意力前后压缩/解压缩,实现高效长上下文推理,在128K上下文中获得高达3.23倍加速且精度损失小于1%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23436 2026-06-01 stat.ML cs.LG math.OC stat.CO

Inference of Online Newton Methods with Nesterov's Accelerated Sketching

带有Nesterov加速草图的在线牛顿方法的推断

Haoxuan Wang, Xinchen Du, Sen Na

机构 * School of Industrial and Systems Engineering, Georgia Institute of Technology(工业与系统工程系,佐治亚理工学院)

AI总结 针对在线牛顿方法推断计算成本高的问题,提出结合Hessian平均与Nesterov加速草图投影求解器的方法,在保持一阶方法$O(d^2)$复杂度下实现二阶方法的鲁棒性,并建立了全局收敛性、渐近正态性和在线协方差估计器。

Comments 52 pages, 2 tables, 3 figures; accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09429 2026-06-01 cs.CV cs.AI cs.LG

Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories

射线即像素:学习视频与相机轨迹的联合分布

Wonbong Jang, Shikun Liu, Soubhik Sanyal, Juan Camilo Perez, Kam Woh Ng, Sanskar Agrawal, Juan-Manuel Perez-Rua, Yiannis Douratsos, Tao Xiang

机构 * Meta AI

AI总结 提出一种视频扩散模型(Rays as Pixels),通过将相机表示为密集射线像素(raxels)并与视频帧共享潜在空间,联合去噪实现相机轨迹预测和相机控制视频生成。

Comments Accepted to ICML 2026. 9-page main paper plus supplementary material. Project page: https://wbjang.github.io/raysaspixels/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17551 2026-06-01 cs.LG cs.AI

SVL: Goal-Conditioned Reinforcement Learning as Survival Learning

SVL:目标条件强化学习作为生存学习

Franki Nguimatsia Tiofack, Fabian Schramm, Théotime Le Hellard, Justin Carpentier

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure, PSL Research University, Paris, France(巴黎高等师范学院,PSL研究大学)

AI总结 提出生存价值学习(SVL),通过将时间到目标建模为概率分布,将目标条件强化学习重构为生存学习问题,并利用危险模型进行最大似然估计,在离线基准上匹配或超越强基线方法。

Comments Accepted to the 43rd International Conference on Machine Learning, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15959 2026-06-01 cs.LG

Multi-Objective Bayesian Optimization via Adaptive \varepsilon-Constraints Decomposition

基于自适应 ε-约束分解的多目标贝叶斯优化

Yaohong Yang, Sammie Katt, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Espoo, Finland(阿尔托大学计算机科学系,芬兰 Espoo) ELLIS Institute Finland(芬兰 ELLIS 机构) Department of Computer Science, University of Manchester, Manchester, United Kingdom(曼彻斯特大学计算机科学系,英国 Manchester)

AI总结 提出STAGE-BO方法,通过自适应ε-约束分解将多目标优化转化为序列约束子问题,实现均匀帕累托覆盖并处理约束与偏好。

Comments 24 pages, 22 figures, 4 tables. Accepted at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09412 2026-06-01 stat.ML cond-mat.dis-nn cs.LG

Sharp description of local minima in the loss landscape of high-dimensional two-layer ReLU neural networks

高维两层ReLU神经网络损失景观中局部极小值的精确描述

Jie Huang, Bruno Loureiro, Stefano Sarao Mannelli

机构 * Physics, Chalmers University of Technology University of Gothenburg Ecole Normale Superieure, PSL \& CNRS Engineering, Chalmers University of Technology School of Computer Science Applied Mathematics, University of the Witwatersrand

AI总结 本文通过总结统计量精确刻画了高维两层ReLU神经网络损失景观中的局部极小值,并建立了与单次SGD的关联,揭示了过参数化对极小值稳定性和可达性的影响。

Comments 29 pages, 18 figures. Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18382 2026-06-01 cs.AI

From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

从弱线索到真实身份:评估LLM代理中推理驱动的去匿名化

Myeongseob Ko, Jihyun Jeong, Sumiran Singh Thakur, Gyuhak Kim, Ruoxi Jia

机构 * Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机工程系) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

AI总结 研究通过LLM代理结合分散的非识别线索与公开证据重建真实身份的能力,揭示了即使在没有明确标识符的情况下,代理也能以高成功率实现去匿名化,并提出了新的隐私评估维度。

Comments Accepted at ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17145 2026-06-01 cs.LG cs.AI

REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge

REAL: 面向LLM评判的回归感知强化学习

Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Texas at Austin(得克萨斯大学奥斯汀分校) Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)

AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。

Comments Accepted to ICML 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09453 2026-06-01 cs.LG cs.AI stat.ML

Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers

变分路由:用于校准混合专家Transformer的可扩展贝叶斯框架

Albus Yizhuo Li, Matthew Wicker

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)

AI总结 提出变分混合专家路由(VMoER),通过将贝叶斯推断限制在专家选择阶段,实现大规模模型的不确定性校准,在微调基础模型上显著提升路由稳定性、降低校准误差并提高分布外检测AUROC,且额外计算开销极小。

Comments 8 pages, 7 figures for main text; 16 pages for Appendix; Accepted by ICML 2026;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13875 2026-06-01 cs.CL cs.LG

GradMem: Learning to Write Context into Memory with Test-Time Gradient Descent

GradMem: 通过测试时梯度下降将上下文写入记忆

Yuri Kuratov, Matvey Kairov, Aydar Bulatov, Ivan Rodkin, Mikhail Burtsev

机构 * AXXX, Cognitive AI Systems Lab, Moscow, Russia(AXXX认知人工智能系统实验室,莫斯科,俄罗斯) London Institute for Mathematical Sciences, London, UK(伦敦数学科学研究所,伦敦,英国)

AI总结 提出GradMem方法,利用测试时梯度下降将上下文写入紧凑记忆状态,通过自监督重构损失优化记忆令牌,在键值检索和自然语言任务上优于前向式记忆写入方法。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09787 2026-06-01 cs.CV cs.LG

What is Missing? Explaining Neurons Activated by Absent Concepts

缺失的是什么?解释被缺失概念激活的神经元

Robin Hesse, Simone Schaub-Meyer, Janina Hesse, Bernt Schiele, Stefan Roth

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Department of Computer Science, Technical University of Darmstadt(达姆施塔特技术大学计算机科学系) Leibniz Institute for Resilience Research(莱比锡韧性研究所) Institute for Quantitative and Computational Biosciences, Johannes Gutenberg University Mainz(美因茨雅各布·冯·特利尔大学定量与计算生物科学研究所) University Medical Center Mainz(美因茨大学医学中心)

AI总结 针对深度神经网络中编码缺失(概念缺失导致神经元激活)这一被忽视的因果关系,提出两种扩展归因和特征可视化方法以揭示并解释这种缺失,实验表明ImageNet模型利用此类缺失且考虑它们可改善去偏。

Comments ICML 2025 | Code: https://github.com/visinf/what-is-missing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09221 2026-06-01 cs.LG

Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning

超越测试时记忆:用于LLM推理的状态空间最优控制

Peihao Wang, Shan Yang, Xijun Wang, Tesi Xiao, Xin Liu, Changlong Yu, Yu Lou, Pan Li, Zhangyang Wang, Ming Lin, René Vidal

机构 * vita-group(vita组)

AI总结 提出测试时控制(TTC)层,通过有限时域LQR规划实现推理,作为适配器集成到预训练LLM中,在数学推理任务上提升高达27.8%的准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏