arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 709
2602.06486 2026-07-15 cs.AI 版本更新

JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

JADE:面向开放式专业任务的专家基础动态评估

Lanbo Lin, Jiayao Liu, Tianyuan Yang, Li Cai, Yuanwu Xu, Lei Wei, Sicong Xie, Guannan Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 提出JADE双层评估框架,结合专家知识与动态声明级评估,解决开放式专业任务中严格性与灵活性的矛盾,在BizBench等基准上提升稳定性并揭示关键失败模式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04029 2026-07-15 cs.DB cs.AI cs.LG 版本更新

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

PluRel: 合成数据解锁关系基础模型的扩展定律

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

机构 * Stanford University(斯坦福大学) SAP Labs LLC(SAP实验室)

AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04689 2026-07-15 cs.CL cs.AI 版本更新

Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

大语言模型评估的自适应测试:一种替代静态基准的心理测量方法

Peiyu Li, Xiuxiu Tang, Si Chen, Ying Cheng, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学)

AI总结 研究针对大语言模型评估成本高、现有协议不合理的问题,提出基于项目反应理论的自适应测试框架ATLAS,通过Fisher信息引导选项目,减少90%项目数仍保持精度,能重构准确率,还可在准确率相当模型中提供精细区分。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17034 2026-07-14 cs.CL cs.LG 版本更新

KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

KVEraser: 学习操控KV缓存以实现高效的局部上下文擦除

Mufei Li, Shikun Liu, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

AI总结 提出KVEraser方法,通过学习操控KV缓存实现局部上下文擦除,避免全局重计算,在长上下文任务中接近全重算性能且延迟仅增加24%。

Comments Oral at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models; Code available at https://github.com/Graph-COM/KVEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06065 2026-07-14 cs.CL cs.SD eess.AS 版本更新

Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

多任务学习还不够:双输出第二语言语音识别中的表示纠缠

Seung Hwan Cho, Young-Min Kim

机构 * KAIST(韩国科学技术院)

AI总结 针对双输出第二语言语音识别,研究发现多任务学习导致表面转录性能下降,归因于编码器级别的表示纠缠,尤其在英语中随表面-意义差异增大而加剧。

Comments 5 pages, 2 figures, Accepted to the 43rd International Conference on Machine Learning Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24956 2026-07-14 cs.CL 版本更新

NITP: Next Implicit Token Prediction for LLM Pre-training

NITP:面向LLM预训练的下一隐式令牌预测

Xiangdong Zhang, Debing Zhang, Shaofeng Zhang, Xiaohan Qin, Yu Cheng, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出NITP方法,通过在表示空间中添加密集连续监督来增强离散令牌预测,以解决标准下一令牌预测中潜在表示空间约束不足的问题,并在0.5B至9B参数模型上取得一致性能提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15868 2026-07-14 cs.CV 版本更新

SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval

SOLAR:用于对称多模态检索的自监督联合学习

Wenjie Yang, Hang Yu, Yuyu Guo, Peng Di

机构 * Ant Group(蚂蚁集团)

AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。

Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11504 2026-07-14 cs.LG cs.CR 版本更新

CTFusion: A CTF-based Benchmark for LLM Agent Evaluation

CTFusion: 一种基于CTF的LLM代理评估基准

Dongjun Lee, Ga-eun Bae, Insu Yun

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

AI总结 本文提出CTFusion,一种基于CTF的评估框架,通过减少竞争影响和数据污染,提升对LLM代理的评估可靠性。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026. Revised to match the camera-ready version. OpenReview: https://openreview.net/forum?id=aUSUvS4dPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18576 2026-07-14 cs.AI 版本更新

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

基于序列贝叶斯更新的语义信念的代理预测

Kevin Murphy

机构 * Department of Computer Science(计算机科学系) University of British Columbia(不列颠哥伦比亚大学)

AI总结 BLF系统通过语义信念状态、层级多试聚合和层级校准方法,在预测基准上超越了现有方法,同时具备低泄露率的回测框架。

Comments v4 adds 2 new appendices: app J evaluates a "generative" Bayesian alternative to BLF (which does worse than the "discriminative" approached used by BLF), and app K sketches how to do value of information computation to decide when to stop searching (although this idea has not been tried). v4 also adds a few more recent references

Journal ref v3 was published in ICML AI Forecasting workshop 2026 (https://forecasting-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17776 2026-07-14 cs.CL 版本更新

DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation

DEER:用于评估深度研究代理在专家报告生成上的基准

Janghoon Han, Heegyu Kim, Changho Lee, Dahm Lee, Min Hyung Park, Hosung Song, Stanley Jungkyu Choi, Moontae Lee, Honglak Lee

AI总结 DEER是一个用于评估深度研究代理在专家报告生成中性能的基准,通过系统化的评估标准和主张验证架构,提升报告质量和逻辑完整性。

Comments ICML 2026 (45 pages, 12 figures, 25 tables, 129 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19806 2026-07-14 cs.CY cs.CL cs.MA 版本更新

LLM-Based Social Simulations Require a Boundary

基于大语言模型的社会模拟需要边界

Zengqing Wu, Run Peng, Takayuki Ito, Makoto Onizuka, Chuan Xiao

机构 * Osaka University(大阪大学) Nagoya University(名古屋大学) University of Michigan(密歇根大学) Kyoto University(京都大学)

AI总结 探讨基于大语言模型的社会模拟,指出其因输出同质化限制对复杂社会动态行为多样性的捕捉。通过回顾研究发现验证实践与问题异质性要求不符,建议匹配验证深度、明确报告方差并合理限制结论,倡导有边界意识的方法为社会科学提供见解。

Comments ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09776 2026-07-14 cs.LG 版本更新

TimeSAE: Causal Sparse Decoding for Faithful Explanations of Black-Box Time Series Models

TimeSAE:用于对黑箱时间序列模型进行忠实解释的因果稀疏解码

Khalid Oublal, Quentin Bouniot, Qi Gan, Stephan Clémençon, Zeynep Akata

机构 * Telecom Paris(电信巴黎大学) Institut Polytechnique de Paris(巴黎理工学院) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

AI总结 针对黑箱时间序列模型难以解释且缺乏泛化能力的问题,基于稀疏自编码器概念引入TimeSAE框架,通过在合成和真实数据集上广泛评估并与基线比较,证明该框架能提供更忠实、稳健的模型解释。

Comments Accepted at ICML 2026

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21833 2026-07-14 cs.LG 版本更新

Memory Savings at What Cost? A Study of Alternatives to Backpropagation

以何种代价节省内存?反向传播替代方案研究

Kunjal Panchal, Sunav Choudhary, Yuriy Brun, Hui Guan

机构 * College of Information and Computer Sciences, University of Massachusetts, Amherst(信息与计算机科学学院,马萨诸塞大学阿默斯特分校) Adobe, San Jose(Adobe公司,圣乔斯)

AI总结 研究比较BP、检查点BP、FmAD和ZO在LLM及视觉语言模型训练中的表现,发现FmAD和ZO虽省内存但有计算成本等问题,带检查点的BP在多方面更优,纠正了此前关于LLM优化的片面基准测试观点。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14411 2026-07-14 cs.LG cs.AI cs.RO 版本更新

Adaptive Reinforcement Learning for Unobservable Random Delays

用于不可观测随机延迟的自适应强化学习

John Wikman, Alexandre Proutiere, David Broman

机构 * KTH Royal Institute of Technology(皇家理工学院)

AI总结 研究现实动态环境中智能体与系统交互因延迟导致标准强化学习假设不成立的问题,提出交互层框架,在此基础上开发ACDA算法,能自适应处理不可观测和时变延迟,在多种环境中性能显著优于现有方法。

Comments Published at ICML 2026 (https://openreview.net/forum?id=QpgIOT06k3)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20578 2026-07-13 cs.LG math.OC stat.ML 版本更新

Upper-Linearizability of Online Non-Monotone DR-Submodular Maximization over Down-Closed Convex Sets

在线非单调DR-子模最大化在下闭凸集上的上线性化

Yiyang Lu, Haresh Jadav, Mohammad Pedramfar, Ranveer Singh, Vaneet Aggarwal

机构 * Purdue University(普渡大学) IIT Indore(印度理工学院Indore) Mila - Quebec AI Institute/McGill University(魁北克AI研究所/麦吉尔大学)

AI总结 本文提出了一种将非单调DR-子模最大化问题转化为在线线性优化的方法,实现了O(T^{1/2})的静态后悔和改进的动态后悔保证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026): https://icml.cc/virtual/2026/poster/64472

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23391 2026-07-10 cs.LG cs.NA math.NA 版本更新

Coupling-Robust Accuracy in Multiphysics Physics Informed Neural Networks via Kronecker-Preconditioned Optimization

通过Kronecker预条件优化实现多物理场物理信息神经网络的耦合鲁棒精度

Youngjae Park, Jaemin Kim, Junghwa Hong

机构 * Dept. of Control and Instrumentation Engineering, Korea University, Sejong, South Korea(控制与仪器工程系,韩国大学,世宗,韩国) BK21 FOUR Smart Mobility Education and Research Team, Korea University, Sejong, South Korea(BK21 FOUR智能交通教育与研究团队,韩国大学,世宗,韩国)

AI总结 针对多物理场耦合PINN在强耦合下精度退化问题,通过神经正切核分析证明标准NTK谱半径随耦合强度γ呈Ω(γ²)增长,而块对角Gauss-Newton预条件使谱半径有界于网络数S,结合Kronecker预条件优化器SOAP与逆梯度范数损失平衡实现耦合鲁棒精度。

Comments Extended version of AI4Physics Workshop accepted paper (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12726 2026-07-10 cs.LG 版本更新

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02998 2026-07-10 cs.LG stat.ME stat.ML 版本更新

Multi-Distribution Robust Conformal Prediction

多分布鲁棒共形预测

Yuqi Yang, Ying Jin

机构 * Mathematics Department, The Hong Kong University of Science(香港科学与技术大学数学系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Data Science, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学数据科学)

AI总结 研究在多源分布下构建一致有效的共形预测集问题,提出最大\(p\)聚合方案,证明其最优性并给出学习一致性分数算法,实验表明该方法能在多分布上提供有效覆盖率且减小集合大小。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03202 2026-07-09 math.ST stat.ML stat.TH 版本更新

Sharp Inequalities between Total Variation and Hellinger Distances for Gaussian Mixtures

高斯混合的总变差与Hellinger距离之间的尖锐不等式

Joonhyuk Jung, Chao Gao

AI总结 本文建立了紧支撑混合分布下高斯位置混合的总变差与Hellinger距离之间的上界,并构造序列证明其尖锐性,从而解决了Jia等人(2023)提出的开放问题,并给出了总变差下学习高斯混合的熵特征以及Hellinger距离下的最优鲁棒估计。

Comments 36 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02712 2026-07-09 cs.LG cs.CL 版本更新

Towards Understanding Steering Strength

理解引导强度

Magamed Taimeskhanov, Samuel Vaiter, Damien Garreau

AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。

Comments Accepted for publication at ICML 2026 (50 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21003 2026-07-09 eess.AS 版本更新

Query-Based Asymmetric Modeling with Decoupled Input-Output Rates for Speech Restoration

基于解耦输入输出速率的基于查询的语音恢复非对称建模

Ui-Hyeop Shin, Jaehyun Ko, Woocheol Jeong, Hyung-Min Park

AI总结 研究语音恢复中输入输出采样率不同的问题,提出基于查询的xSFI建模框架TF-Restormer,通过特定编码合成方式及多种损失训练,在多采样率基准测试中无需冗余重采样实现保真度与感知质量平衡。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09595 2026-07-09 cs.AI cs.CL cs.LG 版本更新

LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?

Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang, Yueqi Ren, Jirong Yang, Ayoung Lee, Shitanshu Bhushan, Lu Wang

机构 * University of Michigan(密歇根大学)

AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏