arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 709
2602.13517 2026-07-07 cs.CL 版本更新

Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量

Wei-Lin Chen, Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌)

AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07488 2026-07-07 cs.LG cs.AI stat.ML 版本更新

Deriving Neural Scaling Laws from the statistics of natural language

从自然语言统计中推导神经缩放定律

Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart

AI总结 研究从自然语言统计推导神经缩放定律,分离出语言关键统计属性预测神经缩放指数,给出基于这些统计量的简单公式,与实验测量定律匹配。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15199 2026-07-07 cs.LG stat.ML 版本更新

Interpretability and Generalization Bounds for Learning Spatial Physics

学习空间物理的可解释性与泛化界

Alejandro Francisco Queiruga, Theo Gutman-Solo, Shuai Jiang

机构 * OpenAI Google(谷歌) Sandia National Laboratories(桑迪亚国家实验室)

AI总结 利用数值分析技术,严格量化了应用于线性微分方程的机器学习模型在参数发现或求解中的准确性、收敛率和泛化界,并基于格林函数表示引入科学模型的可解释性视角。

Comments To appear in ICML 2026. 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16893 2026-07-07 cs.CL 版本更新

Predicting the Emergence of Induction Heads in Language Model Pretraining

预测语言模型预训练中归纳头的出现

Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan Schneider

机构 * Department of Linguistics, Georgetown University(语言学系,乔治城大学)

AI总结 研究训练数据统计特性与归纳头形成关系,通过自然和合成数据设置,发现简单公式可预测归纳头形成点,表面二元重复频率等影响其形成并找到决策边界,局部依赖也影响其形成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06422 2026-07-07 cs.CV 版本更新

Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO

通过在基于流的GRPO中对逐步和长期采样效应建模来缓解稀疏奖励

Yunze Tong, Mushui Liu, Canyu Zhao, Didi Zhu, Wanggui He, Shiyi Zhang, Hongwei Zhang, Peng Zhang, Jinlong Liu, Hao Jiang

AI总结 研究在基于流的GRPO中缓解奖励稀疏问题,提出TurningPoint-GRPO框架,用逐步增量奖励替代基于结果的奖励,识别转折点并赋予长期奖励,有效利用奖励信号提升图像生成效果。

Comments Accepted by ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02908 2026-07-07 cs.LG cs.AI cs.CV stat.ML 版本更新

A Random Matrix Theory Perspective on the Consistency of Diffusion Models

扩散模型一致性的随机矩阵理论视角

Binxu Wang, Jacob Zavatone-Veth, Cengiz Pehlevan

AI总结 研究扩散模型在不同数据集子集训练时输出相似的原因,用随机矩阵理论框架量化有限数据集对去噪器和采样映射期望及方差的影响,揭示交叉分割不一致的因素并验证对模型行为的预测。

Comments 58 pages, 45 figures. Accepted as an Oral Presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02190 2026-07-07 stat.ML cs.LG 版本更新

PCA of probability measures: Sparse and Dense sampling regimes

概率测度的主成分分析:稀疏与密集采样机制

Gachon Erell, Jérémie Bigot, Elsa Cazelles

AI总结 研究在双渐近情形下对多个概率测度进行主成分分析,通过\(m\)个样本观察\(n\)个概率测度,推导经验协方差算子和主成分分析超额风险的收敛率\(n^{-1/2} + m^{-\alpha}\),证明密集情形下速率是极小极大最优的。

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22652 2026-07-07 stat.ML cs.LG 版本更新

Spectral Gradient Descent Mitigates Anisotropy-Driven Misalignment: A Case Study in Phase Retrieval

谱梯度下降减轻各向异性驱动的失准:相位恢复的案例研究

Guillaume Braun, Han Bao, Wei Huang, Masaaki Imaizumi

AI总结 研究谱梯度方法在非线性相位检索模型中的作用机制,通过动力学分析发现梯度下降存在方差诱导失准,谱梯度下降可消除此效应,实现稳定对齐和加速噪声收缩,数值实验证实理论。

Comments Revised version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06148 2026-07-07 cs.CY cs.AI cs.CL 版本更新

Large Language Models Develop Novel Social Biases Through Adaptive Exploration

大语言模型通过适应性探索形成新的社会偏见

Addison J. Wu, Ryan Liu, Xuechunzi Bai, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

AI总结 研究大语言模型在无固有差异时能否形成新社会偏见,用心理学范式证明其能形成,导致任务分配不公平,新模型更严重,还探索干预措施,发现激励探索可减少分层。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22999 2026-07-07 stat.ML cs.AI cs.LG 版本更新

JADAI: Jointly Amortizing Adaptive Design and Bayesian Inference

JADAI:联合摊销自适应设计与贝叶斯推理

Niels Bracher, Lars Kühmichel, Desi R. Ivanova, Xavier Intes, Paul-Christian Bürkner, Stefan T. Radev

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) TU Dortmund University(多特蒙德技术大学) University of Oxford(牛津大学)

AI总结 针对设计变量可优化以最大化信息增益的参数估计问题,引入JADAI框架,通过端到端训练策略、历史网络和推理网络联合摊销贝叶斯自适应设计与推理,在标准基准测试中性能优越。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20757 2026-07-07 cs.CL cs.LG 版本更新

TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior

TokSuite:衡量分词器选择对语言模型行为的影响

Gül Sena Altıntaş, Malikeh Ehghaghi, Brian Lester, Fengyuan Liu, Wanru Zhao, Marco Ciccone, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Google DeepMind(谷歌DeepMind) McGill University(麦吉尔大学) University of Cambridge(剑桥大学) Hugging Face

AI总结 提出TokSuite,含模型集合与基准测试,通过不同分词器的预训练模型及多语言鲁棒性基准测试,解耦分词器影响,阐明多种流行分词器优缺点。

Comments ICML 2026. 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08854 2026-07-07 cs.CV cs.LG 版本更新

Is Generation Required for Data-Efficient Perception?

数据高效感知是否需要生成模型?

Jack Brady, Bernhard Schölkopf, Thomas Kipf, Simon Buchholz, Wieland Brendel

AI总结 研究生成式与非生成式方法实现组合泛化的程度,通过理论刻画归纳偏差,表明生成范式可能更易实现组合泛化,实验发现生成式方法泛化性更好。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15684 2026-07-07 cs.LG cs.AI cs.CE 版本更新

Walrus: A Cross-Domain Foundation Model for Continuum Dynamics

海象:用于连续介质动力学的跨域基础模型

Michael McCabe, Payel Mukhopadhyay, Tanya Marwah, Bruno Regaldo-Saint Blancard, Francois Rozet, Cristiana Diaconu, Lucas Meyer, Kaze W. K. Wong, Hadi Sotoudeh, Alberto Bietti, Irina Espejo, Rio Fear, Siavash Golkar, Tom Hehir, Keiya Hirashima, Geraud Krawezik, Francois Lanusse, Rudy Morel, Ruben Ohana, Liam Parker, Mariel Pettee, Jeff Shen, Kyunghyun Cho, Miles Cranmer, Shirley Ho

AI总结 研究针对物理模拟中机器学习的挑战,通过新方法如谐波分析稳定、负载均衡训练策略等,开发基于Transformer的基础模型Walrus,在多场景预训练,实验表明其性能优于现有模型。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04221 2026-07-07 cs.CL cs.AI cs.LG 版本更新

Context Tuning for In-Context Optimization

上下文调整用于上下文优化

Jack Lu, Ryan Teehan, Zhenbang Yang, Mengye Ren

机构 * Agentic Learning AI Lab(智能代理学习AI实验室)

AI总结 介绍上下文调整方法,利用模型固有上下文学习能力从示例初始化可训练记忆表示并优化,提升少样本适应能力,在多基准测试中表现优于其他方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24380 2026-07-07 cs.LG 版本更新

APEX: Approximate-but-exhaustive search for ultra-large combinatorial synthesis libraries

APEX:针对超大组合合成库的近似但详尽搜索

Aryan Pedawi, Jordi Silvestre-Ryan, Bradley Worley, Darren J Hsu, Kushal S Shah, Elias Stehle, Jingrong Zhang, Izhar Wallach

机构 * Numerion Labs(Numerion实验室) NVIDIA(英伟达)

AI总结 研究超大组合合成库虚拟筛选难题,提出APEX方法,利用神经网络代理,能在一分钟内在消费级GPU上实现完全枚举,可精确检索近似top-k集,性能优于其他方法。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19098 2026-07-07 cs.GT cs.CY 版本更新

Desirable Effort Fairness and Optimality Trade-offs in Strategic Learning

战略学习中理想的努力公平性与最优性权衡

Valia Efthymiou, Ekaterina Fedorova, Chara Podimata

AI总结 研究战略学习中决策规则与策略性适应特征的主体间的互动,将问题构建为约束优化问题,给出理论保证并通过实验展示准确性与理想努力公平性间的权衡。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18020 2026-07-07 cs.LG cs.CR stat.ML 版本更新

Tight Stability Bounds for Robust Distributed Learning: Byzantine Failures Hurt Generalization More than Data Poisoning

稳健分布式学习的紧密稳定性界限:拜占庭故障对泛化的损害大于数据中毒

Thomas Boudou, Batiste Le Bars, Nirupam Gupta, Aurélien Bellet

机构 * Inria(法国国家信息与自动化技术研究院) Inserm(法国国家医学院) Univ. Lille(里尔大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

AI总结 研究稳健分布式学习中拜占庭故障和数据中毒两种威胁模型对泛化的影响,通过算法稳定性分析,首次揭示拜占庭故障导致的泛化速率比数据中毒更差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14007 2026-07-07 cs.LG cs.AI 版本更新

Conditional Clifford-Steerable CNNs for PDE Modeling

用于偏微分方程建模的条件克利福德可控卷积神经网络

Bálint László Szarvas, Maksim Zhdanov

机构 * University of Amsterdam(阿姆斯特丹大学) AMLab(AML实验室)

AI总结 介绍条件克利福德可控卷积神经网络框架,指出标准形式内核基础不完整,通过输入特征场等变表示增强内核,推导等变约束并有效求解,在多个偏微分方程预测任务中表现出色。

Comments Published at ICML 2026

Journal ref The Forty-Third International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11259 2026-07-07 cs.LG cs.AI 版本更新

ICR-RL: Deep Reinforcement Learning via In-Context Regression

ICR-RL:通过上下文回归实现深度强化学习

David Schiff, Ofir Lindenbaum, Yonathan Efroni

机构 * Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学)

AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。

Comments Accepted to ICML 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23845 2026-07-07 cs.LG cs.AI cs.CL cs.CY 版本更新

Position: Use Sparse Autoencoders to Discover Unknowns

定位:使用稀疏自编码器发现未知因素

Kenny Peng, Rajiv Movva, Jon Kleinberg, Emma Pierson, Nikhil Garg

机构 * Cornell University(康奈尔大学) UC Berkeley(伯克利大学)

AI总结 研究围绕稀疏自编码器(SAEs)的不同观点,指出其虽在作用于已知概念时效果欠佳,但在发现未知概念上很强大,还给出了在机器学习及社会健康科学等方面的应用案例。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20412 2026-07-07 cs.SE cs.AI cs.OS 版本更新

kAgent: An execution-guided crash resolution agent for the Linux kernel

kAgent:一种用于Linux内核的执行引导式崩溃修复代理

Alex Mathai, Chenxi Huang, Suwei Ma, Jihwan Kim, Hailie Mitchell, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Junfeng Yang, Baishakhi Ray

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Google Inc.(谷歌公司) Google DeepMind(谷歌DeepMind)

AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。

Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28589 2026-07-03 cs.AI 版本更新

Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

从推理中寻找真理:一种用于引导LLM轨迹的动态表示编辑框架

Tianlong Wang, Yuhang Wang, Weibin Liao, Xin Gao, Xinyu Ma, Yang Lin, Yasha Wang, Liantao Ma

机构 * ByteDance Inc.(字节跳动公司) Huawei Technologies Co., Ltd(华为技术有限公司) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

AI总结 提出DynaSteer动态表示编辑框架,通过模式聚类和Fisher-LDA提取纯净真理,并基于前瞻熵选择性引导轨迹,提升LLM推理真实性。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30295 2026-07-03 cs.CL cs.AI 版本更新

MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings

MedCase-Structured:用于在临床真实EHR环境中基准测试诊断推理的文本到FHIR数据集

Valentina Bui Muti, Eugénie Dulout, Ziquan Fu

机构 * System Inc.(系统公司)

AI总结 提出一个从非结构化文本生成临床真实HL7 FHIR R4数据集的流水线,构建MedCase-Structured数据集,发现LLMs在结构化FHIR输入上的诊断准确性低于纯文本,强调部署对齐基准测试的重要性。

Comments Accepted to ICML 2026 Structured Data for Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11020 2026-07-03 cs.LG cs.AI cs.RO 版本更新

Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

信任区域逆强化学习:利用局部策略更新的显式双上升

Anish Diwan, Davide Tateo, Christopher E. Mower, Haitham Bou-Ammar, Jan Peters, Oleg Arenz

机构 * Technical University of Darmstadt(达姆斯塔特技术大学) Lund University(隆德大学) German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) Robotics Institute Germany (RIG)(德国机器人研究所(RIG)) Huawei, Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

AI总结 本文提出TRIRL算法,通过信任区域优化策略更新,实现奖励函数的单调改进,避免对抗方法的不稳定性,提升多任务表现。

Comments Accepted as a conference paper at the International Conference on Machine Learning (ICML) 2026. Revised to include review feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23065 2026-07-03 cs.CY cs.SE 版本更新

What Should Frontier AI Developers Disclose About Internal Deployments?

前沿AI开发者应披露关于内部部署的哪些信息?

Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。

Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12198 2026-07-03 physics.comp-ph cond-mat.mtrl-sci cs.AI 版本更新

Grounded autonomous scrutiny at scale: emergent critique from reproduction of published computational physics papers

迈向有根的自主研究:一个端到端的LLM微型研究循环在已发表的计算物理学中的应用

Haonan Huang

机构 * Department of Physics, Princeton University(普林斯顿大学物理系)

AI总结 本文提出一个端到端的LLM微型研究循环,用于在已发表的计算物理学中进行自主研究,通过大规模和深度测试展示其在复现、批评和扩展研究中的能力。

Comments v2: camera-ready version, accepted at ICML 2026 AI for Science Workshop. Corrects the phase-classification statistics and adds a coding-sensitivity analysis (Methods M6); the agent-produced six-page Comment is reproduced as-is in the final appendix. 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏