arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11746
2510.24668 2026-07-27 cs.CL cs.AI 版本更新

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14562 2026-07-27 cs.LG math.OC 版本更新

LiMuon: Light and Fast Muon Optimizer for Large Models

LiMuon: 面向大模型的轻量快速Muon优化器

Feihu Huang, Yuning Luo, Songcan Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出LiMuon优化器,结合动量方差缩减与随机SVD,在降低内存的同时实现更低的样本复杂度O(ε^{-3}),并在Mamba-130M等模型上验证有效性。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05618 2026-07-27 cs.CL 版本更新

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21561 2026-07-24 cs.LG q-bio.BM 新提交

Graph Learning on Ensembles of Cyclic Peptides: An Investigation of Molecular Ensemble Modeling

环肽集合上的图学习:分子集合建模研究

Aaron Feller, Kris Deibler, Maxim Secor

AI总结 研究针对分子构象集合预测性质的问题,提出EnsembleEGNN模型,先以EGNN层编码各构象,再用集合注意力块汇集表示,经多任务自监督预训练,在环肽数据集上取得良好效果,联合BERT编码器进一步提升预测性能。

Comments Accepted to Graph Foundation Models workshop at ICML '26. Contains 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21326 2026-07-24 cs.CV 新提交

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion

SlerpFlow:用于整流流反演的球形轨迹校正

Wenbin Duan, Yan Shu, Zhuoyuan Fu, Fangmin Zhao, Yan Li, Yaru Zhao, Binyang Li

AI总结 研究针对基于整流流的图像生成中反演难题,提出SlerpFlow方法,基于流形假设,整合球形线性插值校正流速度方向,缓存校正速度,实现高精度反演,提升重建保真度与编辑语义对齐,无需额外训练。

Comments 16 pages. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20539 2026-07-24 cs.LG cs.AI 新提交

Leveraging Biokinetic Knowledge Priors for Data-Scarce Bioprocess Modeling

利用生物动力学知识先验进行数据稀缺的生物过程建模

Kyunghoon Hur, Eunjung Jeon, Hyun Woo Kim, Gyubok Lee, Seongjun Yang

AI总结 研究针对生物制造数据稀缺问题,将生物动力学ODE知识注入神经网络,比较数据级和架构级先验方法,二者在多数据集和微生物物种上均优于无先验基线且可替代,模拟预训练为生物过程深度学习提供简单高效方法。

Comments Accepted at ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20532 2026-07-24 cs.LG cs.AI 新提交

Position: Stop Reactively Patching Your Model Every Time and Start Proactive Test-Driven AI Development

立场:停止每次都被动地修补模型,开始主动的测试驱动人工智能开发

Nadine Chang, Maying Shen, Jialiang Wang, Rafid Mahmood, Jose M. Alvarez

AI总结 针对现代AI系统多样用例下的维护问题,提出用主动测试驱动飞轮解决反应式飞轮的局限性,通过创建“测试空间”映射反馈数据到任务目标,经数学证明主动飞轮能以更少迭代实现更好长期扩展性。

Comments Accepted at ICML 2026 Position Paper Track. 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20503 2026-07-24 cs.AI cs.LG cs.LO 新提交

LeanFlow: A Case Study in Workflow-Driven Lean Autoformalization

LeanFlow:工作流驱动的精益自动形式化案例研究

Lazar Milikic, Simon Guilloud, Khanh Nguyen, Viktor Kuncak

机构 * Moonshot AI(月球计划人工智能公司) epfl-lara(洛桑联邦理工学院拉腊实验室)

AI总结 研究通过对两篇数学论文案例研究,探讨文档到项目形式化中运行时机制对相关指标的影响,使用Kimi2.6和GPT5.5进行消融实验,报告多项数据,展示LeanFlow在特定任务上的表现及校准成果。

Comments 14 pages, 3 figures, ICML 2026: AI for Math Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20485 2026-07-24 cs.AI cs.CL cs.LG 新提交

Expectation Alignment of Language Models for Real-World User Expectations

语言模型与现实世界用户期望的期望对齐

Miaomiao Li, Yang Wang, Bin Liang, Shudong Liu, Zhiwei Zhang, Kam-Fai Wong

AI总结 研究LLMs是否满足用户期望,提出提取期望程序并引入ExpectBench基准,分析发现LLMs存在问题,进而提出LENS框架,可让模型内化期望以生成更契合的响应,凸显明确建模用户期望对实现现实人机对齐的重要性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20484 2026-07-24 cs.AI 新提交

The Devil is in the Spectrum: Mitigating Representation Collapse in LLMs via Topologically Regularized Side-Path

问题出在频谱中:通过拓扑正则化侧路径减轻大语言模型中的表示坍缩

Yiheng Tao, Kaiwen Cheng, Yao Lu, Chang Liu, Jie Chen

AI总结 研究针对大语言模型表示坍缩问题,通过频谱分析得出混合效率与信息容量的权衡,提出TRSP方法,采用无参数三角盒机制和长度感知门正则化令牌交互拓扑,实验证明该方法在多方面有显著改进。

Comments 22pages, 4 figures, poster of icml 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20474 2026-07-24 cs.AI 新提交

VeriSimpl: Robust Optimization Modeling from Natural Language using Simplification-based Verification

VeriSimpl:基于简化验证的自然语言鲁棒优化建模

Sumaya Abdul Rahman, Seckhen Ariel Andrade Cuellar, Ghani Raissov, Mohammad Raza

机构 * Gurobi(古罗比) IBM(国际商业机器公司)

AI总结 研究自然语言到优化建模问题,核心方法是基于简化验证理念,利用优化求解器生成诊断查询让大语言模型推理公式正确性,主要贡献是在优化基准测试中提升准确性并提供高精度自验证信号。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20464 2026-07-24 cs.AI 新提交

Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs

随机采样在认知上是浅薄的:大语言模型中温度变化与模型多样性之间的维度差距

Izhar Ali

机构 * Rowan University(罗文大学)

AI总结 研究语言模型重复运行答案不同时其变化能否揭示未知,比较单个模型多次运行与模型集合一次运行,通过随机矩阵测试发现单个模型跨问题结构不明显,自一致性能给出单问题不确定性,多样集合可揭示模型未知。

Comments 8 pages, 4 figures, 3 tables. Accepted at EIML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20432 2026-07-24 cs.CL cs.PL 新提交

Position: Natural Language Should Not Fully Replace Formal Languages

立场:自然语言不应完全取代形式语言

Eitan Wagner, Elisha Rosensweig, Omri Abend

AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。

Comments To be published in ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19806 2026-07-24 cs.LG cs.AI 版本更新

OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization

OPIUM:通过双目标潜在优化减轻引导外部性和过度拒绝

Kavin Aravindan, Arihant Rastogi, Krishak Aneja, Aadi Prasad, Saiyam Jain, Vaishnavi Shivkumar, Ponnurangam Kumaraguru

AI总结 研究激活引导向量存在的外部性问题,提出无训练方法OPIUM,通过表示匹配净化引导向量,在给定参考行为下优化新向量,改善安全与效用权衡,减轻激活引导的有害副作用。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05476 2026-07-24 cs.LG 版本更新

Parameter-Free Encoders Remain Viable for RDB Foundation Models

无参数编码器对关系数据库基础模型仍然可行

Linjie Xu, David Wipf

AI总结 研究如何利用关系数据库预测目标列缺失值,对比无参数和参数化编码器,分析标签输入时RDB编码器属性,通过实验验证简单无参数编码器在多基准任务中仍有强大性能。

Comments ICML 2026 Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20955 2026-07-24 cs.CR cs.LG 版本更新

Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective

从频域角度增强扩散模型的成员推理攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Hefei University of Technology(合肥工业大学) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学),教育部)

AI总结 本文从频域角度揭示扩散模型处理高频信息的缺陷导致成员推理攻击误分类,并提出即插即用的高频滤波模块以提升攻击性能。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01006 2026-07-24 cs.SD cs.AI cs.LG cs.MM 版本更新

AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching

AG-REPA:音频流匹配中表示对齐的因果层选择

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * AI Thrust, Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,信息中心,香港科学与技术大学(广州))

AI总结 提出AG-REPA方法,通过前向门控消融量化各层对速度场的因果贡献,实现稀疏层选择和自适应加权对齐,在音频流匹配中优于传统REPA基线。

Comments Accepted to ICML 2026. 17 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11936 2026-07-24 cs.AI 版本更新

From Noise to Diversity: Random Embedding Injection in LLM Reasoning

从噪声到多样性:在LLM推理中的随机嵌入注入

Heejun Kim, Seungpil Lee, Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim, Sundong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术学院) Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。

Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18239 2026-07-24 cs.LG cs.AI 版本更新

Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

朝着解耦偏好优化动态:压制失败者,保留胜利者

Wei Chen, Yubing Wu, Junmei Yang, Delu Zeng, Qibin Zhao, John Paisley, Min Chen, Zhou Wang

机构 * South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。

Journal ref International Conference on Machine Learning(ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07075 2026-07-24 physics.chem-ph cs.AI cs.CL cs.LG

LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning

LatentChem: 从文本思维链到化学推理中的潜在思考

Xinwu Ye, Yicheng Mao, Yuxuan Liao, Jia Zhang, Yimeng Liu, Li Hao, Fang Wu, Zhiwei Li, Zehong Wang, Zhiyuan Liu, Zhenfei Yin, Li Yuan, Philip Torr, Huan Sun, xiangxiang Zeng, Mengdi Wang, Le Cong, Shenghua Gao, Xiangru Tang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对化学大语言模型依赖显式思维链导致的模态不匹配问题,提出LatentChem推理接口,通过连续思维向量和动态感知解耦化学逻辑与语言生成,在ChemCoTBench上以59.88%非平局胜率超越强CoT基线,并实现平均10.84倍推理步骤开销降低(5.96倍实际加速)。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10092 2026-07-24 cs.AI cs.LG 版本更新

Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit

使用稀疏自动编码器的可解释嵌入:一种数据分析工具包

Nick Jiang, Xiaoqing Sun, Lisa Dunlap, Lewis Smith, Neel Nanda

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。

Comments ICML 2026. Project page and code: https://interp-embed.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14257 2026-07-24 cs.CL cs.AI 版本更新

Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs

以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距

Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距

Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19704 2026-07-23 cs.LG stat.ML 新提交

Efficient Clustering with Provable Guardrails for LLM Inference at Scale

大规模LLM推理中具有可证明护栏的高效聚类

Longshaokan Wang, Wai Tsang Keung, Punit Ghodasara, Roman Wang, Ali Dashti, Francesc Moreno-Noguer

机构 * Amazon(亚马逊)

AI总结 研究针对大规模LLM推理成本和延迟瓶颈,提出两阶段聚类算法,先用Mini-batch K-Means生成初始聚类,再在其中选代表,能保证逐样本质量控制,运行高效且可扩展,相比常见方法有显著优势,部署后大幅降低成本和延迟。

Comments Accepted for presentation at ICML HiLD workshop 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19408 2026-07-23 cs.LG 新提交

Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning

语言模型微调中基于奖励感知的进化策略种群规模缩放

Sung Cho, Gyubin Han

AI总结 研究在大语言模型微调中,进化策略种群规模缩放与奖励设计及归一化的关系。通过实验发现交叉熵与二元奖励微调种群规模结论差异大,主要因奖励设计和归一化,禁用归一化可改进小种群模型表现,揭示小种群失败可能是实现问题而非内在限制。

Comments 15 pages, 2 figures. Accepted at the 4th HiLD (High-dimensional Learning Dynamics) Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19374 2026-07-23 cs.AI 新提交

Euclean: Automated Geometry Problem Formalization with Unified Verification in Lean

Euclean:在Lean中通过统一验证实现几何问题的自动形式化

Linbin Tang, Jingyan You, Zilin Kang, Hanzhang Liu, Sophia Zhang, Zenan Li, Chenrui Cao, Liangcheng Song, Jiaao Wu, Xian Zhang, Fan Yang

机构 * Google DeepMind(谷歌DeepMind) ByteDance Seed Team(字节跳动种子团队)

AI总结 研究针对几何问题形式化的碎片化现状,提出Euclean框架,通过四个阶段在Mathlib中自动形式化几何,构建了大型数据集,经评估有一定准确率,能提升Goedel v2证明成功率,验证了数据集质量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏