arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-07-03 至 2026-07-03 共收录 22
2606.28589 2026-07-03 cs.AI 版本更新

Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories

从推理中寻找真理:一种用于引导LLM轨迹的动态表示编辑框架

Tianlong Wang, Yuhang Wang, Weibin Liao, Xin Gao, Xinyu Ma, Yang Lin, Yasha Wang, Liantao Ma

机构 * ByteDance Inc.(字节跳动公司) Huawei Technologies Co., Ltd(华为技术有限公司) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

AI总结 提出DynaSteer动态表示编辑框架,通过模式聚类和Fisher-LDA提取纯净真理,并基于前瞻熵选择性引导轨迹,提升LLM推理真实性。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30295 2026-07-03 cs.CL cs.AI 版本更新

MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings

MedCase-Structured:用于在临床真实EHR环境中基准测试诊断推理的文本到FHIR数据集

Valentina Bui Muti, Eugénie Dulout, Ziquan Fu

机构 * System Inc.(系统公司)

AI总结 提出一个从非结构化文本生成临床真实HL7 FHIR R4数据集的流水线,构建MedCase-Structured数据集,发现LLMs在结构化FHIR输入上的诊断准确性低于纯文本,强调部署对齐基准测试的重要性。

Comments Accepted to ICML 2026 Structured Data for Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11020 2026-07-03 cs.LG cs.AI cs.RO 版本更新

Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates

信任区域逆强化学习:利用局部策略更新的显式双上升

Anish Diwan, Davide Tateo, Christopher E. Mower, Haitham Bou-Ammar, Jan Peters, Oleg Arenz

机构 * Technical University of Darmstadt(达姆斯塔特技术大学) Lund University(隆德大学) German Research Center for AI (DFKI)(人工智能研究中心(DFKI)) Robotics Institute Germany (RIG)(德国机器人研究所(RIG)) Huawei, Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

AI总结 本文提出TRIRL算法,通过信任区域优化策略更新,实现奖励函数的单调改进,避免对抗方法的不稳定性,提升多任务表现。

Comments Accepted as a conference paper at the International Conference on Machine Learning (ICML) 2026. Revised to include review feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23065 2026-07-03 cs.CY cs.SE 版本更新

What Should Frontier AI Developers Disclose About Internal Deployments?

前沿AI开发者应披露关于内部部署的哪些信息?

Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。

Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12198 2026-07-03 physics.comp-ph cond-mat.mtrl-sci cs.AI 版本更新

Grounded autonomous scrutiny at scale: emergent critique from reproduction of published computational physics papers

迈向有根的自主研究:一个端到端的LLM微型研究循环在已发表的计算物理学中的应用

Haonan Huang

机构 * Department of Physics, Princeton University(普林斯顿大学物理系)

AI总结 本文提出一个端到端的LLM微型研究循环,用于在已发表的计算物理学中进行自主研究,通过大规模和深度测试展示其在复现、批评和扩展研究中的能力。

Comments v2: camera-ready version, accepted at ICML 2026 AI for Science Workshop. Corrects the phase-classification statistics and adds a coding-sensitivity analysis (Methods M6); the agent-produced six-page Comment is reproduced as-is in the final appendix. 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17212 2026-07-03 cs.GT cs.AI cs.LG 版本更新

Adaptive Contracts for Cost-Effective AI Delegation

面向成本效益的AI委托自适应合同

Eden Saig, Tamar Garbuz, Ariel D. Procaccia, Inbal Talgam-Cohen, Jamie Tucker-Foltz

机构 * Tel Aviv University(特拉维夫大学) Harvard University(哈佛大学) Technion -- Israel Institute of Technology(技术学院——以色列理工学院) California Institute of Technology(加州理工学院) Yale School of Management(耶鲁管理学院)

AI总结 针对AI委托中评估噪声导致支付增加的问题,提出自适应合同机制,通过选择性详细评估降低成本,并给出最优合同计算算法与实证验证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13191 2026-07-03 physics.comp-ph cond-mat.mtrl-sci cs.AI 版本更新

From Experiments to Expertise: Scientific Knowledge Consolidation for AI-Driven Computational Physics

从实验到专长:面向AI驱动计算物理的科学知识巩固

Haonan Huang

AI总结 提出QMatSuite平台,通过记录、检索和反思机制巩固计算材料科学中的知识,减少推理开销并提高模拟准确性。

Comments v2: camera-ready version, accepted at the ICML 2026 Workshop on AI for Physics (AI4Physics@ICML 2026). 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02112 2026-07-03 cs.LG cs.CL 版本更新

Recursive Models for Long-Horizon Reasoning

长程推理的递归模型

Chenxiao Yang, Nathan Srebro, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(丰田技术研究所)

AI总结 提出递归模型,通过递归调用自身在隔离上下文中解决子任务,突破上下文长度限制,理论证明可指数级降低活跃上下文需求,实验验证在SAT求解和围棋任务中提升长程准确性。

Comments in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10431 2026-07-03 cs.LG 版本更新

QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

QTALE: 面向LLM的量化鲁棒令牌自适应层执行

Kanghyun Noh, Jinheon Choi, Yulhwa Kim

机构 * Department of Semiconductor Systems Engineering, Sungkyunkwan University(成均馆大学半导体系统工程系)

AI总结 提出QTALE框架,通过多样化训练路径和后训练调整机制,实现令牌自适应层执行与量化的无缝集成,在保持精度的同时降低计算和内存开销。

Comments 22 pages, 10 figures, 20 tables,

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05999 2026-07-03 cs.LG 版本更新

On the Role of Computation in Reinforcement Learning

论计算在强化学习中的作用

Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko, Benjamin Eysenbach

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文形式化计算受限策略,证明使用更多计算的策略能解决更复杂问题并泛化到更长视野任务,提出可变计算量架构,实验表明仅通过增加计算量即可提升性能。

Comments ICML 2026, Website: https://rajghugare19.github.io/computation-rl/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10545 2026-07-03 cs.LG cs.AI stat.ML 版本更新

$μ$pscaling small models: Principled warm starts and hyperparameter transfer

$\mu$缩放小型模型:有原则的热启动与超参数迁移

Yuxin Ma, Nan Chen, Mateo Díaz, Soufiane Hayou, Dmitriy Kunisky, Soledad Villar

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系)

AI总结 提出一种基于$\mu$P和任意维架构的宽度升级方法,通过理论引导的噪声和优化器超参数缩放,实现功能等价和超参数迁移,降低调参成本。

Comments 69 pages, 11 figures, closest to version to be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07267 2026-07-03 cs.AI cs.CL cs.LG 版本更新

BRIDGE: Predicting Human Task Completion Time From Model Performance

BRIDGE: 从模型性能预测人类任务完成时间

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院) Periodic Labs(Periodic实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究)

AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03315 2026-07-03 cs.AI 版本更新

Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity

Memora: 一种平衡抽象与特异性的和谐记忆表示

Menglin Xia, Xuchao Zhang, Shantanu Dixit, Paramaguru Harimurugan, Rujia Wang, Victor Ruhle, Robert Sim, Chetan Bansal, Saravan Rajmohan

机构 * Microsoft(微软)

AI总结 提出Memora记忆表示,通过主抽象和线索锚点平衡抽象与特异性,结合检索策略实现高效上下文感知检索,在LoCoMo和LongMemEval基准上达到新最优。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02762 2026-07-03 cs.LG 版本更新

On the Sample Efficiency of Inverse Dynamics Models for Semi-Supervised Imitation Learning

关于半监督模仿学习中逆动力学模型样本效率的研究

Sacha Morin, Moonsub Byeon, Alexia Jolicoeur-Martineau, Sébastien Lachapelle

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Samsung AI Lab, Montreal(蒙特利尔三星人工智能实验室)

AI总结 本文分析半监督模仿学习中逆动力学模型(IDM)的样本效率优势,归因于IDM假设复杂度低且随机性小,并基于此改进LAPO算法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22710 2026-07-03 cs.CR cs.CL 版本更新

AlienLM: Alienization of Language for API-Boundary Privacy in Black-Box LLMs

AlienLM: 面向黑盒大语言模型API边界隐私的语言异化

Jaehee Kim, Pilsung Kang

AI总结 提出AlienLM,通过词汇级双射将文本转化为异化语言,在仅使用API的情况下减少明文暴露,平均保留81%以上的性能,且恢复攻击成功率低于0.22%。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21718 2026-07-03 cs.LG cs.AI 版本更新

When Does Predictive Inverse Dynamics Outperform Behavior Cloning?

何时预测性逆动力学优于行为克隆?

Lukas Schäfer, Pallavi Choudhury, Abdelhak Lemkhenter, Chris Lovett, Somjit Nath, Luis França, Matheus Ribeiro Furtado de Mendonça, Alex Lamb, Riashat Islam, Siddhartha Sen, John Langford, Katja Hofmann, Sergio Valcarcel Macua

机构 * University of Cambridge(剑桥大学) Universitygrow

AI总结 本文通过理论分析解释了预测性逆动力学模型(PIDM)为何在行为克隆(BC)失败时表现更优,归因于偏差-方差权衡,并实验验证了PIDM在样本效率上的显著优势。

Comments To be published in proceedings of the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04509 2026-07-03 cs.AI 版本更新

A General Neural Backbone for Mixed-Integer Linear Optimization via Dual Attention

一种通过双重注意力实现混合整数线性优化的通用神经骨干

Peixin Huang, Yaoxin Wu, Yining Ma, Cathy Wu, Wei Zhang, Wen Song

机构 * Shenzhen Research Institute, Shandong University, China(山东大学深圳研究院,中国)

AI总结 提出基于元素中心视角和双重注意力(内部自注意力和交叉注意力)的神经骨干,在实例、元素和求解状态三个层面优于传统GNN架构,为学习增强组合优化提供强大基础。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07843 2026-07-03 cs.LG cs.AI cs.CL 版本更新

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver:自适应线程化实现语言模型高效并行推理

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学)

AI总结 提出ThreadWeaver框架,通过两阶段并行轨迹生成、基于trie的展开设计和并行化感知强化学习,在保持与顺序推理模型相当准确率的同时,显著降低推理延迟。

Comments Accepted as an oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏