arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11957 篇
2609.37078 2026-09-30 cs.LG 新提交

ZeroDiff: Zero-Shot Time Series Reconstruction via Informed-Prior Diffusion

ZeroDiff:基于先验信息扩散的零样本时间序列重建

Yingda Fan, Dan Lu, Xiaowei Jia

机构 * University of Pittsburgh(匹兹堡大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)

AI总结 针对目标观测稀缺的零样本时间序列重建问题,提出ZeroDiff方法,利用外生变量构建先验并通过扩散校准误差,在真实数据集上显著优于现有方法。

Comments ICML 2026. Code: this https URL (ICML2026" target="_blank" rel="noopener">https://github.com/YingdaFan/ZeroDiff-ICML2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36578 2026-09-30 cs.LG cs.AI 新提交

Factorized Scheduling Principle: Learning Interpretable and Transferable Policies via Structured Additive Functions

因子化调度原理:通过结构化加性函数学习可解释且可迁移的策略

Hong Je-Gal, Hyun-Suk Lee

机构 * Sejong University(世宗大学) ; Artificial Intelligence Robotics Institute (AIRI), Sejong University(世宗大学人工智能机器人研究所(AIRI))

AI总结 提出因子化调度原理框架,将调度策略分解为加性分量,学习可解释且可迁移的规则,并在合成和现实任务中验证了性能与零样本泛化能力。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.36265 2026-09-30 cs.LG cs.AI cs.CL 新提交

In-Context Learning Amplifies a Latent Symbolic Circuit

上下文学习放大潜在符号电路

Melissa Wessel

AI总结 本研究揭示大型语言模型中的潜在符号电路在上下文示例积累时被放大,其抽象、归纳、检索三阶段机制在低样本时已可检测,且函数向量可部分替代归纳阶段,依赖完整检索阶段,表明规则遵循能力预先存在于权重中。

Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.34426 2026-09-30 cs.LG 版本更新

Q-learning Penalized Transformer for Safe Offline Reinforcement Learning

Q-learning 惩罚 Transformer 用于安全离线强化学习

Shengchao Hu, Peng Wang, Jifeng Hu, Qiyang Zhou, Anning Hu, Li Shen, Ya Zhang, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Jilin University(吉林大学) ; Nanyang Technological University(南洋理工大学)

AI总结 本文提出 Q-learning 惩罚 Transformer(QPT)框架,通过 Q 形惩罚将安全约束融入条件序列建模,在 DSRL 基准 38 个任务上优于基线并实现零样本阈值适应。

Comments ICML submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29985 2026-09-30 cs.CL 版本更新

Are We Measuring Strategy or Phrasing? The Gap Between Surface- and Approach-Level Diversity in LLM Math Reasoning

我们是在衡量策略还是措辞?LLM数学推理中表面多样性与方法层面多样性的差距

Sangmook Lee, Minbeom Kim, Jeonghye Kim, Dohyung Kim, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)

AI总结 提出方法层面多样性概念,发现现有多样性指标无法反映策略差异,且多样性感知强化学习会降低方法多样性,直接优化方法多样性仍具挑战。

Comments Accepted to EMNLP 2026 and ICML 2026 Ai4Math Workshop (Honorable Mention). Code at this https URL (https://github.com/helmsman12/LLM_reasoning_diversity)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21648 2026-09-30 cs.LG cond-mat.dis-nn cs.NE stat.ML 版本更新

Dropout Universality: Scaling Laws and Optimal Scheduling at the Edge-of-Chaos

Dropout 普适性:混沌边缘的缩放定律与最优调度

Lucas Fernandez Sarmiento

机构 * Lucas Fernandez Sarmiento

AI总结 提出 dropout 作为临界信号传播扰动的平均场理论,发现前端加载的 dropout 调度在固定预算下可将 MLP 和 Vision Transformer 的测试损失降低 18-35%,并推导出相关缩放定律与普适类。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08372 2026-09-30 cs.LG math.OC 版本更新

Dynamic Regret via Discounted-to-Dynamic Reduction with Applications to Curved Losses and Adam Optimizer

通过折扣到动态的还原实现动态后悔,应用于曲面损失和Adam优化器

Yan-Feng Xie, Yu-Jie Zhang, Peng Zhao, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家实验室) ; School of Artificial Intelligence(人工智能学院) ; University of Washington(华盛顿大学)

AI总结 本文通过折扣到动态的还原方法,改进了FTRL相关问题的动态后悔界,并应用于曲面损失和Adam优化器,获得了非凸非光滑设置下的最优收敛速率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08777 2026-09-30 cs.LG cs.AI cs.CL cs.GT 版本更新

Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling

渐近通用对齐:通过测试时间缩放实现的新对齐框架

Yang Cai, Weiqiang Zheng

机构 * Yale University(耶鲁大学)

AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。

Comments A preliminary version of the paper is accepted to ICML 2026. This version adds new results for the multi-output opponents setting and self-play dynamics with last-iterate convergence

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.35528 2026-09-29 cs.LG cs.AI 新提交

Let the Neurons Die: Exploiting ReLU-Induced Model Degradation

让神经元死亡:利用ReLU引发的模型退化

Kexin Li, Wenjun Qiu, Joshua Abraham, Aditi Maheshwari, David Lie

机构 * University of Toronto(多伦多大学)

AI总结 针对ReLU神经元的死亡问题,提出基于数据排序和投毒的三种训练时攻击,仅通过排序100个样本或添加200个投毒样本即可显著降低MNIST测试准确率。

Comments Accepted to the Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026 in Seoul, South Korea; Presented as a poster on July 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.33981 2026-09-29 cs.LG 新提交

Future Information-Directed Sampling for Bayesian Nonstationary Bandits

面向贝叶斯非平稳老虎机的未来信息导向采样

Yichen Song, Alessio Russo, Aldo Pacchiano

机构 * Boston University(波士顿大学) ; Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学布罗德研究所)

AI总结 本文提出未来信息导向采样(FIDS),一种面向贝叶斯非平稳老虎机的新算法,通过显式探索未来最优臂信息,在保持与汤普森采样相近遗憾的同时利用预测性结构,并采用监督学习框架从离线数据近似后验推断。

Comments 18 pages. An earlier version appeared at the ICML 2026 DEMO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-09-29 cs.AI 版本更新

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21967 2026-09-29 stat.AP 版本更新

When Machines Lie Differently: Detecting AI vs Human Fake News

当机器说谎方式不同时:检测人工智能与人类制造的假新闻

Calvin Ibenye, Aya-Vera Jimenez, Samuel Jaeger, Dhrubajyoti Ghosh

AI总结 研究通过两个二元分类任务,用词汇、可读性等特征及多种机器学习模型,区分真实新闻与人类及人工智能生成的假新闻,发现检测人工智能生成的假新闻准确率高,而人类撰写的较难区分,揭示了错误信息检测的不对称性。

Comments Accepted at the International Conference on Machine Learning and Applications (ICMLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31282 2026-09-29 cs.LG 版本更新

Revisiting the Volume Hypothesis

重新审视体积假说

Ari Pakman, Lior Kreimer, Yakir Berchenko

AI总结 通过复制交换Wang-Landau算法估计二元网络中的联合态密度,研究梯度学习与随机采样在泛化性能上的差异如何随训练数据量变化,发现数据量增大时梯度学习的优势减弱,从而解释了关于体积假说的矛盾实验结果。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06894 2026-09-29 cs.LG cs.AI 版本更新

COGNOS: Universal Enhancement for Time Series Anomaly Detection via Constrained Gaussian-Noise Optimization and Smoothing

COGNOS:通过约束高斯噪声优化与平滑实现时间序列异常检测的通用增强

Wenlong Shang, Shihao Tian, Xutong Wan, Peng Chang

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) ; Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing University of Technology, China(北京计算智能与智能系统重点实验室,北京理工大学,中国)

AI总结 本文提出COGNOS框架,通过约束高斯噪声优化与平滑解决时间序列异常检测中MSE损失导致的统计缺陷,提升检测可靠性。

Comments Paper accepted by the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18576 2026-09-29 cs.AI 版本更新

Agentic Forecasting with Structured Linguistic Beliefs

基于序列贝叶斯更新的语义信念的代理预测

Kevin Murphy

机构 * Department of Computer Science(计算机科学系) ; University of British Columbia(不列颠哥伦比亚大学)

AI总结 BLF系统通过语义信念状态、层级多试聚合和层级校准方法,在预测基准上超越了现有方法,同时具备低泄露率的回测框架。

Comments v5 is a complete rewrite! Shorter and clearer, and includes new experiments measuring effect of the belief state, and comparison to a "proper" Bayesian approach (based on LLM likelihoods)

Journal ref v3 was published in ICML AI Forecasting workshop 2026 (https://forecasting-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21003 2026-09-29 cs.AI 版本更新

Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

贝叶斯-LoRA:大型语言模型的概率低秩适应

Moule Lin, Shuhao Guan, Andrea Patane, David Gregg, Goetz Botterweck

机构 * School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) ; School of Computer Science, University College Dublin, Dublin, Ireland(都柏林大学学院计算机科学学院)

AI总结 本文提出贝叶斯-LoRA,通过概率低秩表示改进LoRA,提升模型校准性,在多个常识推理基准中实现84%的ECE和76%的NLL减少。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14773 2026-09-29 cs.LG cs.AI 版本更新

HO-SFL: Hybrid-Order Split Federated Learning with Backprop-Free Clients and Dimension-Free Aggregation

HO-SFL: 混合阶分割联邦学习,无反向传播客户端与维度无关聚合

Qiyuan Chen, Xian Wu, Yi Wang, Xianhao Chen

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong, Hong Kong SAR, China(电子与计算机工程系,香港大学,香港特别行政区,中国)

AI总结 提出HO-SFL框架,通过拉格朗日框架重构分割学习,服务器执行一阶更新而客户端进行零阶优化,实现无反向传播客户端、维度无关聚合,理论证明收敛速度与一阶方法相当,实验验证通信和内存成本显著降低。

Comments ICML 2026 final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14972 2026-09-29 cs.LG 版本更新

Use What You Know: Causal Foundation Models with Partial Graphs

利用已知信息:带有部分图结构的因果基础模型

Arik Reuter, Anish Dhir, Cristiana Diaconu, Jake Robertson, Ole Ossen, Frank Hutter, Adrian Weller, Mark van der Wilk, Bernhard Schölkopf

机构 * University of Cambridge(剑桥大学) ; Gatsby Computational Neuroscience Unit(加布特计算神经科学单位) ; Prior Labs(Prior实验室) ; University of Freiburg(弗赖堡大学) ; The Alan Turing Institute(艾伦·图灵研究所) ; University of Oxford(牛津大学)

AI总结 提出在因果基础模型中注入因果图或祖先信息的方法,利用图卷积编码器和注意力机制有效利用部分因果信息,使通用模型匹配专用模型性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05435 2026-09-29 cs.CV 版本更新

Stable Velocity: A Variance Perspective on Flow Matching

稳定速度:流匹配的方差视角

Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对流匹配中单样本条件速度导致的高方差训练目标,提出稳定速度框架,通过方差表征识别高低方差区域,并引入无偏方差缩减目标(StableVM)、方差感知表示对齐(VA-REPA)以及免微调加速采样(StableVS),在多个大规模模型上实现训练效率提升和超过2倍采样加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05031 2026-09-29 cs.LG

Laplacian Representations for Decision-Time Planning

用于决策时规划的拉普拉斯表示

Dikshant Shehmar, Matthew Schlegel, Matthew E. Taylor, Marlos C. Machado

机构 * University of Cambridge(剑桥大学)

AI总结 本文提出利用拉普拉斯表示作为决策时规划的潜在空间,通过多时间尺度捕捉状态空间距离,并基于此设计层次规划算法ALPS,在离线目标条件强化学习任务中优于常用基线。

Comments Accepted at ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02464 2026-09-29 cs.CL 版本更新

From Directions to Regions: Decomposing Activations in Language Models via Local Geometry

从方向到区域:通过局部几何分解语言模型中的激活

Or Shafran, Shaked Ronen, Omri Fahn, Shauli Ravfogel, Atticus Geiger, Mor Geva

机构 * Blavatnik School of Computer Science(Blavatnik计算机科学学院) ; AI, Tel Aviv University, Israel(人工智能,特拉维夫大学,以色列) ; New York University, New York, NY, USA(纽约大学,纽约,纽约州,美国)

AI总结 本研究提出MFA方法,通过局部几何分解语言模型中的激活,捕捉复杂非线性结构,优于无监督基线并优于稀疏自编码器的转向性能。

Comments Accepted at ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01553 2026-09-29 cs.LG cs.AI 版本更新

Plain Transformers are Surprisingly Powerful Link Predictors

普通Transformer竟是惊人的链接预测器

Quang Truong, Yu Song, Donald Loveland, Mingxuan Ju, Tong Zhao, Neil Shah, Jiliang Tang

机构 * Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA.(计算机科学与工程系,密歇根州立大学,东兰辛,MI,美国。) ; Department of Computer Science(计算机科学系) ; Engineering, Michigan State University, East Lansing, MI, USA.(工程,密歇根州立大学,东兰辛,MI,美国。)

AI总结 提出PENCIL,一种仅编码器的普通Transformer,通过采样局部子图的注意力机制替代手工先验,在保持标准Transformer可扩展性的同时,隐式泛化多种启发式方法,实现高效且参数经济的链接预测。

Comments ICML'26. UPDATE: Corrected the HeaRT-ogbl-collab results due to an evaluation code error

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13768 2026-09-29 cs.CV cs.AI q-bio.NC 版本更新

Scaling Vision Transformers for Functional MRI with Flat Maps

利用平面图扩展视觉Transformer用于功能性磁共振成像

Connor Lane, Mihir Tripathy, Leema Krishna Murali, Ratna Sagari Grandhi, Shamus Sim Zi Yang, Sam Gijsen, Debojyoti Das, Manish Ram, Utkarsh Kumar Singh, Cesar Kadir Torrico Villanueva, Yuxiang Wei, Will Beddow, Gianfranco Cortés, Suin Cho, Daniel Z. Kaplan, Benjamin Warner, Tanishq Mathew Abraham, Paul S. Scotti

机构 * Baylor College of Medicine(贝勒医学院) ; University of Florida(佛罗里达大学)

AI总结 本研究将fMRI数据转为平面图视频,用掩码自编码器训练视觉Transformer,验证了幂律缩放规律,并实现了跨受试者的状态与特质解码。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05071 2026-09-29 math.OC cs.LG stat.ML 版本更新

Revisiting Inexact Fixed-Point Iterations for Min-Max Problems: Stochasticity and Structured Nonconvexity

重新审视极小极大问题的不精确不动点迭代:随机性与结构化非凸性

Ahmet Alacaoglu, Donghwan Kim, Stephen J. Wright

机构 * University of British Columbia(不列颠哥伦比亚大学) ; Wisconsin Institute for Discovery, University of Wisconsin–Madison(威斯康星大学麦迪逊分校威斯康星发现研究所) ; KAIST(韩国科学技术院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文通过锥非扩张性与精细化分析,将一阶方法在非凸-非凹极小极大问题中可容忍的$\ ho$值从$\ rac{1}{2L}$提升至$\ rac{1}{L}$,并改进随机凸-凹情形下的复杂度结果。

Journal ref Proceedings of the International Conference on Machine Learning (ICML) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30993 2026-09-28 cs.CV cs.AI 新提交

FLIP: Final Layer Inference-Time Probing for Vision-Language Models

FLIP:视觉-语言模型的最终层推理时探测

Drandreb Earl O. Juanico, Rowel O. Atienza

机构 * University of the Philippines(菲律宾大学)

AI总结 FLIP通过最终层推理时探测验证视觉-语言模型中干预位点的机制解释,提出四标准协议,确认面向logit的归一化后状态支持任务关联计算,而非一般扰动。

Comments 25 pages, 14 figures, 5 tables. Accepted at the Mechanistic Interpretability Workshop at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.30822 2026-09-28 cs.LG cs.CE 新提交

Adaptive Interaction Graphs for Particle Simulation

自适应交互图用于粒子模拟

Aiden Zhou

机构 * Yale University(耶鲁大学)

AI总结 提出自适应交互图方法 AdaptGNS,通过联合训练的方差头动态调整粒子邻域,在 WaterDrop 上实现严格 Pareto 改进,并揭示不确定性集中在复杂区域。

Comments 6 pages, 3 figures. Presented at ICML 2026 Workshop on AI for Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07618 2026-09-28 cs.LG stat.ML

Neural Networks With Dense Weights Are Not Universal Approximators

具有密集权重的神经网络不是通用逼近器

Levi Rauchwerger, Stefanie Jegelka, Ron Levie

机构 * Princeton University, Dept of CS(普林斯顿大学计算机科学系) ; MIT, Dept of EECS and CSAIL(麻省理工学院电子工程与计算机科学系及计算机科学与人工智能实验室) ; TUM, School of CIT, MCML, MDSI(技术大学(TUM)信息科技学院,MCML,MDSI) ; Technion – IIT, Faculty of Mathematics(技术学院–以色列理工学院数学学院)

AI总结 研究探讨了密集神经网络的逼近能力,指出在有限的权重约束下,密集连接的神经网络无法逼近任意连续函数,从而揭示了密集层神经网络的固有局限性,推动了稀疏连接在实现真正通用性中的必要性。

Comments NeurIPS 2026. Also presented at the GFM Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10684 2026-09-28 cs.LG cond-mat.dis-nn cs.AI stat.ML

On the origin of neural scaling laws: from random graphs to natural language

神经缩放定律的起源:从随机图到自然语言

Maissam Barkeshli, Alberto Alfarano, Andrey Gromov

机构 * Meta Superintelligence Labs, FAIR(Meta超智能实验室,FAIR) ; Department of Physics, University of Maryland, College Park(大学物理系,马里兰大学College Park分校) ; Joint Quantum Institute(联合量子研究所)

AI总结 本文研究了从随机图到自然语言的神经缩放定律起源,发现即使在无幂律结构的数据中,简化设置也能产生缩放定律,并展示了语言复杂性降低时缩放指数的单调变化。

Comments 33 pages

Journal ref ICML 2026 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.29802 2026-09-25 cs.AI cs.CL 新提交

Learning to Ideate for Scientific Impact

学习构思以提升科学影响力

Shubham Kale, Aniketh Garikaparthi, Manasi Patwardhan

机构 * TCS Research(塔塔咨询服务研究院)

AI总结 本研究利用引用归一化影响力作为反馈信号,通过奖励模型和强化学习训练构思生成器,使其在科学发现中产生更高预期影响力的想法。

Comments RLxF Workshop ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24423 2026-09-25 cs.AI 版本更新

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

临时团队协作中上下文强化学习的极限基准测试

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

机构 * C$^{2}$DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所C²DL实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; University of Science and Technology of China(中国科学技术大学) ; Qwen Team, Alibaba Group(阿里集团Qwen团队)

AI总结 提出ICRL4AHT基准,基于Overcooked-V2评估上下文强化学习在临时团队协作中的表现,发现算法在未见队友和布局下常不如随机基线,凸显多智能体环境下的适应挑战。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
↑