arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-29 至 2026-05-29 共收录 128
2512.13517 2026-05-29 q-bio.NC cs.LG

A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments

基于交互式VR实验的心理旋转深度学习模型

Raymond Khazoum, Daniela Fernandes, Aleksandr Krylov, Qin Li, Stephane Deny

机构 * Department of Computer Science, Aalto University, Espoo, Finland(奥卢大学计算机科学系,芬兰埃斯波) Department of Neuroscience and Biomedical Engineering, Aalto University, Espoo, Finland(奥卢大学神经科学与生物医学工程系,芬兰埃斯波)

AI总结 提出一个由等变编码器、神经符号对象编码器和神经决策代理组成的深度学习模型,通过VR实验验证,准确模拟人类心理旋转的性能、响应时间和行为。

Comments Version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10401 2026-05-29 stat.ML cs.LG math.ST stat.TH

Diffusion differentiable resampling

扩散可微重采样

Jennifer Rosina Andersson, Zheng Zhao

机构 * Department of Information Technology, Uppsala University, Sweden(乌普萨拉大学信息科技系,瑞典)

AI总结 针对序贯蒙特卡洛中的可微重采样问题,提出一种基于无训练扩散模型代理的信息性且即时可微的重采样方法,理论证明其一致性,并在多个滤波和参数估计基准上优于现有方法。

Comments In ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25154 2026-05-29 stat.ME stat.CO stat.ML

TabMGP: Martingale Posterior with TabPFN

TabMGP: 基于TabPFN的马氏后验

Kenyon Ng, Edwin Fong, David T. Frazier, Jeremias Knoblauch, Susan Wei

AI总结 提出TabMGP方法,利用TabPFN作为预测规则构建马氏后验,为表格数据提供具有近名义覆盖率的可信集,优于手工MGP构造和标准贝叶斯基线。

Comments Accepted at ICML 2026. Extra plots in https://drive.google.com/drive/folders/1ct_effOoTEGpiWUf0_1xI3VqLWHtJY16 . Code in https://github.com/weiyaw/tabmgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22437 2026-05-29 cs.AI cs.CL

Modeling Hierarchical Thinking in Large Reasoning Models

大型推理模型中的层次化思维建模

G M Shahariar, Erfan Shayegani, Ali Nazari, Nael Abu-Ghazaleh

机构 * University of California, Riverside(加州大学河滨分校) Independent Researcher(独立研究者)

AI总结 本文提出将大型推理模型(LRM)的层次化推理动态近似为有限状态机(FSM)中的轨迹,并通过Q值引导的推理时控制方法实现高效推理优化。

Comments Accepted in ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11499 2026-05-29 cs.LG cs.AI

Offline Reinforcement Learning with Generative Trajectory Policies

基于生成轨迹策略的离线强化学习

Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

机构 * School of Computing, Data Sciences Computer Engineering Department, UCLA, Los Angeles, USA

AI总结 本文提出生成轨迹策略(GTP),通过统一扩散、流匹配和一致性模型为常微分方程驱动的连续时间生成轨迹,并引入两种理论自适应方法,在D4RL基准上达到最先进性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23730 2026-05-29 cs.AI

EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance

EAPO: 利用按需专家协助增强策略优化

Siyao Song, Cong Ma, Zhihao Cheng, Shiye Lei, Minghao Li, Ying Zeng, Huaixiao Tou, Kai Jia

机构 * ByteDance BandAI(字节跳动BandAI)

AI总结 提出专家辅助策略优化(EAPO)框架,通过训练中与外部专家的多轮交互增强探索,解决强化学习中的稀疏奖励和低效探索问题,在多个基准上平均提升5个点。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22504 2026-05-29 cs.AI cs.LG

Estimating the Empowerment of Language Model Agents

估计语言模型代理的赋权能力

Jinyeop Song, Jeff Gore, Max Kleiman-Weiner

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学)

AI总结 提出基于信息论中赋权概念的评估框架EELMA,通过多轮文本交互近似有效赋权,实验表明赋权与任务性能强相关,可作为与任务成功度量互补的通用评估指标。

Comments Published at the International Conference on Machine Learning (ICML) 2026. 9 pages, 9 figures; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21154 2026-05-29 cs.LG cs.AI

GRPO is Secretly a Process Reward Model

GRPO 秘密地是一个过程奖励模型

Michael Sullivan, Alexander Koller

机构 * Department of Language Science Technology, Saarland Informatics Campus, Saarland University, Saarbr \"u cken, Germany

AI总结 本文理论证明,使用结果奖励模型的 GRPO 强化学习算法等价于一个基于蒙特卡洛的过程奖励模型,并发现其缺陷,提出 λ-GRPO 改进,在推理任务上提升性能。

Comments 16 pages, 9 figures; accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19282 2026-05-29 cs.CL cs.AI

Less Is More: Elevating RAG via Performance-Driven Context Compression

少即是多:通过性能驱动的上下文压缩提升RAG

Ziqiang Cui, Yunpeng Weng, Xing Tang, Peiyang Liu, Shiwei Li, Bowei He, Jiamin Chen, Yansen Zhang, Xiuqiang He, Chen Ma

机构 * City University of Hong Kong, Hong Kong SAR, China(香港城市大学) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(阿布扎赫尔 Mohamed bin Zayed 人工智能大学) Huazhong University of Science and Technology(华中科技大学) Peking University, Beijing, China(北京大学) Shenzhen Technology University, Shenzhen, China(深圳技术大学)

AI总结 提出CORE-RAG框架,利用任务性能作为反馈信号迭代优化压缩策略,在3%压缩率下平均精确匹配得分提升3.3点。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19202 2026-05-29 cs.CL

Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning

通过探针知识和推理揭示LLMs中的科学问题解决

Alan Li, Yixin Liu, Arpan Sarkar, Doug Downey, Arman Cohan

机构 * Department of Computer Science, Yale University Department of Molecular \& Cellular Biology, Harvard University Allen Institute for AI Department of Computer Science, Northwestern University

AI总结 本文提出SciReas基准和KRUX探针框架,系统评估LLMs在科学推理中的知识与推理角色,发现知识检索是主要瓶颈,外部上下文知识和推理增强均能提升性能。

Comments 33 pages, 18 figures

Journal ref ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03253 2026-05-29 cs.GT cs.AI cs.MA

Approximate Proportionality in Online Fair Division

在线公平分配中的近似比例性

Davin Choo, Winston Fu, Derek Khu, Tzeh Yuan Neoh, Tze-Yang Poon, Nicholas Teh

机构 * Harvard University, USA(哈佛大学) University of Oxford, UK(牛津大学) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR), Singapore(前沿人工智能研究中心(CFAR)) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC)) Princeton University, New Jersey, USA(普林斯顿大学) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR), Singapore(信息与通信研究所以(I2R))

AI总结 研究在线公平分配问题中比例性(PROP1)的可近似性,通过非自适应对手和最大物品价值预测两种松弛方法,设计了具有鲁棒保证的在线算法。

Comments Appears in the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16880 2026-05-29 cs.CV cs.AI cs.LG

Finding DoRI: Discovery of Retained Images in Diffusion Models

Finding DoRI: 扩散模型中保留图像的发现

Antoni Kowalczuk, Dominik Hintersdorf, Lukas Struppek, Kristian Kersting, Adam Dziedzic, Franziska Boenisch

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Technical University of Darmstadt(达姆施塔特技术大学) Hessian Center for AI (Hessian.AI)(黑森人工智能中心(Hessian.AI)) Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特技术大学认知科学中心)

AI总结 通过挑战记忆局部化假设,发现文本嵌入的小扰动可重新触发数据复制,并证明记忆本质上是非局部的,从而提出对抗微调实现更鲁棒的缓解方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21627 2026-05-29 cs.GT cs.AI cs.CY cs.LG

Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives

你的大语言模型是否在过度收费?分词、透明度与激励

Ander Artola Velasco, Stratis Tsirtsis, Nastaran Okati, Manuel Gomez-Rodriguez

机构 * Ander Artola Velasco(1. 阿德纳·阿尔托拉·韦拉斯科) Stratis Tsirtsis(2. 斯特拉蒂斯·蒂尔蒂斯) Nastaran Okati(3. 纳斯塔兰·奥卡蒂)

AI总结 研究当前按token计费机制下,服务提供商可能通过策略性报告token数量来过度收费,并提出按字符线性定价的激励相容机制以消除该财务激励。

Comments Selected as an oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02604 2026-05-29 cs.LG

Connecting Independently Trained Modes via Layer-Wise Connectivity

通过逐层连接性连接独立训练的模态

Yongding Tian, Zaid Al-Ars, Maksim Kitsak, Peter Hofstee

机构 * Computer Engineering Lab, Delft University of Technology, Delft, NL(代尔夫特理工大学计算机工程实验室) Network and Architecture Service, Delft University of Technology, Delft, NL(代尔夫特理工大学网络与架构服务) IBM Infrastructure, TX, USA(IBM基础设施)

AI总结 提出一种新的经验算法,通过逐层连接性构建独立训练神经网络模型之间的连续低损失路径,在多种现代架构上实现更一致的模式连接。

Comments 28 pages, 22 figures, accepted in ICML 2026: https://openreview.net/forum?id=4VOTzpH9MO

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03805 2026-05-29 cs.CL

CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective

CriticalKV: 从输出扰动角度优化 KV 缓存淘汰

Yuan Feng, Junlin Lv, Haoyu Guo, Yukun Cao, S Kevin Zhou, Xike Xie

机构 * School of Computer Science, University of Science and Technology of China(科学技术大学计算机科学学院) School of Biomedical Engineering, USTC(USTC生物医学工程学院) Data Darkness Lab, MIRACLE Center, Suzhou Institute for Advanced Research(苏州先进研究院数据黑暗实验室、奇迹中心) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

AI总结 本文通过分析注意力输出扰动,提出一种基于扰动约束的 KV 缓存条目选择算法,显著降低压缩损失。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00452 2026-05-29 cs.LG cs.CV

Learning Locally, Revising Globally: Global Reviser for Federated Learning with Noisy Labels

局部学习,全局修正:面向含噪标签联邦学习的全局修正器

Yuxin Tian, Mouxing Yang, Yuhao Zhou, Jian Wang, Qing Ye, Tongliang Liu, Gang Niu, Jiancheng Lv

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,中国成都) Engineering Research Center of Machine Learning(机器学习工程研究中心) University of Sydney, Sydney, Australia(悉尼大学,澳大利亚悉尼) Southeast University, Nanjing, China(东南大学,中国南京)

AI总结 针对联邦学习中标签噪声与数据异质性共存的问题,提出一种利用全局模型慢记忆特性的联邦全局修正器(FedGR),通过三个模块协同修正噪声标签并正则化局部训练,在三个基准上优于八种基线方法。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29556 2026-05-29 cs.AI

Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification

Opt-Verifier:通过双面验证释放大语言模型在优化建模中的潜力

Haoyang Liu, Jie Wang, Boxuan Niu, Xiongwei Han, Yian Xu, Mingxuan Ye, Zijie Geng, Fangzhou Zhu, Tao Zhong, Mingxuan Yuan, Jianye Hao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition(脑启发式感知与认知MoE实验室) University of Science and Technology of China(中国科学技术大学) Noah's Ark Lab, Huawei Technologies(华为技术诺亚实验室) Tianjin University(天津大学)

AI总结 提出Opt-Verifier框架,通过结构侧和解决方案侧的双面验证,利用大语言模型自动构建数学优化模型,显著提升建模准确性。

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29489 2026-05-29 cs.LG cs.SY eess.SY

Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging

访问集至关重要:为可扩展的权重空间模型合并预算专家读取

Yuanyi Wang, Yanggan Gu, Su Lu, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University, PolyU(香港理工大学,PolyU) Hong Kong Polytechnic University Daya Bay Technology(香港理工大学达亚拜技术) Innovation Research Institute(创新研究院)

AI总结 针对大语言模型合并中专家权重读取的I/O瓶颈,提出MergePipe,一种预算感知的执行层,通过将合并问题转化为专家访问集问题,在显式I/O预算下选择要访问的专家增量块,实现高达11倍加速且参数偏差极小。

Comments ICML 2026 Workshop on Weight-Space Symmetries: from Foundations to Practical Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29461 2026-05-29 cs.CV

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

FlowSeg: 面向大语言模型条件分割的动态语义引导

Zekang Zhang, Guangyu Gao, Youyun Tang, ChengJing Wu, Xiaochao Qu, Chi Harold Liu, Jianbo Jiao, Yunchao Wei, Luoqi Liu, Ting Liu

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) WEI Lab, Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院WEI实验室) Beijing Key Laboratory of Advanced Information Science(北京高级信息科学重点实验室)

AI总结 针对大语言模型条件分割中语义错位问题,提出FlowSeg方法,通过双向语义流动态引导掩码生成,实现语义对齐并达到最优性能。

Comments 18 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29447 2026-05-29 cs.CV cs.CL

Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents

恢复策略诱导错误:鲁棒GUI智能体的基准测试与轨迹合成

Tianpeng Bu, Xin Liu, Qihua Chen, Hao Jiang, Shurui Li, Hongtao Duan, Lu Jiang, Lulu Hu, Bin Yang, Minying Zhang

机构 * alibaba(阿里巴巴)

AI总结 提出GUI-RobustEval基准和鲁棒驱动轨迹合成框架RoTS,通过树状管道主动发现错误模式并合成恢复步骤,训练模型在GUI任务上取得最先进性能。

Comments ICML 2026 Spotlight. 36 pages, 19 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29434 2026-05-29 cs.CR cs.AI cs.CL cs.LG

AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing

AliMark: 增强句子级水印对文本释义的鲁棒性

Yuexin Li, Wenjie Qu, Linyu Wu, Yulin Chen, Yufei He, Tri Cao, Bryan Hooi, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出AliMark框架,将句子级水印重构为比特序列编码与对齐问题,通过多候选对齐检测策略提升对句子拆分合并等结构扰动的鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29421 2026-05-29 cs.CL

Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design

将设计技能学习为记忆策略用于智能光子逆向设计

Shengchao Chen, Ting Shu, Sufen Ren

机构 * AAII, University of Technology Sydney(AAII,悉尼技术大学) School of Artificial Intelligence, Shenzhen University(人工智能学院,深圳大学) School of Information and Communication Engineering, Hainan University(信息与通信工程学院,海南大学)

AI总结 提出SkillPCF闭环智能体框架,通过物理引导的记忆技能库、强化学习技能选择和模拟器接地技能演化,解决光子晶体光纤逆向设计中的知识积累问题,在真实数据集上实现更优的设计质量与效率权衡。

Comments AI4Physics@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29380 2026-05-29 cs.LG cs.AI cs.CV

TRACER: Persistent Regularization for Robust Multimodal Finetuning

TRACER: 用于鲁棒多模态微调的持久正则化

Hesam Asadollahzadeh, Feng Liu, Christopher Leckie, Sarah M. Erfani

机构 * School of Computing and Information Systems (CIS), Faculty of Engineering and IT (FEIT), University of Melbourne, Australia(墨尔本大学计算机科学与信息系统学院(CIS)、工程与信息技术学院(FEIT))

AI总结 提出TRACER方法,通过加权移动平均教师实现持久正则化,解决多模态对比微调中的灾难性遗忘和EMA坍缩问题,提升分布外鲁棒性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29359 2026-05-29 cs.CY cs.AI

Does Distributed Training Undermine Compute Governance?

分布式训练是否会破坏计算治理?

Robi Rahman

机构 * Machine Intelligence Research Institute(机器智能研究所)

AI总结 本文探讨了分布式训练技术可能规避计算治理的可行性,并提出了包括举报、芯片追踪、法务会计以及集群内存和计算阈值在内的反制措施。

Comments TAIGR workshop in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29335 2026-05-29 cs.CV cs.AI

Rethinking FID Through the Geometry of the Reference Dataset

通过参考数据集的几何结构重新思考FID

Yunghee Lee, Byeonghyun Pak

AI总结 本文通过分析参考数据集的几何特性(密度和有效秩)来解释Fréchet Inception Distance (FID) 与样本质量之间的不一致性,并提出应结合参考数据集几何结构来更可靠地评估生成模型。

Comments 9 pages, 2 figures. Accepted to ICML 2026 Workshop: Combining Theory and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29295 2026-05-29 cs.NE

EvoGM: Learning to Merge LLMs via Evolutionary Generative Optimization

EvoGM: 通过进化生成优化学习合并大语言模型

Tao Jiang, Xinmeng Yu, Chenhao Yi, Yiling Wu, Yan Li, Ran Cheng, Dongmei Jiang, Jianguo Zhang

AI总结 提出EvoGM框架,利用可学习的生成建模优化合并系数,通过双生成器架构和循环一致性学习自适应采样和精炼候选模型,在多轮进化流程中迭代提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29247 2026-05-29 cs.AI cs.CL cs.LG

DenseSteer: Steering Small Language Models towards Dense Math Reasoning

DenseSteer: 引导小型语言模型进行密集数学推理

Yang Ouyang, Shuhang Lin, Jung-Eun Kim

机构 * North Carolina State University(北卡罗来纳州立大学) Rutgers University(罗格斯大学)

AI总结 提出DenseSteer,一种无需训练的推理时引导框架,通过调节内部表征向密集推理模式靠拢,提升小型模型在多步数学推理中的准确性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29184 2026-05-29 cs.LG cs.AI

Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback

影响引导的符号回归:基于大语言模型与细粒度反馈的方程搜索科学发现

Evgeny S. Saveliev, Samuel Holt, Nabeel Seedat, David L. Bentley, Jim Weatherall, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森·路透基础研究) U. Colorado, Anschutz Medical Campus(科罗拉多大学安舒茨医疗校区)

AI总结 提出影响引导符号回归(IGSR)方法,利用大语言模型生成候选函数并通过细粒度影响分数进行剪枝,结合蒙特卡洛树搜索高效探索组合空间,在多个基准和真实生物数据中发现新关系。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29153 2026-05-29 cs.LG cs.AI physics.comp-ph

Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization

揭示科学机器学习中的多机制模式:不同的失败模式与机制特定优化

Yuxin Wang, Yuanzhe Hu, Xiaokun Zhong, Xiaopeng Wang, Haiquan Lu, Tianyu Pang, Michael W. Mahoney, Yujun Yan, Pu Ren, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) University of California, San Diego(加州大学圣地亚哥分校) University of California, Berkeley(加州大学伯克利分校) National University of Singapore(新加坡国立大学) Lawrence Berkeley National Laboratory(伯克利国家实验室) International Computer Science Institute(国际计算机科学研究所)

AI总结 通过机制感知诊断框架,研究科学机器学习模型在不同超参数设置下的多机制行为,发现三种一致机制结构、优化效果的机制特异性以及精细失败模式,为提升鲁棒性提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29033 2026-05-29 cs.LG

Moment Matching Q-Learning

矩匹配Q学习

Yiyan, Liang, Sifei Liu, Weitong Zhang

机构 * School of Data and Information Science, University of North Carolina at Chapel Hill, Chapel Hill, USA(数据与信息科学学院,北卡罗来纳大学教堂山分校,教堂山,美国)

AI总结 提出矩匹配Q学习(MoMa QL)框架,利用最大均值差异(MMD)匹配原始分布与目标分布的所有阶统计量,实现条件得分函数的分布级收敛,在D4RL任务中计算效率高且性能相当,并在离线到在线强化学习中通过加速流策略的动作采样展现更优的适应性和性能。

Comments 23 pages, 14 figures, 10 tables, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏