arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-05-29 至 2026-05-29 共收录 128
2605.29028 2026-05-29 cs.LG cs.AI

Return-to-Go Is More Than a Number: Q-Guided Alignment for Return-Conditioned Supervised Learning

Return-to-Go 不仅仅是数字:面向返回条件监督学习的 Q 引导对齐

Yuxiao Yang, Weitong Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 提出 Q-ALIGN DT 框架,通过确保输出策略的 Q 值与输入 RTG 一致,实现返回条件序列模型中 RTG 与策略性能的对齐,在 D4RL 基准上取得优越的可控性和性能。

Comments 28 pages, 13 figures, 20 tables, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29005 2026-05-29 cs.LG cs.AI

LoRe: Adaptive Interaction-Evaluation Routing with Per-Step Interaction Budgets for Iterative Graph Solvers

LoRe: 基于每步交互预算的自适应交互评估路由用于迭代图求解器

Jintao Li, Yong-Yi Wang, Zheng-An Wang, Heng Fan

机构 * Beijing Key Laboratory of Fault-Tolerant Quantum Computing, Beijing Academy of Quantum Information Sciences, Beijing, China(北京容错量子计算重点实验室,量子信息科学北京市院,北京,中国) Beijing National Laboratory for Condensed Matter Physics, Institute of Physics, CAS, Beijing, China(北京凝聚态物理国家实验室,物理研究所,中国科学院,北京,中国) Beijing Key Laboratory of Advanced Quantum Technology, Beijing, China(北京先进量子技术重点实验室,北京,中国) Hefei National Laboratory, Hefei, China(合肥国家实验室,合肥,中国)

AI总结 提出LoRe方法,通过动态路由计算到高冲突或高不确定性交互,实现每步固定比例交互评估,在不牺牲解质量的前提下显著提升迭代图求解器的可扩展性和速度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29001 2026-05-29 cs.LG cs.AI

FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

FormInv:数学推理基准中语义不变性的测量协议

Nishal Thomas, Noel Thomas

机构 * Mohamed Bin Zayed University of Artificial Intelligence(Mohamed Bin Zayed人工智能大学)

AI总结 提出FormInv协议,通过跨模型一致性审计检测语义错误,并引入语义一致性率(SCR)和Cochran's Q指标,揭示标准基准无法捕捉的排名变化和模型不一致性。

Comments 18 pages, 3 figures. Under review for the 3rd AI for Math Workshop (AI4Math), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28920 2026-05-29 cs.LG cs.AI stat.ML

Conf-Gen: Conformal Uncertainty Quantification for Generative Models

Conf-Gen: 生成模型的共形不确定性量化

Gabriel Loaiza-Ganem, Kevin Zhang, Wei Cui, Marc T. Law, Kin Kwan Leung

机构 * layer6ai-labs(layer6ai实验室)

AI总结 提出Conf-Gen框架,通过共形风险控制适配生成任务,统一并扩展了共形预测在大型语言模型等生成模型中的应用,并在图像生成、对话AI和AI代理等新领域提供了形式化保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28902 2026-05-29 cs.AI

Orthogonal Concept Erasure for Diffusion Models

扩散模型的正交概念擦除

Yuhao Sun, Lingyun Yu, Haoxiang Xu, Fengyuan Miao, Zhuoer Xu, Hongtao Xie

机构 * University of Science(科学技术大学)

AI总结 提出正交概念擦除(OCE)方法,通过几何视角的乘法参数更新实现精确概念擦除,同时保持生成能力,支持多概念擦除。

Comments Accepted by ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28900 2026-05-29 cs.LG

Spectral Guidance for Flexible and Efficient Control of Diffusion Models

谱引导:灵活高效的扩散模型控制方法

Gabriel Moreira, Manuel Marques, João Paulo Costeira, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Institute for Systems and Robotics(系统与机器人研究所)

AI总结 提出谱引导框架,通过条件期望算子的奇异函数学习生成过程的固有几何结构,实现无需重训练或反向传播的稳定高保真控制,在CIFAR-10上条件准确率提升37个百分点且采样加速4倍。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28880 2026-05-29 cs.LG physics.data-an stat.ME

Towards Continuous-time Causal Foundation Models

迈向连续时间因果基础模型

Dennis Thumm, Ruben Wiedemann, Ying Chen

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院伦敦分校) Department of Mathematics, Centre for Quantitative Finance, Risk Management Institute, National University of Singapore(新加坡国立大学数学系、量化金融中心、风险管理研究所)

AI总结 提出轨迹律对观测时间表不变的连续性准则,通过细网格积分与解耦观测实现连续时间因果先验模型,并在线性与非线性先验上验证其优于离散方法。

Comments ICML 2026 2nd Workshop on Foundation Models for Structured Data (FMSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28293 2026-05-29 cs.LG cs.AI

ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation

ProRL: 通过修正策略梯度估计实现主动推荐的有效强化学习

Hongru Hou, Tiehua Mei, Denghui Geng, Jinhui Huang, Ao Xu, Hengrui Chen, Jiaqing Liang, Deqing Yang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国)

AI总结 针对主动推荐系统中策略梯度估计存在的长度依赖偏差和高方差问题,提出ProRL框架,通过逐步奖励中心化和位置特定优势估计两个机制修正梯度,显著提升推荐效果。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02116 2026-05-29 cs.LG

Statistical Consistency and Generalization of Contrastive Representation Learning

对比表示学习的统计一致性与泛化性

Yuanfan Li, Xiyuan Wei, Tianbao Yang, Yiming Ying

机构 * University of Sydney Texas A\&M University

AI总结 本文提出统一的统计学习理论,证明对比损失与最优排序统计一致,并推导出随负样本数增加而改善的泛化界,解释了大负样本集的经验优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01663 2026-05-29 cs.LG cs.RO

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

基于流锚定噪声条件Q学习的离线强化学习:高效且表达力强的方法

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali

机构 * The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Independent Researcher, Seoul, South Korea(首尔独立研究者)

AI总结 提出FAN算法,通过单次流策略迭代和单高斯噪声样本实现高效离线强化学习,在保持高性能的同时显著降低计算成本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00716 2026-05-29 cs.LG cs.SI

Aitchison Embeddings for Learning Compositional Graph Representations

用于学习组合图表示的Aitchison嵌入

Nikolaos Nakis, Chrysoula Kosma, Panagiotis Promponas, Michail Chatzianastasis, Giannis Nikolentzos

机构 * Human Nature Lab, Yale University, New Haven, USA(耶鲁大学人类本质实验室) Yale Institute for Network Science, Yale University, New Haven, USA(耶鲁大学网络科学研究所) Université Paris Saclay, Université Paris Cité, ENS Paris Saclay, CNRS, SSA, INSERM, Centre Borelli, Gif-sur-Yvette, France(巴黎萨克雷大学、巴黎城市大学、巴黎萨克雷高等师范学院、国家科学研究中心、SSA、国家医学研究院、Borelli研究中心,法国) Department of Informatics and Telecommunications, University of Peloponnese, Peloponnese, Greece(希腊皮洛斯大学信息与电信系)

AI总结 提出基于Aitchison几何的组合图嵌入框架,通过等距对数比坐标实现可解释的节点表示,在节点分类和链接预测任务中性能与强基线相当,并利用子成分一致性进行维度约简。

Comments ICML 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18518 2026-05-29 cs.CV cs.LG

UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models

UDM-GRPO:面向均匀离散扩散模型的稳定高效组相对策略优化

Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang, Yonggang Qi, Xinlong Wang

机构 * Beijing University of Posts(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对均匀离散扩散模型(UDM)与强化学习(RL)集成时训练不稳定、性能提升有限的问题,提出UDM-GRPO框架,通过将最终干净样本作为动作、利用扩散前向过程重建轨迹以及引入简化步数和无CFG策略,显著提升文本到图像生成任务的性能。

Comments UDM-GRPO is accepted by ICML 2026 (Spotlight). Code is available at https://github.com/Yovecent/UDM-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11080 2026-05-29 cs.CV cs.AI

ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation

ReSpinQuant: 通过子空间残差旋转近似实现高效逐层大模型量化

Suyoung Kim, Sunghyun Wee, Hyeonjin Kim, Kyomin Hwang, Hyunho Lee, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

AI总结 提出ReSpinQuant框架,通过离线激活旋转融合和高效子空间残差旋转匹配基,解决逐层量化方法在线计算开销大的问题,在W4A4和W3A3量化上达到最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00357 2026-05-29 cs.DC cs.SY eess.SY

SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

SPARe: 面向10万+GPU容错LLM预训练系统的堆叠并行与自适应重排序

Jin Lee, Zhonghao Chen, Xuhang He, Robert Underwood, Bogdan Nicolae, Franck Cappello, Xiaoyi Lu, Sheng Di, Zheng Zhang

AI总结 针对大规模LLM预训练中故障频繁导致重启开销主导训练时间的问题,提出SPARe框架,通过跨并行组堆叠冗余数据分片并自适应重排序执行顺序,在梯度同步中掩盖节点故障,实现接近传统复制的可用性且计算开销仅2~3倍,在60万GPU规模下训练时间减少40~50%。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17200 2026-05-29 cs.CV

GASS: Geometry-Aware Spherical Sampling for Disentangled Diversity Enhancement in Text-to-Image Generation

GASS: 几何感知球面采样用于文本到图像生成中解耦多样性增强

Ye Zhu, Kaleb S. Newman, Johannes F. Lutzeyer, Adriana Romero-Soriano, Michal Drozdzal, Olga Russakovsky

机构 * Laboratoire d'Informatique (LIX), CNRS, École Polytechnique, IPP, France(信息实验室(LIX),法国国家科学研究中心,巴黎高等技术学院,IPP,法国) Department of Computer Science, Princeton University, USA(计算机科学系,普林斯顿大学,美国) FAIR at Meta - Montreal, Canada(Meta FAIR - 加拿大蒙特利尔) McGill University, Canada(麦吉尔大学,加拿大) Mila, Quebec AI Institute, Canada(魁北克人工智能研究所,加拿大) Canada CIFAR AI chair(加拿大CIFAR人工智能主席)

AI总结 提出几何感知球面采样(GASS),通过正交分解CLIP嵌入中的提示相关与无关变异方向,沿两轴扩展投影分布以引导采样,在保持图像保真度和语义对齐的同时增强生成多样性。

Comments ICML 2026 Camera-ready. Code available at https://github.com/L-YeZhu/GASS_T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08013 2026-05-29 cs.AI

Small Agent Group is the Future of Digital Health

小型智能体群是数字健康的未来

Yuqiao Meng, Luoxi Tang, Dazheng Zhang, Rafael Brens, Elvys J. Romero, Nancy Guo, Safa Elkefi, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布inghamton分校) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出小型智能体群(SAG)通过协作推理替代单一大型模型,在数字健康中实现更优的有效性、可靠性和部署效率。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02909 2026-05-29 cs.AI cs.FL cs.LG

Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs

关于推理的推理:LLM中思维链令牌复杂度的BAPO界限

Kiran Tomlinson, Tobias Schnabel, Adith Swaminathan, Jennifer Neville

机构 * Microsoft Research, Redmond, WA(微软研究院,西雅图,华盛顿)

AI总结 通过扩展BAPO模型,证明二元多数、三元组匹配和图可达性三个任务需要Ω(n)个思维链令牌,实验验证了线性缩放与理论下界一致。

Comments 31 pages; accepted to ICML '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00324 2026-05-29 math.OC cs.CV cs.RO eess.SP

Dual Quaternion SE(3) Synchronization with Recovery Guarantees

对偶四元数 SE(3) 同步及其恢复保证

Jianing Zhao, Linglingzhi Zhu, Anthony Man-Cho So

机构 * Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Shatin, NT, Hong Kong(系统工程与工程管理系,香港中文大学(深圳)) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology, Atlanta, GA, USA(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

AI总结 采用对偶四元数表示,通过谱初始化和对偶四元数广义幂法实现 SE(3) 同步,并给出误差界和线性收敛保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23257 2026-05-29 cs.SE

From Historical Patches to Repair Plans: Outcome-Conditioned Reasoning for Repository-Level Program Repair

从历史补丁到修复计划:面向仓库级程序修复的结果条件推理

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

AI总结 提出条件推理蒸馏(ConRAD),通过从已验证补丁反向重构修复推理并蒸馏出结果一致的阶段性修复计划,在推理时引导故障定位和补丁生成,无需微调或搜索,在SWE-Bench Lite上显著提升Pass@1。

Comments ICML 2026,17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22661 2026-05-29 cs.SD

Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability

评估与奖励基于平均延续对数概率的表达性角色扮演TTS的LALM

Yong Ren, Jingbei Li, Haiyang Sun, Yujie Chen, Cheng Yi, Yechang Huang, Hao Gu, Ye Bai, Xuerui Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北京航空航天大学)

AI总结 提出平均延续对数概率(MCLP)作为评估指标和奖励信号,用于提升大型音频语言模型在角色扮演文本转语音任务中的风格一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22531 2026-05-29 cs.LG cs.AI

Learn from A Rationalist: Distilling Intermediate Interpretable Rationales

向理性主义者学习:蒸馏中间可解释原理

Jiayi Dai, Randy Goebel

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada(阿尔伯塔大学计算机科学系,加拿大埃德蒙顿) Alberta Machine Intelligence Institute, Edmonton, Canada(阿尔伯塔机器智能研究所,加拿大埃德蒙顿)

AI总结 提出REKD方法,通过知识蒸馏将教师模型的可解释原理和预测传授给学生模型,提升基于较弱神经网络的可解释原理提取模型的预测性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21725 2026-05-29 cs.CL cs.LG

Procedural Pretraining: Warming Up Language Models with Abstract Data

程序化预训练:用抽象数据预热语言模型

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney

机构 * EPFL(苏黎世联邦理工学院) Idiap Research Institute(伊迪普研究机构) AIML, Adelaide University(人工智能实验室,阿德莱德大学)

AI总结 提出程序化预训练方法,通过在抽象结构化数据(如形式语言生成的程序数据)上预训练语言模型,显著提升其推理能力并加速后续语义知识学习,实验表明仅需0.1-0.3%的程序数据即可超越标准预训练。

Comments ICML 2026. Project page: https://zlshinnick.github.io/procedural-pretraining-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20255 2026-05-29 cs.LG cs.CL cs.SE

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

HE-SNR:通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所)

AI总结 针对SWE-bench基准,提出基于熵压缩假说的HE-SNR指标,通过细粒度熵分析指导中期训练数据筛选,在高达560B参数模型上验证有效性。

Comments Accepted at ICML 2026. 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00283 2026-05-29 cs.LG cs.AI q-bio.QM

BioArc: Discovering Optimal Neural Architectures for Biological Foundation Models

BioArc:发现生物学基础模型的最优神经架构

Yi Fang, Haoran Xu, Jiaxin Han, Sirui Ding, Yizhi Wang, Yue Wang, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机科学系) Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学计算机科学系) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)

AI总结 针对现有基础模型架构直接迁移至生物学领域时忽视生物数据独特性质的问题,提出BioArc框架,利用神经架构搜索系统探索架构设计空间,发现高性能架构并提炼设计原则,同时提出架构预测方法以高效预测新任务的最优架构。

Comments Accepted at the 43nd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14584 2026-05-29 cs.LG cs.AI

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

ReflexGrad: 基于进度门控双过程路由的LLM智能体片段内故障恢复

Ankush Kadu, Aswanth Krishnan

AI总结 提出ReflexGrad双过程架构,通过进度门控路由在无演示条件下实现LLM智能体片段内故障恢复,显著提升任务成功率。

Comments 18 pages, 4 figures, 10 tables. Accepted at ICML 2026 FoGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26412 2026-05-29 cs.CV cs.AI

LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation

LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试

Xiangqing Zheng, Chengyue Wu, Kehai Chen, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) The University of Hong Kong(香港大学)

AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。

Comments Accepted by ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12152 2026-05-29 stat.ML cs.LG

Follow-the-Perturbed-Leader for Decoupled Bandits: Best-of-Both-Worlds and Practicality

解耦赌博机的跟随扰动领导者:两全其美与实用性

Chaiwon Kim, Jongyeong Lee, Min-hwan Oh

机构 * Seoul National University, Seoul, Korea(首尔国立大学,韩国首尔) Korea Institute of Science and Technology, Seoul, Korea(韩国科学技术院,韩国首尔)

AI总结 针对解耦多臂赌博机问题,提出一种高效的跟随扰动领导者策略,在随机环境下实现常数遗憾,在对抗环境下实现最优O(√KT)遗憾,且避免了凸优化和重采样过程,显著降低计算成本。

Comments Accepted to ICML 2026, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10020 2026-05-29 stat.ML cs.LG q-bio.BM

Calibrating Generative Models to Distributional Constraints

生成模型的分布约束校准

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe

机构 * Stanford University, Palo Alto, CA USA(斯坦福大学)

AI总结 针对生成模型采样分布统计量偏离期望的校准问题,提出将校准形式化为受约束优化问题,并通过松弛损失和奖励损失两种替代目标进行微调,在蛋白质设计、图像生成和语言建模等应用中显著降低了数百个同时约束下的校准误差。

Comments To appear at the International Conference on Machine Learning (ICML), 2026. Codebase accompanying the paper is available at: https://github.com/smithhenryd/cgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03013 2026-05-29 cs.LG

Distributional Inverse Reinforcement Learning

分布逆强化学习

Feiyang Wu, Ye Zhao, Anqi Wu

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, USA(计算科学与工程学院,佐治亚理工学院,美国亚特兰大) George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, USA(乔治·W·伍德鲁夫机械工程学院,佐治亚理工学院,美国亚特兰大)

AI总结 提出一种离线逆强化学习的分布框架,通过最小化一阶随机占优违反并整合扭曲风险度量,联合建模奖励函数的不确定性和回报的完整分布,实现奖励分布和分布感知策略的恢复。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏