arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

共收录 11791
2605.23323 2026-05-25 eess.IV cs.CV

Efficient Learned Image Compression without Entropy Coding

无需熵编码的高效学习图像压缩

Hao Cao, Wenqi Guo, Zhijin Qin, Jungong Han

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory of Space Network(空间网络与通信国家重点实验室) Beijing National Research Center for Information Science(北京信息科学国家研究中心)

AI总结 提出一种无需熵编码的多速率学习图像压缩框架EF-LIC,通过无约束向量量化和上下文条件自回归变换消除统计与相关冗余,在保持压缩性能的同时显著降低编码延迟。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23282 2026-05-25 eess.IV cs.CV cs.LG

Discontinuous Galerkin Neural Operator for Pathology Defocus Deblurring

病理学离焦去模糊的间断伽辽金神经算子

Shaoqing Duan, Haofei Song, Xintian Mao, Qingli Li, Yan Wang

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University, Shanghai, China(上海多维信息处理关键实验室,华东师范大学,上海,中国)

AI总结 提出间断伽辽金神经算子(DGNO),通过间断伽辽金公式参数化积分核,解决病理显微镜中空间变化和局部不连续的离焦模糊问题,实现优于现有方法的去模糊效果。

Comments 17 pages, 9 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23275 2026-05-25 cs.LG

Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models

扩散域扩展:学习协调预训练扩散模型

Egor Lifar, Semyon Savkin, Timur Garipov, Shangyuan Tong, Tommi Jaakkola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 提出扩散域扩展(DDE)方法,通过紧凑可训练网络协调预训练扩散模型的去噪输出,以生成更大对象并处理更复杂条件,在长音频生成和条件图像生成中优于其他方法。

Comments Accepted as poster at ICML 2024 Workshop on Structured Probabilistic Inference and Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23265 2026-05-25 cs.DS

Fairness in Aggregation: Optimal Top-$k$ and Improved Full Ranking

聚合中的公平性:最优Top-$k$和改进的全排名

Diptarka Chakraborty, Arya Mazumdar, Barna Saha, Alvin Hong Yao Yan

AI总结 针对算法排名系统中的公平性问题,提出了最优的公平Top-$k$聚合算法,并将公平全排名的近似比从3改进到2。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23257 2026-05-25 cs.RO cs.CV

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation

将适应转化为资产:面向在线视觉语言导航的跨域桥接

Zixuan Hu, Xuantuo Huang, Yancheng Li, Yichun Hu, Shengyong Xu, Ling-Yu Duan

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) School of Electronics, Peking University, Beijing, China(北京大学电子学院)

AI总结 提出 IDEA 框架,通过 Fisher 引导的软提示优化和动态资产库构建跨域桥接,解决视觉语言导航中测试时适应的灾难性遗忘和负迁移问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23254 2026-05-25 cs.CV

CARE: Class-Adaptive Expert Consensus for Reliable Learning with Long-Tailed Noisy Labels

CARE: 面向长尾噪声标签可靠学习的类别自适应专家共识

Mengke Li, Haiquan Ling, Lihao Chen, Yang Lu, Yiqun Zhang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University, Shenzhen, China.(深圳大学计算机科学与软件工程学院,中国深圳) Guangming Laboratory, Shenzhen, China.(深圳广明实验室,中国深圳) School of Informatics, Xiamen University, Xiamen, China.(厦门大学信息学院,中国厦门) School of Computer Science and Technology, Guangdong University of Technology, Guangzhou, China(广东工业大学计算机科学与技术学院,中国广州)

AI总结 提出CARE框架,利用视觉语言模型的三种互补监督源,通过类别自适应专家共识机制,根据类别频率对尾部类施加更严格的一致性、对头部类施加更宽松的一致性,以过滤不可靠信号并重新校准类别分布,从而在长尾噪声标签下实现可靠修正。

Comments poster in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23087 2026-05-25 cs.LG

The Implicit Bias of Depth: From Neural Collapse to Softmax Codes

深度的隐式偏差:从神经坍缩到Softmax编码

Connall Garrod, Jonathan P. Keating, Christos Thrampoulidis

机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) Department of Electrical and Computer Engineering, University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)

AI总结 研究深度无约束特征模型在无正则化训练下,梯度下降和深度如何诱导低秩隐式偏差,从而从神经坍缩转向softmax编码,并分析训练动态和宽度的影响。

Comments 46 pages, 11 figures, accepted at the International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23078 2026-05-25 cs.LG cs.CL

GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

GEMQ:MoE大语言模型的全局专家级混合精度量化

Jianing Deng, Song Wang, Dongwei Wang, Zijie Liu, Tianlong Chen, Huanrui Yang, Jingtong Hu

机构 * University of Pittsburgh(匹兹堡大学) University of Central Florida(佛罗里达州立大学) University of Arizona(亚利桑那大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 提出全局专家级混合精度量化方法GEMQ,通过全局线性规划建模专家重要性并微调路由器,实现MoE-LLMs的极致低比特量化,减少内存并加速推理。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23043 2026-05-25 cs.CL stat.ML

HawkesLLM: Semantic Uncertainty Propagation in Agentic Text Simulation

HawkesLLM:智能体文本模拟中的语义不确定性传播

Zewei Deng, Tinghan Ye, Liyan Xie

机构 * Department of Industrial and Systems Engineering, University of Minnesota(工业与系统工程系,明尼苏达大学) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

AI总结 提出HawkesLLM框架,通过多变量Hawkes过程建模时间影响与文本生成分离,解决智能体文本模拟中语义不确定性路径依赖问题,在GDELT新闻级联案例中提升后期语义对齐。

Comments 10 pages, 4 figures, Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22981 2026-05-25 cs.CL cs.AI cs.LG

Memorization Dynamics of Fill-in-the-Middle Pretraining

Fill-in-the-Middle 预训练的记忆动态

Tobias von Arx, Tanguy Dieudonné

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

AI总结 通过对比 FIM 与标准 LTR 预训练,研究 FIM 对逐字记忆的影响,发现 FIM 更易恢复短片段或部分匹配,而 LTR 对长精确延续置信度更高,且 FIM 训练下的逐字提取随重复次数近似线性增长。

Comments MemFM @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22635 2026-05-25 cs.LG cs.CL cs.CV

The Double Dilemma in Multi-Task Radiology Report Generation: A Gradient Dynamics Analysis and Solution

多任务放射学报告生成中的双重困境:梯度动力学分析与解决方案

Erjian Zhang, Yatong Hao, Liejun Wang, Zhiqing Guo

机构 * School of Computer Science and Technology(计算机科学与技术学院) Xinjiang University(新疆大学) Information Security Engineering Technology Research Center(信息安全工程技术研究中心)

AI总结 针对多任务放射学报告生成中线性标量化策略无法平衡判别性临床监督与生成平滑性的问题,提出基于梯度动力学的冲突规避幅度增强梯度下降(CAME-Grad)优化器,通过方向修正与能量注入实现动态平衡,在八个方法上平均提升2.3%和1.9%的临床效能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22252 2026-05-25 cs.CE

LineageFlow: Flow Matching for High-Fidelity Family-Aware Protein Sequence Generation

LineageFlow: 用于高保真家族感知蛋白质序列生成的流匹配

Langzhang Liang, Ming Yang, Yi Feng, Junfan Li, Shirui Pan, Yinghui Xu, Tianlei Ying, Yizhen Zheng, Zenglin Xu

AI总结 提出LineageFlow,一种基于Dirichlet流匹配的模型,通过从祖先序列重建得到的谱系先验初始化生成,将生成转化为从进化支架的结构化突变,实现高家族有效性和结构置信度,并引入重路由干预实现无逐步骤指导的目标导向采样。

Comments Accepted at ICML 2026. 23 pages, 5 figures. Code: https://github.com/Jinx-byebye/LineageFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18993 2026-05-25 cs.LG cs.AI

Distilling Linearized Behavior into Non-Linear Fine-Tuning for Effective Task Arithmetic

将线性化行为蒸馏到非线性微调中以实现有效的任务算术

Thomas Sommariva, Francesca Morandi, Simone Calderara, Angelo Porrello

机构 * University of Pisa, Italy(比萨大学,意大利)

AI总结 提出通过激活空间约束将线性化模型的低干扰特性蒸馏到标准非线性微调中,实现高效任务向量组合且无推理开销。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19000 2026-05-25 cs.LG cs.AI

Decompose, Structure, and Repair: A Neuro-Symbolic Framework for Autoformalization via Operator Trees

分解、结构化与修复:基于操作树的神经符号自动形式化框架

Xiaoyang Liu, Zineng Dong, Yifan Bai, Yantao Li, Yuntian Liu, Tao Luo

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) Institute of Natural Sciences, MOE-LSC, CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学自然科学研究院)

AI总结 提出DSR神经符号框架,通过将数学语句分解为逻辑组件并映射为结构化操作树,利用子树精炼定位和修复错误,在PRIME基准上达到新最优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04005 2026-05-25 cs.IT cs.LG math.IT

Training-Free Rate-Distortion-Perception Traversal With Diffusion

无训练率失真感知遍历与扩散

Yuhan Wang, Suzhi Bi, Ying-Jun Angela Zhang

机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(信息工程系,香港中文大学,香港) College of Electronic and Information Engineering, Shenzhen University, Shenzhen(电子与信息工程学院,深圳大学,深圳)

AI总结 提出一种无需重新训练、利用预训练扩散模型遍历率失真感知(RDP)曲面的框架,结合反向信道编码与分数缩放概率流ODE解码器,理论证明其在AWGN下最优,实验验证其灵活性和有效性。

Comments Accepted by the Forty-Third International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07252 2026-05-25 stat.ME

Beyond Euclidean Summaries: Online Change Point Detection for Distribution-Valued Data

超越欧几里得摘要:面向分布值数据的在线变点检测

Yingyan Zeng, Yujing Huang, Xiaoyu Chen

AI总结 提出一种基于2-Wasserstein空间的分布值变点检测框架,通过切空间线性化将经典多元监控统计量适配到分布流形,实现对复杂分布变化的快速检测。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. C

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02780 2026-05-25 cs.AI cs.LG

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Scaling-Aware Adapter for Structure-Grounded LLM Reasoning

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Yi Li, Yan Sun, Boyu Wang, Pingzhao Hu

机构 * Department of Computer Science, Western University, London, Canada(加拿大伦敦西方大学计算机科学系) Department of Biochemistry, Western University, London, Canada(加拿大伦敦西方大学生物化学系)

AI总结 提出Cuttlefish,一种统一多模态大语言模型,通过缩放感知适配器和几何基础适配器,自适应调整结构令牌数量并注入几何线索,以提升异构结构推理性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01449 2026-05-25 math.NA cs.NA math.PR stat.ML

Dimension-Free Multimodal Sampling via Preconditioned Annealed Langevin Dynamics

无维度多模态采样:基于预处理退火朗之万动力学

Lorenzo Baldassari, Josselin Garnier, Knut Solna, Maarten V. de Hoop

AI总结 针对函数空间问题有限维近似细化下保持稳定的多模态目标采样算法,提出预处理退火朗之万动力学,在谱条件下实现维度一致的时间复杂度内的高斯混合目标采样。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22367 2026-05-25 stat.ML cs.LG

Amortized Simulation-Based Inference in Generalized Bayes via Neural Posterior Estimation

通过神经后验估计在广义贝叶斯中进行摊销的基于模拟的推理

Shiyi Sun, Geoff K. Nicholls, Jeong Eun Lee

机构 * Department of Statistics, University of Oxford, Oxford, United Kingdom(英国牛津大学统计系) Department of Statistics, University of Auckland, Auckland, New Zealand(新西兰奥克兰大学统计系)

AI总结 提出一种通过训练单一数据与β条件神经后验估计器来摊销广义贝叶斯推理中温度参数β的方法,无需模拟器调用或推理时MCMC,实现单次前向传播采样。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21766 2026-05-25 cs.CL cs.AI

CoFrGeNet: Continued Fraction Architectures for Language Generation

CoFrGeNet:用于语言生成的连分式架构

Amit Dhurandhar, Vijil Chenthamarakshan, Dennis Wei, Tejaswini Pedapati, Karthikeyan Natesan Ramamurthy, Rahul Nair

机构 * IBM Research(IBM研究院)

AI总结 受连分式启发,提出CoFrGeNet架构,用新函数类替换Transformer中的多头注意力和前馈网络,在参数量减少1/2至2/3的情况下,在下游分类、问答、推理和文本理解任务上达到或超越原模型性能。

Comments Earlier version accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21692 2026-05-25 cs.AI

TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning

TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析

Mingzu Liu, Hao Fang, Runmin Cong

机构 * School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国) Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)

AI总结 针对微调即服务中的后门攻击,提出基于三组件注意力分布差异的无监督防御框架TCAP,通过高斯混合模型和EM投票聚合检测中毒样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21198 2026-05-25 cs.DC cs.AI cs.LG

ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling

ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务

Yuchen Yang, Yaru Zhao, Pu Yang, Shaowei Wang, Zhi-Hua Zhou

机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)

AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17261 2026-05-25 cs.LG

AGZO: Activation-Guided Zeroth-Order Optimization for LLM Fine-Tuning

AGZO:用于大语言模型微调的激活引导零阶优化

Wei Lin, Yining Jiang, Qingyu Song, Qiao Xiang, Hong Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学计算机科学与工程系) Xiamen University, China(厦门大学)

AI总结 提出激活引导零阶优化方法AGZO,利用前向传播中的激活结构限制扰动到低秩子空间,在保持低内存的同时提升更新方向与真实梯度的余弦相似度,缩小与一阶微调的性能差距。

Comments 21 pages in total, including 9 pages of main text, with 4 figures and 3 tables Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21270 2026-05-25 cs.CL cs.AI cs.CV

Sparser Block-Sparse Attention via Token Permutation

通过令牌置换实现更稀疏的块稀疏注意力

Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出一种基于令牌置换的块稀疏注意力方法(PBS-Attn),通过利用注意力的置换性质增加块级稀疏性,在长上下文预填充中实现高达2.75倍的端到端加速,同时保持模型精度接近全注意力基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00526 2026-05-25 cs.CL cs.LG

Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum

超越对数似然:面向模型能力连续体的监督微调概率目标

Gaotang Li, Ruizhong Qiu, Xiusi Chen, Heng Ji, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文系统研究监督微调中不同概率目标函数,发现模型能力连续体决定目标优劣:强模型端偏好先验倾向目标(如-p),弱模型端对数似然最优,并理论解释其转换机制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10016 2026-05-25 cs.CL

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04390 2026-05-25 cs.CR cs.AI

Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG

通过隐秘视角:检索增强生成中针对投毒攻击的注意力感知防御

Sarthak Choudhary, Nils Palumbo, Ashish Hooda, Krishnamurthy Dj Dvijotham, Somesh Jha

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ServiceNow Research(ServiceNow研究)

AI总结 针对检索增强生成系统在低污染率下仍易受投毒攻击的问题,提出基于注意力权重的归一化段落注意力分数和注意力方差滤波器,实现高精度检测与防御,并揭示真正隐秘投毒的挑战。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04230 2026-05-25 cs.SD cs.AI cs.CR cs.LG eess.AS

XAttnMark: Learning Robust Audio Watermarking with Cross-Attention

XAttnMark:基于交叉注意力的鲁棒音频水印学习

Yixin Liu, Lie Lu, Jihui Jin, Lichao Sun, Andrea Fanelli

机构 * Department of Computer Science, Lehigh University, Bethlehem, PA, USA(莱文斯顿大学计算机科学系) Dolby Laboratories Inc., San Francisco, CA, USA(杜比实验室公司)

AI总结 提出XAttnMark,通过生成器与检测器的部分参数共享、交叉注意力机制和时间条件模块,结合心理声学对齐的时频掩蔽损失,在音频水印的鲁棒检测和准确归因上达到最优性能。

Comments Accepted at ICML'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21306 2026-05-25 cs.LG cs.AI

The Surprising Difficulty of Search in Model-Based Reinforcement Learning

基于模型的强化学习中搜索的惊人困难

Wei-Di Chang, Mikael Henaff, Brandon Amos, Gregory Dudek, Scott Fujimoto

机构 * Meta FAIR McGill University(麦吉尔大学)

AI总结 本文研究基于模型的强化学习中的搜索问题,发现即使模型高度准确,搜索也可能损害性能,而缓解过估计偏差比提高模型或价值函数精度更重要,通过取价值函数集成的最小值可有效解决偏差并实现有效搜索。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏