arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9455
2603.21546 2026-03-24 cs.LG cs.AI

What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulators

世界模型在强化学习中学习了什么?在学习的环境模拟器中探测潜在表示

Xinyu Zhang

机构 * Anyscale

AI总结 研究通过线性与非线性探针、因果干预和注意力分析,探讨了IRIS和DIAMOND两种架构的世界模型对游戏状态的内部表示,发现其具有近似线性的结构化表示。

Comments 5 pages, 3 figures, 1 table

Journal ref ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21485 2026-03-24 cs.LG

Off-Policy Evaluation for Ranking Policies under Deterministic Logging Policies

基于确定性日志策略的排序策略离策略评估

Koichi Tanaka, Kazuki Kawamura, Takanori Muroi, Yusuke Narita, Yuki Sasamoto, Kei Tateno, Takuma Udagawa, Wei-Wei Du, Yuta Saito

机构 * Keio University(keio大学) Sony Group Corporation(sony集团) Yale University(yale大学) Hanuku-kaso, Co., Ltd.(hanuku-kaso公司)

AI总结 本文提出Click-based Inverse Propensity Score估计器,利用用户点击行为的内在随机性,在确定性日志策略下实现低偏差的离策略评估。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27419 2026-03-24 cs.AI cs.CL

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

DeepCompress:一种双奖励策略用于动态探索和压缩推理链

Tian Liang, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17699 2026-03-24 cs.CV cs.LG

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

GAS:通过通用对抗求解器改进扩散ODE的离散化

Aleksandr Oganov, Ilya Bykov, Eva Neudachina, Mishan Aliev, Alexander Tolmachev, Alexander Sidorov, Aleksandr Zuev, Andrey Okhotin, Denis Rakitin, Aibek Alanov

机构 * HSE University(俄罗斯高等经济学院) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所)

AI总结 本文提出通用对抗求解器,通过结合原蒸馏损失与对抗训练,提升扩散模型细节保真度,无需复杂训练技巧,实现更高效的ODE离散化。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10154 2026-03-24 cs.RO

CompassNav: Steering From Path Imitation To Decision Understanding In Navigation

CompassNav: 从路径模仿到决策理解的导航导航

LinFeng Li, Jian Zhao, Yuan Xie, Xin Tan, Xuelong Li

机构 * East China Normal University(东华师范大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出CompassNav方法,通过引入Compass-Data-22k数据集和gap-aware奖励函数,使导航代理能理解而非单纯模仿路径,实现更高效的导航性能。

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19988 2026-03-24 stat.ML cs.LG q-bio.QM

BioBO: Biology-informed Bayesian Optimization for Perturbation Design

BioBO:结合生物学知识的贝叶斯优化用于扰动设计

Yanke Li, Tianyu Cui, Tommaso Mansi, Mangal Prakash, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药) ETH Zurich(苏黎世联邦理工学院)

AI总结 BioBO结合多模态基因嵌入和富集分析,提升代理建模和获取策略,提高标签效率25-40%,并提供路径级解释,链接设计与生物调控电路。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-03-24 cs.LG cs.PL

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14186 2026-03-24 cs.RO cs.LG cs.SY eess.SY

Differentiable Simulation of Hard Contacts with Soft Gradients for Learning and Control

可微模拟硬接触与软梯度用于学习与控制

Anselm Paulus, A. René Geist, Pierre Schumacher, Vít Musil, Simon Rappenecker, Georg Martius

机构 * University of Tübingen(图宾根大学) Masaryk University(马萨里克大学)

AI总结 本文提出DiffMJX,通过结合自适应时间积分与惩罚模拟提升梯度精度,并引入接触距离(CFD)解决接触梯度消失问题,提高仿真与现实的匹配度。

Journal ref A. Paulus, A. R. Geist, et al., Differentiable Simulation of Hard Contacts with Soft Gradients for Learning and Control. In The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04559 2026-03-24 cs.CV

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15054 2026-03-24 cs.CL cs.AI cs.LG q-bio.BM

MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation

MolLangBench: 一种全面的分子结构识别、编辑和生成语言提示基准

Feiyang Cai, Jiahui Bai, Tao Tang, Guijuan He, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) HitGen University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出MolLangBench,用于评估分子语言接口任务,发现现有模型在分子识别和编辑任务上表现欠佳,生成任务更差,强调了对化学应用中更可靠AI系统的研发需求。

Comments ICLR-2026 Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02246 2026-03-24 cs.CV cs.AI cs.LG stat.ML

Conditional Variational Diffusion Models

条件变分扩散模型

Gabriel della Maggiora, Luis Alberto Croquevielle, Nikita Deshpande, Harry Horsley, Thomas Heinis, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(先进系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Bladder Infection and Immunity Group (BIIG), UCL Centre for Kidney and Bladder Health(膀胱感染与免疫组(BIIG),UCL肾与膀胱健康中心) Division of Medicine, University College London(伦敦大学学院医学系) Institute of Computer Science, University of Wrocław(沃斯克大学计算机科学研究所)

AI总结 本文提出一种在训练过程中学习方差调度的方法,用于解决逆问题,适用于超分辨率显微镜和定量相成像,实现高质量解决方案。

Comments Denoising Diffusion Probabilistic Models, Inverse Problems, Generative Models, Super Resolution, Phase Quantification, Variational Methods

Journal ref In The Twelfth International Conference on Learning Representations. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21169 2026-03-24 cs.LG

Model Evolution Under Zeroth-Order Optimization: A Neural Tangent Kernel Perspective

零阶优化下的模型演化:神经切线核视角

Chen Zhang, Yuxin Cheng, Chenchen Ding, Shuqi Wang, Jingreng Lei, Runsheng Yu, Yik-Chung WU, Ngai Wong

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文从神经切线核视角探讨零阶优化下的模型演化,证明线性模型中预期NZK恒定,提出通过NZK解释零阶更新的核梯度下降,实验证实理论结果并展示加速效果。

Comments ICLR 2026 Workshop on Scientific Methods for Understanding Deep Learning (20 pages, 18 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21115 2026-03-24 cs.CV

LiFR-Seg: Anytime High-Frame-Rate Segmentation via Event-Guided Propagation

LiFR-Seg: 通过事件引导传播实现任意时刻高帧率分割

Xiaoshan Wu, Xiaoyang Lyu, Yifei Yu, Bo Wang, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出LiFR-Seg框架,通过事件驱动的运动场和不确定性感知的变形过程,在仅使用单帧RGB图像和异步事件数据的情况下实现任意时刻的高帧率语义分割。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21096 2026-03-24 cs.LG cs.AI cs.CL

Mixture of Chapters: Scaling Learnt Memory in Transformers

章节混合:在变换器中扩展学习记忆

Tasmay Pankaj Tibrewal, Pritish Saha, Ankit Meda, Kunal Singh, Pradeep Moturi

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Fractal AI

AI总结 本文提出学习稀疏内存银行,通过交叉注意力机制使变换器层检索存储知识,通过章节路由扩展内存容量,实验证明模型在预训练和指令微调中优于基线,展示显式关联记忆的补充能力。

Comments 20 pages, 2 figures, 8 tables. Accepted at ICLR 2026 New Frontiers in Associative Memory Workshop. Code available at https://github.com/Tasmay-Tibrewal/Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21051 2026-03-24 cs.RO

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

皮层策略:一种双流视图变换器用于机器人操作

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。

Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20777 2026-03-24 cs.LG cs.AI cs.CV

OmniPatch: A Universal Adversarial Patch for ViT-CNN Cross-Architecture Transfer in Semantic Segmentation

OmniPatch: 一种适用于ViT-CNN跨架构迁移的通用对抗补丁

Aarush Aggarwal, Akshat Tomar, Amritanshu Tiwari, Sargam Goyal

机构 * Data Science Group, Indian Institute of Technology Roorkee(数据科学组,印度理工学院罗里克分校)

AI总结 本文提出OmniPatch,一种能跨图像和ViT-CNN架构通用的对抗补丁训练框架,无需目标模型参数即可提升语义分割的鲁棒性。

Comments 10 pages, 4 figures, ICLR 2026: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08104 2026-03-24 cs.LG

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

不可见的安全威胁:通过隐写术对LLM进行恶意微调

Guangnian Wan, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03251 2026-03-24 cs.LG

Speculative Speculative Decoding

推测性推测解码

Tanishq Kumar, Tri Dao, Avner May

AI总结 本文提出推测性推测解码(SSD),通过并行化推测与验证过程提升解码效率,实现30%以上速度提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23306 2026-03-24 cs.CV

ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding

ThinkOmni: 通过指导解码将文本推理提升到多模态场景

Yiran Guan, Sifan Tu, Dingkang Liang, Linghao Zhu, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(小米公司)

AI总结 ThinkOmni提出一种无需训练和数据的框架,通过指导解码将文本推理扩展到多模态场景,实验显示在多个多模态推理基准上取得显著提升。

Comments Accept by ICLR 2026, Code: https://github.com/1ranGuan/thinkomni

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10541 2026-03-24 math.NA cs.LG cs.NA

FastLSQ: Solving PDEs in One Shot via Fourier Features with Exact Analytical Derivatives

FastLSQ:通过傅里叶特征一次性求解偏微分方程

Antonin Sulc

机构 * Lawrence Berkeley National Laboratory(伯克利国家实验室)

AI总结 FastLSQ利用三角随机傅里叶特征和精确解析导数,高效求解偏微分方程及反问题,实现线性问题一次最小二乘调用,非线性问题通过牛顿-拉夫森法重用解析装配,性能显著优于迭代PINNs。

Comments 9 pages, 4 figure, Accepted at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01003 2026-03-24 cs.LG cs.RO

Contractive Diffusion Policies: Robust Action Diffusion via Contractive Score-Based Sampling with Differential Equations

收缩扩散策略:通过微分方程的收缩分数基采样实现鲁棒动作扩散

Amin Abyaneh, Charlotte Morissette, Mohamad H. Danesh, Anas El Houssaini, David Meger, Gregory Dudek, Hsiu-Chin Lin

机构 * Department of Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系) Department of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila–Quebec AI Institute(魁北克人工智能研究所)

AI总结 本文提出收缩扩散策略,通过引入收缩行为提升扩散采样动态的鲁棒性,减少求解和分数匹配误差,降低动作方差,在数据稀缺情况下表现优异。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14395 2026-03-24 cs.AI

Massive Editing for Large Language Models Based on Dynamic Weight Generation

基于动态权重生成的大型语言模型大规模编辑

Wentao Wan, Qiqing Lao, Zhiwei Xie, Hefeng Wu, Runnan Lin, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学)

AI总结 本文提出基于动态权重生成的大型语言模型大规模编辑方法,通过动态权重神经元提升知识编辑的可靠性、通用性和局部性指标。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12060 2026-03-24 cs.LG cs.AI cs.CV

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

你的VAR模型实际上是一个高效且可解释的生成分类器

Yi-Chung Chen, David I. Inouye, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃洛姆家族电气与计算机工程学院)

AI总结 本文提出基于视觉自回归模型的新型生成分类器,引入A-VARC+提升准确率与推理速度,展示VAR方法在可解释性和灾难性遗忘抵抗方面的独特优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06552 2026-03-24 cs.CL

Flipping the Dialogue: Training and Evaluating User Language Models

翻转对话:训练和评估用户语言模型

Tarek Naous, Philippe Laban, Wei Xu, Jennifer Neville

机构 * Microsoft Research(微软研究院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出User LMs,通过多轮对话模拟人类用户,验证其在真实场景下优于传统模拟方法,提升评估准确性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01641 2026-03-24 cs.CV

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24817 2026-03-24 cs.CV

UP2You: Fast Reconstruction of Yourself from Unconstrained Photo Collections

UP2You:从无约束照片集合中快速重建自己

Zeyu Cai, Ziyang Li, Xiaoben Li, Boqian Li, Zeyu Wang, Zhenyu Zhang, Yuliang Xiu

机构 * Westlake University(西湖大学) Nanjing University(南京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 UP2You通过数据校正方法高效处理无结构照片,实现高保真的3D人物重建,无需预设模板,提升几何精度和纹理保真度。

Comments Page: https://zcai0612.github.io/UP2You Code: https://github.com/zcai0612/UP2You

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23774 2026-03-24 cs.CV

Texture Vector-Quantization and Reconstruction Aware Prediction for Generative Super-Resolution

纹理向量量化与重建感知预测用于生成超分辨率

Qifan Li, Jiale Zou, Jinhua Zhang, Wei Long, Xingyu Zhou, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出纹理向量量化与重建感知预测策略,解决VQ模型中量化误差大和预测器训练不优的问题,实现低计算成本的高质量超分辨率生成。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏