arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6506 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 模型式强化学习 1126 篇

2603.05969 2026-08-07 cs.CV cs.AI cs.CL 56%

Imagine How To Change: Explicit Procedure Modeling for Change Captioning

想象如何改变:用于变化描述的显式过程建模

Jiayang Sun, Zixin Guo, Min Cao, Guibo Zhu, Jorma Laaksonen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Department of Computer Science, Aalto University(阿alto大学计算机科学系) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.CV

AI总结 ProCap通过动态过程建模改进变化描述,利用关键帧和可学习查询提升描述准确性与效率。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/BlueberryOreo/ProCap

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 56%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19849 2026-08-04 cs.AI cs.LG 版本更新 56%

Near-Optimal Reinforcement Learning for Constrained Recurrence Objectives

具有$ω$-正则目标和约束的强化学习

Dominik Wagner, Leon Witzman, Luke Ong

机构 * NTU Singapore(南洋理工大学)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合$ω$-正则目标与约束的强化学习算法,以解决安全性和性能之间的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25459 2026-07-29 cs.LG cs.AI q-fin.ST 新提交 56%

Emergent Latent-State Computation under Stochastic Volatility

随机波动率下的涌现潜态计算

Xiaoyu Huang, Lulu Wang

机构 * Temple University(天普大学) Dickinson College(迪金森学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07075 2026-07-24 physics.chem-ph cs.AI cs.CL cs.LG 56%

LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning

LatentChem: 从文本思维链到化学推理中的潜在思考

Xinwu Ye, Yicheng Mao, Yuxuan Liao, Jia Zhang, Yimeng Liu, Li Hao, Fang Wu, Zhiwei Li, Zehong Wang, Zhiyuan Liu, Zhenfei Yin, Li Yuan, Philip Torr, Huan Sun, xiangxiang Zeng, Mengdi Wang, Le Cong, Shenghua Gao, Xiangru Tang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 针对化学大语言模型依赖显式思维链导致的模态不匹配问题,提出LatentChem推理接口,通过连续思维向量和动态感知解耦化学逻辑与语言生成,在ChemCoTBench上以59.88%非平局胜率超越强CoT基线,并实现平均10.84倍推理步骤开销降低(5.96倍实际加速)。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22442 2026-07-17 cs.LG cs.AI 版本更新 56%

Fully Offline Reinforcement Learning

完全离线强化学习

Mattie Fellows, Clarisse Wibault, Uljad Berdica, Johannes Forkel, Maike Osborne, Jakob N. Foerster

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 研究完全离线强化学习问题,提出基于贝叶斯模型的SOReL方法及扩展的TOReL方法,通过学习动力学后验、预测不确定性估计策略值实现完全离线超参数选择,建立实用且有理论基础的完全离线强化学习框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00808 2026-07-02 cs.LG 新提交 56%

Local Motion Matters: A Deconstruct-Recompose Paradigm for Reinforcement Learning Pre-training from Videos

局部运动至关重要:一种用于从视频中进行强化学习预训练的解构-重组范式

Jinwen Wang, Youfang Lin, Xiaobo Hu, Shuo Wang, Kai Lv

机构 * Beijing Jiaotong University(北京交通大学) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG;dynamics model(abstract)

AI总结 提出解构-重组范式(DRP),通过解构全局运动为原子动作学习局部运动表示,再重组以加速下游策略学习,在机器人控制任务中显著提升样本效率。

Comments 20 pages, 16 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pages 9859-9868

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17519 2026-07-02 cs.LG cs.AI 版本更新 56%

TANDEM: Temporal Attention-guided Neural Differential Equations for Missingness in Time Series Classification

TANDEM:基于缺失数据的时序分类的时序注意力引导神经微分方程

YongKyung Oh, Dong-Young Lim, Sungil Kim, Alex Bui

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TANDEM框架,通过注意力机制整合观测数据、插值控制路径和连续潜在动态,提升时序分类中缺失数据的处理能力,实验显示其优于现有方法。

Comments CIKM '25: Proceedings of the 34th ACM International Conference on Information and Knowledge Management. https://doi.org/10.1145/3746252.3760996

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20411 2026-06-19 cs.LG 新提交 56%

Direct Advantage Estimation for Scalable and Sample-efficient Deep Reinforcement Learning

直接优势估计:可扩展且样本高效的深度强化学习

Hsiao-Ru Pan, Bernhard Schölkopf

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG;dynamics model(abstract)

AI总结 针对直接优势估计(DAE)在部分可观测域和高维观测下的局限性,本文扩展其理论框架并引入离散潜动态模型降低计算复杂度,在Arcade学习环境中验证了DAE的可扩展性和样本效率。

Comments Accepted at RLC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10530 2026-06-10 cs.LG cs.AI 新提交 56%

Machine Learning Methods for Studying Latent Neural Activity Dynamics

研究潜在神经活动动力学的机器学习方法

Shufeng Kong, Fumei Deng, Xinyi Dong, Caihua Liu, Weiwei Chen, Yingheng Wang, Daniel Cao, Azahara Oliva, Antonio Fernandez-Ruiz, Carla Gomes

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系) Department of Neurobiology and Behavior, Cornell University(康奈尔大学神经生物学与行为学系) Department of Ecology and Evolutionary Biology, Cornell University(康奈尔大学生态学与进化生物学系) School of Computer Science and Artificial Intelligence, Foshan University(佛山大学计算机科学与人工智能学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 综述从状态空间模型到深度生成模型的潜在变量模型,涵盖单区域动力学、多区域通信和行为对齐建模,并讨论大规模神经基础模型及未来挑战。

Comments Accepted by IJCAI 2026 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 56%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.LG;dynamics model(abstract)

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26733 2026-05-27 cs.LG cs.AI 56%

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

循环语言模型中测试时可扩展潜在推理的稳定循环动力学

Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) School of Intelligence Science and Technology, Nanjing University, Nanjing, China(智能科学与技术学院,南京大学,南京,中国)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 提出STARS训练框架,通过雅可比谱半径正则化约束潜在状态趋近渐近稳定不动点,解决循环语言模型深度递归时性能崩溃问题,实现可靠的测试时扩展并提升峰值性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25267 2026-05-26 cs.LG cs.AI 56%

Latent Q-Barrier Shielding for Safe In-Context Reinforcement Learning

潜在Q-屏障屏蔽用于安全上下文强化学习

Minjae Kwon, Amir Moeini, Shangtong Zhang, Lu Feng

机构 * University of Virginia(弗吉尼亚大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 提出一种潜在Q-屏障屏蔽方法,通过学习上下文表示、潜在动力学和集成成本评论家,在部署时无需参数更新即可根据剩余预算和预测未来成本过滤或软重加权候选动作,从而改善安全上下文强化学习在分布外转移下的奖励-安全权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24405 2026-05-26 cs.LG cs.AI 56%

Generative OOD-regularized Model-based Policy Optimization

生成式OOD正则化的基于模型的策略优化

Aysin Tumay, Jiahe Huang, Elise Jortberg, Rose Yu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Abiomed(阿比omed)

专题命中 模型式强化学习 :model-based RL(abstract);分类 cs.AI、cs.LG

AI总结 提出GORMPO算法,利用生成式密度估计在稀疏状态-动作空间中限制策略更新到高密度区域,以解决离线强化学习中的分布外动作问题,并在真实医疗数据集和离线RL数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23470 2026-05-25 cs.LG cs.AI cs.CE 56%

Learning Individual Dynamics from Sparse Cross-Sectional Snapshots

从稀疏横截面快照中学习个体动力学

Christian Lagemann, Kai Lagemann, Steven L. Brunton, Sach Mukherjee

机构 * Statistics and Machine Learning, German Center for Neurodegenerative Diseases (DZNE)(统计与机器学习,德国神经退行性疾病中心(DZNE)) MediaTek Research(联发科技研究) Department of Mechanical Engineering & AI Institute in Dynamic Systems, University of Washington, Seattle(机械工程与人工智能动态系统研究所,华盛顿大学,西雅图) DZNE & University of Bonn, Bonn, Germany and University of Cambridge, Cambridge, United Kingdom(DZNE与波恩大学,波恩,德国和剑桥大学,剑桥,英国)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 提出CADENCE框架,通过将潜在动力学锚定到静态个体上下文,从孤立快照中恢复连续个体轨迹,并证明单时间点轨迹推断的可识别性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14220 2026-05-22 cs.LG cs.AI 56%

Twice Sequential Monte Carlo for Tree Search

两次序贯蒙特卡洛用于树搜索

Yaniv Oren, Joery A. de Vries, Pascal R. van der Vaart, Matthijs T. J. Spaan, Wendelin Böhmer

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Twice Sequential Monte Carlo Tree Search(TSMCTS)方法,通过减少方差和缓解路径退化问题,提高了在离散和连续环境中比SMC基线和现代MCTS版本更优的性能,同时在顺序计算上具有良好的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15603 2026-05-18 cs.LG cs.AI 56%

Offline Reinforcement Learning with Universal Horizon Models

离线强化学习中的通用时间 horizon 模型

Hojun Chung, Junseo Lee, Songhwai Oh

机构 * Interdisciplinary Program in Artificial Intelligence and ASRI, Seoul National University(人工智能交叉学科项目及首尔国立大学ASRI) Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用时间 horizon 模型,通过灵活预测任意时间 horizon 的未来状态,改进了传统几何时间 horizon 模型在远期状态建模上的不足,并在100个OGBench任务中验证了其有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23597 2026-05-14 cs.LG cs.AI 56%

Characteristic Root Analysis and Regularization for Linear Time Series Forecasting

特征根分析与线性时间序列预测中的正则化

Zheng Wang, Kaixuan Zhang, Wanfang Chen, Xiaonan Lu, Longyuan Li, Tobias Schlagenhauf

机构 * Bosch Center for AI (BCAI) & Bosch (China) Investment Co., Ltd.(博世人工智能中心(BCAI)及博世(中国)投资有限公司) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文研究线性模型在时间序列预测中的特征根作用,提出鲁棒根重构策略,通过实验验证了其有效性,实现了高性能的预测模型。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11711 2026-05-13 cs.LG cs.AI 56%

Debiased Model-based Representations for Sample-efficient Continuous Control

去偏的基于模型的表示用于样本高效的连续控制

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言) McGill University(麦吉尔大学) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DR.Q算法,通过最大化当前状态-动作对表示与下一状态之间的互信息,并采用衰减优先经验回放,以减少表示和actor-critic学习中的偏差,从而在连续控制任务中取得优于现有方法的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28161 2026-05-01 cs.RO 56%

RopeDreamer: A Kinematic Recurrent State Space Model for Dynamics of Flexible Deformable Linear Objects

RopeDreamer:一种用于柔性可变形线性物体动态的运动学递归状态空间模型

Tim Missal, Lucas Domingues, Berk Guler, Simon Manschitz, Jan Peters, Paula Dornhofer Paro Costa

机构 * Technical University of Darmstadt(德意志技术大学) School of Electrical and Computer Engineering, Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学电气与计算机工程学院) Instituto de Pesquisas Eldorado(Eldorado研究所) Honda Research Institute Europe GmbH(本田欧洲研究院) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Robotics Institute Germany (RIG)(德国机器人研究所) Centre for Cognitive Science(认知科学研究中心) Artificial Ingelligence Lab, Recod.ai(Recod.ai人工智能实验室)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.RO;dynamics model(abstract)

AI总结 本文提出结合递归状态空间模型与四元数运动链表示的潜变量框架,用于预测柔性可变形线性物体的状态,通过约束物理有效流形减少自交和非物理变形,提升长周期预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27313 2026-05-01 cs.LG cs.CV 56%

PINN-Cast: Exploring the Role of Continuous-Depth NODE in Transformers and Physics Informed Loss as Soft Physical Constraints in Short-term Weather Forecasting

PINN-Cast:探索连续深度NODE在Transformer中的作用及物理信息损失作为短期天气预报中的软物理约束

Hira Saleem, Flora Salim, Cormac Purcell

机构 * University of New South Wales(新南威尔士大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.CV

AI总结 本文提出连续深度Transformer编码器,结合Neural ODE动态和物理信息损失,提升短期天气预报的准确性与物理一致性。

Comments 14 pages, 4 Figures, Accepted in 26th International Conference on Computational Science (ICCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05174 2026-04-29 cs.LG cs.AI stat.ML 56%

Bayesian Inverse Transition Learning: Learning Dynamics From Near-Optimal Trajectories

贝叶斯逆向转移学习:从近优轨迹中学习动态

Leo Benac, Abhishek Sharma, Sonali Parbhoo, Finale Doshi-Velez

机构 * Harvard University(哈佛大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出逆向转移学习方法,通过近优轨迹的有限覆盖作为特征,结合贝叶斯方法估计动态,提升决策质量并指导迁移成功判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05480 2026-04-28 cs.GR cs.CV cs.LG 56%

ODE-GS: Latent ODEs for Dynamic Scene Extrapolation with 3D Gaussian Splatting

ODE-GS:基于动态场景外推的隐式ODE与3D高斯点划法

Daniel Wang, Patrick Rim, Tian Tian, Dong Lao, Alex Wong, Ganesh Sundaramoorthi

机构 * Yale University(耶鲁大学) TU Delft(代尔夫特理工大学) Louisiana State University(路易斯安那州立大学) RTX(RTX公司)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.CV

AI总结 ODE-GS结合隐式ODE与3D高斯点划法,通过连续时间隐式动态建模实现动态3D场景的未来外推,优于传统时间条件变形网络方法,提升外推性能19.8%。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01570 2026-04-02 cs.RO cs.AI 56%

Ego-Foresight: Self-supervised Learning of Agent-Aware Representations for Improved RL

Ego-Foresight: 为改进强化学习的自监督学习 agent 意识表示

Manuel Serra Nunes, Atabak Dehban, Yiannis Demiris, José Santos-Victor

机构 * Institute for Systems and Robotics, Instituto Superior Técnico, U. Lisboa(系统与机器人研究所,里斯本高等理工学院,里斯本大学) Personal Robotics Laboratory, Imperial College London(个人机器人实验室,伦敦帝国理工学院)

专题命中 模型式强化学习 :model based RL(abstract);分类 cs.AI、cs.RO

AI总结 本文提出 Ego-Foresight 方法,通过自监督学习解耦 agent 信息,提升强化学习的样本效率和性能。

Comments 13 pages, 8 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22871 2026-03-25 cs.AI cs.LG math.DS 56%

Dynamical Systems Theory Behind a Hierarchical Reasoning Model

层次推理模型背后的动力系统理论

Vasiliy A. Es'kin, Mikhail E. Smorkalov

机构 * Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系) Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心) Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Contraction Mapping Model,通过将离散递归推理转化为连续的NODEs/NSDEs,提供数学严谨且稳定的推理引擎,在Sudoku-Extreme基准测试中取得93.7%的准确率,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21162 2026-03-24 cs.AI cs.LG 56%

Revisiting Tree Search for LLMs: Gumbel and Sequential Halving for Budget-Scalable Reasoning

重新审视用于大语言模型的树搜索:Gumbel与顺序削减用于可扩展的推理

Leonid Ugadiarov, Yuri Kuratov, Aleksandr Panov, Alexey Skrynnik

专题命中 模型式强化学习 :model-based reinforcement learning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReSCALE,通过将Gumbel采样和顺序削减替代传统方法,实现大语言模型在推理中的可扩展推理能力提升,解决了搜索预算增加时准确率下降的问题。

Comments The paper has been accepted to the ICAPS-2026 conference. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07558 2026-03-23 cs.LG cs.CV 56%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.CV

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04412 2026-03-17 cs.RO cs.LG 56%

HoRD: Robust Humanoid Control via History-Conditioned Reinforcement Learning and Online Distillation

通过历史条件强化学习和在线蒸馏实现鲁棒的人形机器人控制:HoRD

Puyue Wang, Jiawei Hu, Yan Gao, Junyan Wang, Yu Zhang, Gillian Dobbie, Tao Gu, Wafa Johal, Ting Dang, Hong Jia

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG、cs.RO

AI总结 HoRD通过历史条件强化学习和在线蒸馏,使单个策略能零样本适应未知领域,提升人形机器人在动态变化和外部扰动下的鲁棒性和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02592 2026-03-16 cs.LG cs.AI cs.SY eess.SY 56%

Learnable Koopman-Enhanced Transformer-Based Time Series Forecasting with Spectral Control

可学习的Koopman增强变换器时间序列预测与频谱控制

Ali Forootani, Raffaele Iervolino

机构 * Max Planck Institute of Geoanthropology(马克斯·普朗克地理人类学研究所) Department of Electrical Engineering and Information Technology, University of Naples(那不勒斯大学电气工程与信息学院)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的可学习Koopman算子参数化家族,结合线性动态系统理论与现代深度学习预测架构,通过四种可学习Koopman变体提升时间序列预测性能,展示了在多个时间跨度和片段长度下的优越偏误-方差权衡和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14024 2026-02-17 cs.LG cs.AI 56%

EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models

EIDOS:用于时间序列基础模型的潜在空间预测学习

Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin

机构 * Nankai University(南开大学) Eindhoven University of Technology(埃因霍温理工大学) Yunnan University(云南大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI、cs.LG

AI总结 EIDOS通过潜在空间预测学习提升时间序列基础模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏