arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-13 至 2026-03-13 共收录 8 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4 篇

2603.11110 2026-03-13 cs.RO cs.AI 92%

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 69%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14810 2026-03-13 cs.LG cs.AI 50%

MARIA: a Multimodal Transformer Model for Incomplete Healthcare Data

MARIA:一种用于不完整医疗数据的多模态Transformer模型

Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * UniCampus

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 MARIA是一种基于Transformer的多模态模型,通过掩码自注意力机制有效处理不完整医疗数据,优于现有方法在性能和鲁棒性方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02686 2026-03-13 cs.LG cs.AI 50%

A Systematic Review of Intermediate Fusion in Multimodal Deep Learning for Biomedical Applications

多模态深度学习在生物医学应用中的中间融合系统综述

Valerio Guarrasi, Fatih Aksu, Camillo Maria Caruso, Francesco Di Feola, Aurora Rofena, Filippo Ruffini, Paolo Soda

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文系统综述了多模态深度学习在生物医学应用中的中间融合方法,分析了现有技术、挑战及未来方向,并提出结构化符号以促进方法的广泛应用。

Journal ref Image and Vision Computing 158 (2025) 105509

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身与机器人 1 篇

2502.00622 2026-03-13 cs.RO cs.CV cs.LG 89%

Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling

生成式预测控制:通过预测世界建模增强推理时间的机器人策略

Han Qi, Haocheng Yin, Aris Zhu, Yilun Du, Heng Yang

专题命中 具身与机器人 :world model(title,abstract);world model(title,abstract);分类 cs.LG、cs.CV、cs.RO

AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。

Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 自动驾驶 1 篇

2603.01928 2026-03-13 cs.CV 81%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模型式强化学习 2 篇

2509.00639 2026-03-13 cs.LG 50%

Disentangling Slow and Fast Temporal Dynamics in Degradation Inference with Hierarchical Differential Models

分离慢速和快速时间动态以推断退化:基于分层微分模型

Mengjie Zhao, Olga Fink

专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.LG

AI总结 本文提出H-CDE框架,通过分离慢退化动态和快操作动态,提升退化推断的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06503 2026-03-13 cs.MA cs.AI cs.RO 50%

Enhancing Heterogeneous Multi-Agent Cooperation in Decentralized MARL via GNN-driven Intrinsic Rewards

通过图神经网络驱动的内在奖励增强去中心化MARL中的异质多智能体协作

Jahir Sadik Monon, Deeparghya Dutta Barua, Md. Mosaddek Khan

机构 * Independent University Bangladesh(独立大学Bangladesh) Penta Global Ltd(Penta全球有限公司) University of Dhaka, Bangladesh(达卡大学,Bangladesh)

专题命中 模型式强化学习 :分类 cs.AI、cs.RO、cs.MA;dynamics model(abstract)

AI总结 CoHet通过图神经网络驱动的内在动机提升去中心化MARL中异质智能体协作性能

Comments Full paper version for AAMAS 2025 (https://ifaamas.org/Proceedings/aamas2025/pdfs/p2681.pdf), 9 pages, 5 figures

Journal ref Proceedings of the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2025), pages 2681-2683, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏