arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-13 至 2026-03-13 共收录 4 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 4 篇

2603.11110 2026-03-13 cs.RO cs.AI 92%

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR 69%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14810 2026-03-13 cs.LG cs.AI 50%

MARIA: a Multimodal Transformer Model for Incomplete Healthcare Data

MARIA:一种用于不完整医疗数据的多模态Transformer模型

Camillo Maria Caruso, Paolo Soda, Valerio Guarrasi

机构 * UniCampus

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 MARIA是一种基于Transformer的多模态模型,通过掩码自注意力机制有效处理不完整医疗数据,优于现有方法在性能和鲁棒性方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02686 2026-03-13 cs.LG cs.AI 50%

A Systematic Review of Intermediate Fusion in Multimodal Deep Learning for Biomedical Applications

多模态深度学习在生物医学应用中的中间融合系统综述

Valerio Guarrasi, Fatih Aksu, Camillo Maria Caruso, Francesco Di Feola, Aurora Rofena, Filippo Ruffini, Paolo Soda

专题命中 通用世界模型 :分类 cs.AI、cs.LG;predictive model(abstract);predictive models(abstract)

AI总结 本文系统综述了多模态深度学习在生物医学应用中的中间融合方法,分析了现有技术、挑战及未来方向,并提出结构化符号以促进方法的广泛应用。

Journal ref Image and Vision Computing 158 (2025) 105509

详情

展开后加载摘要…

URL PDF HTML 收藏