arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

2026-03-31 至 2026-03-31 共收录 6 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 通用世界模型 6 篇

2511.14262 2026-03-31 cs.LG cs.AI 94%

Object-Centric World Models for Causality-Aware Reinforcement Learning

基于因果意识的强化学习对象中心世界模型

Yosuke Nishimoto, Takashi Matsubara

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出STICA框架,通过对象中心Transformer构建世界模型,并结合因果意识策略和价值网络,提升样本效率和最终性能。

Comments Accepted by AAAI-26. Codes are available at https://github.com/nishimoto0430/STICA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO 93%

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 通用世界模型 :world model(title,abstract);world models(title,abstract);world model(title,abstract);world models(title,abstract)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26741 2026-03-31 cs.CV cs.AI cs.RO 91%

Language-Conditioned World Modeling for Visual Navigation

基于语言的视觉导航世界建模

Yifei Dong, Fengyi Wu, Yilong Dai, Lingdong Kong, Guangyu Chen, Xu Zhu, Qiyu Hu, Tianyu Wang, Johnalbert Garnica, Feng Liu, Siyu Huang, Qi Dai, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Clemson University(克莱姆森大学) Drexel University(德雷塞尔大学) Microsoft Research(微软研究院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);world models(abstract);world models(abstract)

AI总结 本文研究了基于语言的视觉导航问题,提出LCVN数据集并开发了两种模型家族,通过语言 grounding、未来状态预测和动作生成实现统一任务学习。

Comments 19 pages, 6 figures, Code: https://github.com/F1y1113/LCVN

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25240 2026-03-31 q-bio.QM cs.AI q-bio.GN 88%

Lingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cells

Lingshu-Cell: 一个生成性细胞世界模型用于转录组建模以实现虚拟细胞

Han Zhang, Guo-Hua Yuan, Chaohao Yuan, Tingyang Xu, Tian Bian, Hong Cheng, Wenbing Huang, Deli Zhao, Yu Rong

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.AI

AI总结 Lingshu-Cell通过生成式模型学习转录组状态分布,支持在扰动下进行条件模拟,能够准确复现转录组分布和细胞亚型比例,展现复杂细胞异质性的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27449 2026-03-31 cs.CV 88%

LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model

LOME:基于动作条件的视点世界模型学习人类-物体操控

Quankai Gao, Jiawei Yang, Qiangeng Xu, Le Chen, Yue Wang

机构 * University of Southern California(南加州大学)

专题命中 通用世界模型 :world model(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 LOME通过结合空间人类动作与环境上下文,生成逼真的人-物交互视频,提升动作跟随精度与泛化能力,实现物理效果如液体倒出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01342 2026-03-31 cs.CV 69%

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

InternVideo-Next:无需视频-文本监督的通用视频基础模型

Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, China(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 通用世界模型 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出InternVideo-Next,通过解耦传统编码器-解码器设计为Encoder-Predictor-Decoder框架,解决像素重建与语义冲突问题,构建语义一致且细节保留的潜在空间,提升视频基础模型的通用性。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏