arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-22 至 2026-01-22 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 5 篇

2403.05131 2026-01-22 cs.AI cs.CV 82%

Sora as a World Model? A Complete Survey on Text-to-Video Generation

Sora作为世界模型?文本到视频生成的全面调查

Fachrina Dewi Puspitasari, Chaoning Zhang, Joseph Cho, Adnan Haider, Noor Ul Eman, Omer Amin, Alexis Mankowski, Muhammad Umair, Jingyao Zheng, Sheng Zheng, Lik-Hang Lee, Caiyan Qin, Tae-Ho Kim, Choong Seon Hong, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Kyung Hee University(韩国庆熙大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) Nota Inc.(Nota公司) Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文全面调查了文本到视频生成技术在世界建模中的应用,指出其在空间、行动和战略智能方面的进展,但仍需解决多样性与一致性之间的权衡问题。

Comments First complete survey on Text-to-Video Generation from World Model perspective, 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14514 2026-01-22 cs.AI q-bio.NC 74%

"Just in Time" World Modeling Supports Human Planning and Reasoning

即时世界建模支持人类规划与推理

Tony Chen, Sam Cheyette, Kelsey Allen, Joshua Tenenbaum, Kevin Smith

机构 * MIT Department of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系) UBC Departments of Computer Science and Psychology(不列颠哥伦比亚大学计算机科学与心理学系)

专题命中 具身推理 :world model(title);分类 cs.AI

AI总结 本文提出'即时'框架,通过在线构建简化表示实现高效心理模拟,支持人类规划与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14354 2026-01-22 cs.LG 74%

VJEPA: Variational Joint Embedding Predictive Architectures as Probabilistic World Models

VJEPA:变分联合嵌入预测架构作为概率世界模型

Yongchao Huang

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 VJEPA通过变分目标学习预测分布,统一表征学习与贝叶斯过滤,提供概率世界模型框架,适用于高维噪声环境中的鲁棒规划。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 62%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 57%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏