arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-27 至 2026-01-27 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 6 篇

2601.17507 2026-01-27 cs.RO 84%

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17067 2026-01-27 cs.CV cs.AI 81%

A Mechanistic View on Video Generation as World Models: State and Dynamics

视频生成作为世界模型的机制视角:状态与动态

Luozhou Wang, Zhifei Chen, Yihua Du, Dongyu Yan, Wenhang Ge, Guibao Shen, Xinli Xu, Leyi Wu, Man Chen, Tianshuo Xu, Peiran Ren, Xin Tao, Pengfei Wan, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tongji University(同济大学) Kuaishou Technology(快手科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出基于状态构建和动态建模的视频生成新分类法,旨在提升视频生成模型的物理持续性和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18620 2026-01-27 cs.LG 79%

CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling

CASSANDRA:面向随机世界建模的程序化与概率学习与推理

Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Ian Berlot-Attwell, Stéphane Aroca-Ouellette, Kaheer Suleman

机构 * Skyfall AI Tufts University(塔夫茨大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) Vector Instiute(Vector研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 CASSANDRA通过结合LLM的知识先验和概率图模型结构学习,提升随机世界建模中的转移预测与规划能力。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17796 2026-01-27 q-bio.NC 78%

AI and World Models

人工智能与世界模型

Robert Worden

专题命中 具身推理 :world model(title,abstract)

AI总结 本文探讨了人工智能系统中世界模型的必要性,强调其在预测和控制人工智能行为后果中的关键作用,以及构建可靠世界模型的挑战。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09899 2026-01-27 cs.RO 70%

Semantic2D: Enabling Semantic Scene Understanding with 2D Lidar Alone

Semantic2D: 仅使用2D激光雷达实现语义场景理解

Zhanteng Xie, Yipeng Pan, Yinqiang Zhang, Jia Pan, Philip Dames

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Department of Mechanical Engineering, Temple University(机械工程系, Temple大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 Semantic2D通过仅使用2D激光雷达实现语义场景理解,提出首个公开数据集和细粒度分割算法,提升机器人导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 62%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏