arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-16 至 2025-12-16 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 5 篇

2503.02904 2025-12-16 eess.IV cs.CV cs.LG 81%

Surgical Vision World Model

手术视觉世界模型

Saurabh Koju, Saurav Bastola, Prashant Shrestha, Sanskar Amgain, Yash Raj Shrestha, Rudra P. K. Poudel, Binod Bhattarai

机构 * University of Aberdeen, UK(阿伯丁大学,英国) Cambridge Research Laboratory, Toshiba Europe Ltd, UK(剑桥研究实验室,东芝欧洲有限公司,英国) Nepal Applied Mathematics and Informatics Institute for research (Naamii), Nepal(尼泊尔应用数学与信息学研究所(Naamii),尼泊尔) University of Lausanne, Switzerland(洛桑大学,瑞士)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个手术视觉世界模型,通过生成动作可控的手术数据,提升自主手术代理训练的现实感与交互性。

Comments This paper has been accepted at the Data Engineering in Medical Imaging Workshop, MICCAI 2025

Journal ref MICCAI Workshop on Data Engineering in Medical Imaging (2025) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19773 2025-12-16 gr-qc hep-th 78%

On the uplift of 4D wormholes in Braneworld models and their 5D structure

关于Braneworld模型中4D虫洞的提升及其5D结构

Thomas D. Pappas, Theodoros Nakas

专题命中 具身推理 :world model(title,abstract)

AI总结 本文研究了Braneworld模型中4D虫洞的提升及其5D结构,推导了通用条件并首次提出flare-out条件,揭示了扭曲额外维度对5D虫洞结构的影响。

Comments 37 pages, 11 figures. v2: Significantly enriched and extended analysis in preparation for journal submission; method generalized to arbitrary radial coordinates; further examples added, including thick-brane models and non-isometric wormholes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 62%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏