arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2025-11-25 至 2025-11-25 共收录 3 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 3 篇

2507.00416 2025-11-25 cs.RO cs.CV 84%

Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding

Evo-0:具有隐式空间理解的视觉-语言-动作模型

Tao Lin, Gen Li, Yilei Zhong, Yanwen Zou, Yuxin Du, Jiting Liu, Encheng Gu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) University of Cambridge(剑桥大学)

专题命中 空间理解 :spatial understanding(title,abstract);point cloud(abstract);分类 cs.CV、cs.RO

AI总结 Evo-0通过隐式整合3D几何特征,提升视觉-语言-动作模型在现实世界中的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 57%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17940 2025-11-25 cs.CV 57%

Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames

场景摘要:将场景视频聚类为空间上多样的帧

Chao Chen, Mingzhi Zhu, Ankush Pratap Singh, Yu Yan, Felix Juefei-Xu, Chen Feng

机构 * New York University(纽约大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SceneSum通过自监督方法将场景视频聚类为空间多样化的关键帧,提升空间推理能力,优于现有视频摘要方法。

详情

展开后加载摘要…

URL PDF HTML 收藏