arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2025-12-16 至 2025-12-16 共收录 3 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 3 篇

2512.12622 2025-12-16 cs.CV cs.RO 81%

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 空间理解 :3D vision(title,abstract);分类 cs.CV、cs.RO

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12822 2025-12-16 cs.CV cs.AI 79%

Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding

Lemon:一种统一且可扩展的3D多模态模型用于通用空间理解

Yongyuan Liang, Xiyao Wang, Yuanchen Ju, Jianwei Yang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 空间理解 :spatial understanding(title);point cloud(abstract);分类 cs.CV

AI总结 Lemon提出一种统一的Transformer架构,通过联合处理3D点云块和语言标记,实现空间-语言融合,提升3D多模态模型的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03682 2025-12-16 cs.CV cs.AI cs.LG 57%

How PARTs assemble into wholes: Learning the relative composition of images

如何将PART组合成整体:学习图像的相对组成

Melika Ayoughi, Samira Abnar, Chen Huang, Chris Sandino, Sayeri Lala, Eeshan Gunesh Dhekane, Dan Busbridge, Shuangfei Zhai, Vimal Thilak, Josh Susskind, Pascal Mettes, Paul Groth, Hanlin Goh

机构 * University of Amsterdam(阿姆斯特丹大学) Apple(苹果公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 PART通过连续相对变换学习图像的相对组成,优于基于网格的方法,在空间理解任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏