arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-24 至 2026-08-24 共收录 11 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 1 篇

2608.20748 2026-08-24 cs.CV 新提交 70%

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

为视觉几何接地Transformer生成多视角对抗样本

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 三维重建 :3D vision(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本研究针对3D基础模型VGGT的安全漏洞,提出MVAP-G多视角对抗扰动生成器,通过跨视角对抗对齐机制生成一致扰动,可无需迭代优化即可显著降低VGGT性能,为3D视觉系统鲁棒性研究提供了新方向。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2608.20687 2026-08-24 cs.CV cs.GR 新提交 85%

TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction

TopoSurfel:闭合高斯面元与网格间的循环以实现表面重建

Chuanjin Fan, Wenjie Chang, Bohao Liao, Yujia Chen, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Deep Space Exploration Laboratory(深空探测实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯溅射直接提取高保真表面易产生伪影和浮点数的问题,提出闭合高斯面元与网格循环的TopoSurfel框架,通过动态生成代理网格及相关策略实现高质量表面重建与新视图合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20602 2026-08-24 eess.IV cs.CV 新提交 84%

Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction

稀疏光场采样提升 casual 三维与四维重建

Shamus Li, Ruiming Cao, Laura Waller, Kristina Monakhova, Sara Fridovich-Keil

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文针对消费级多视图相机,提出稀疏视图3DGS与4DGS基线方法,验证多相机稀疏采样可显著提升单帧、少帧及casual视频的三维与四维重建质量,尤其适用于动态场景。

Comments Project page: this https URL (https://shamus.li/lightfield-gaussian-splatting)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 3 篇

2608.20740 2026-08-24 cs.CV 新提交 83%

VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds

VisTa3D:用于从视觉、触觉和三维点云重建薄物体的数据集与基准

Shania Guo, Yeongsik Seo, Andrew Fu, Mei Hao, Iris Xia, Jiwon Jenny Lee, Xinyi Mary Xie, Hyoungseob Park, Aaron Dollar, Alex Wong

机构 * Yale University(耶鲁大学) Yale Vision Laboratory(耶鲁视觉实验室) GRAB Lab(GRAB实验室)

专题命中 点云 :point cloud(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 VisTa3D是首个含视觉、触觉等数据的薄物体重建数据集,作者在其上基准测试现有模型发现其保真度低,还提出视觉-深度-触觉基线模型以探究触觉数据对薄物体重建的辅助作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20872 2026-08-24 math.NA cs.CE 新提交 78%

Point Cloud Quality for Meshfree Methods

无网格方法的点云质量

Mohsen Abdolahzadeh, Oleg Davydov, Isabel Michel, Pratik Suchde

专题命中 点云 :point cloud(title,abstract)

AI总结 本研究针对无网格点云质量展开系统研究,对比分析现有指标并引入新指标,经大量数值测试后确定六项可靠指标,同时指出部分常用指标预测精度的能力较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20891 2026-08-24 cs.RO cs.CV 新提交 62%

IMU-Free Body-Frame State Estimation with Sparse Scene Flow for Quadcopters

面向四旋翼无人机的基于稀疏场景流的无IMU机体坐标系状态估计

Daniel Grønhaug, Sofie Markeset, Mathias Kolberg

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出一种无IMU的四旋翼仅视觉状态估计系统,采用扩展卡尔曼滤波与4视图光束平差法,生成机体坐标系状态估计与稀疏场景流,无需GPS等世界坐标系基础设施。

Comments 56 pages, 5 figures, 2 tables. Evaluated on the VID dataset ( arXiv:2103.11152 (https://arxiv.org/abs/2103.11152) )

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2608.20534 2026-08-24 cs.CV 新提交 70%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 新视角合成 :3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 2 篇

2608.20448 2026-08-24 cs.GR cs.CV 新提交 81%

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube:具有部件级语义与空间控制的组合式三维生成

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV、cs.GR

AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20759 2026-08-24 cs.CV 新提交 57%

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

DiGS-Avatar:基于UV空间扩散的单图像可动画三维人体重建

Jiakun Li, Li Fang, Hao Zhu, Fei Hu, Long Ye, Yuan Zhang, Jinyao Yan

机构 * Key Laboratory of Media Audio and Video (Communication University of China)(中国传媒大学媒体音频与视频重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出DiGS-Avatar,将单图像可动画三维人体重建转化为UV空间扩散的潜变量补全任务,通过师生框架优化后解码为三维高斯基元,实现了高效高质量的重建与零样本泛化。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 2 篇

2608.21136 2026-08-24 cs.CV 新提交 57%

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

Jie Xu, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 针对现有开放词汇零样本3D场景理解模型难以处理流式RGB-D输入、易受2D分割掩码噪声影响的问题,提出无训练框架Stream3Dv2,通过几何-语义融合等策略提升性能,在相关任务上优于基准,可与LLM智能体集成用于开放世界具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20691 2026-08-24 cs.CV 新提交 57%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏