arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-26 至 2026-08-26 共收录 15 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 1 篇

2608.23206 2026-08-26 cs.CV 版本更新 79%

Learning Spherical Occupancy Profiles for Multi-View 3D Reconstruction and Generation

用于多视图三维重建与生成的球形占用轮廓学习

YiHsuan Tsai

机构 * Nanjing University(南京大学)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 该研究提出将逐光线球形占用轮廓作为统一中间表示,训练判别式解码器与生成式流水线,在多视图三维重建任务中取得良好效果,且可迁移至真实照片场景。

Comments 12 pages,5 figures,5 tables. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 2 篇

2608.22888 2026-08-26 cs.CV 版本更新 83%

NemoSplat: Feed-Forward 4D Gaussian Splatting for Media-Aware Underwater Reconstruction

NemoSplat:面向介质感知水下重建的前馈式4D高斯溅射方法

Xiaopeng Guo, Wai Chung Tse, Yipeng Zhu, Hanwen Zhang, Huajian Huang, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 针对水下环境光散射与动态物体导致的重建难题,提出首个介质感知前馈4D高斯溅射框架NemoSplat,设计可提示动态解缠器与介质感知高斯预测器,构建大规模水下数据集,实现了最优跟踪精度与高保真渲染。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24049 2026-08-26 cs.LG 新提交 78%

Physics-Integrated Operator Learning via Gaussian Splatting Representations

基于高斯溅射表示的物理集成算子学习

Jihao Zhang, Junyi Guo, Jian-Xun Wang

机构 * Cornell University(康奈尔大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract)

AI总结 本研究提出基于前馈高斯溅射(FFGS)表示的物理集成算子学习框架,在多类PDE系统长时序预测中降低相对ℓ₂误差1.5-2.2倍,提升光谱保真度,对部分已知控制方程具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 7 篇

2608.24093 2026-08-26 cs.CV cs.LG 新提交 79%

Joint-Embedding Prediction of Masked Point Tubes for Self-Supervised Learning on 4D Point Cloud Videos

面向四维点云视频的掩码点管联合嵌入预测自监督学习

Jheng-Ling Lee, Shang-Tse Chen

机构 * National Taiwan University(台湾大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究针对四维点云视频自监督学习的挑战,提出JEPA风格框架结合Sketched Isotropic Gaussian Regularization,通过掩码时空区域的潜在点管预测学习表示,在动作和手势识别任务中取得良好效果。

Comments 13 pages, 4 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23486 2026-08-26 cs.CV cs.RO 版本更新 62%

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

GeoWAM:面向自动驾驶的视觉几何世界动作模型

Yiren Lu, Xin Ye, Jiaming Liu, Philip Jacobson, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Case Western Reserve University(凯斯西储大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。

Comments Project page: this https URL (https://yiren-lu.com/project_pages/geowam/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22821 2026-08-26 cs.CV 版本更新 57%

SiZeUp: Fast 3D Proxy from Aerial Images via Depth Ordinal Loss

SiZeUp:基于深度序数损失的航拍图像快速3D代理模型构建方法

Wenjun Zhou, Yunshan Li, Qiaoyu Zhu, Weidan Xiong, Hao Zhang, Daniel Cohen-Or, Hui Huang

机构 * Shenzhen University(深圳大学) Simon Fraser University(西蒙菲莎大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 SiZeUp是一种从校准倾斜航拍图像构建大规模城市3D代理模型的方法,采用“ footprint 高度”表示法与深度序数一致性损失,实现23-52倍加速,适用于大规模城市建模。

Comments SiZeUp (SZU) accepted to SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00260 2026-08-26 cs.CV 版本更新 57%

C3VDReg: A Benchmark for Local-to-Local Colonoscopic Registration toward Anatomical Localization

C3VDReg:面向解剖定位的局部-局部结肠镜配准基准

Linzhe Jiang, Jiayuan Huang, Sophia Bano, Matthew J. Clarkson, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute(UCL哈维斯研究所) University College London, University of London(伦敦大学学院, 伦敦大学) Division of Informatics, Imaging and Data Sciences(信息学、成像与数据科学部门) University of Manchester(曼彻斯特大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出面向局部-局部结肠镜配准的基准C3VDReg,通过构建点云对评估基线模型,发现高几何重叠不足以保证配准精度,重复管状解剖的平移歧义是主要瓶颈,凸显需更强解剖与上下文约束。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12524 2026-08-26 cs.CV 版本更新 57%

Voronoi-Assisted Optimization for Diffusing Unsigned Distance Fields from Unoriented Points

基于Voronoi辅助优化的无向点云无符号距离场扩散方法

Jiayi Kong, Chen Zong, Junkai Deng, Xuhui Chen, Fei Hou, Shiqing Xin, Junhui Hou, Chen Qian, Ying He

机构 * S-Lab Nanyang Technological University Singapore(南洋理工大学新加坡S-Lab) College of Mathematics Nanjing University of Aeronautics and Astronautics China(南京航空航天大学数学学院) College of Computing and Data Science Nanyang Technological University Singapore(南洋理工大学计算与数据科学学院) Institute of Software Chinese Academy of Sciences China(中国科学院软件研究所) School of Computer Science Shandong University China(山东大学计算机科学学院) Department of Computer Science City University of Hong Kong China(香港城市大学计算机科学系) SenseTime Research China(SenseTime研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出轻量级无网络方法VAD,通过Voronoi准则对齐无向点云法向量并扩散积分,可高效稳定计算UDF,稳健处理各类三维几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23762 2026-08-26 math.AT 新提交 50%

Transport based embeddings with topological guarantees

带拓扑保证的基于传输的嵌入

Erik Carlsson, John Carlsson

专题命中 点云 :point cloud(abstract)

AI总结 该研究提出带拓扑保证的基于传输的嵌入方法,通过定义c-凸势函数的传输映射压缩数据,在COIL和SYMSOL数据集实验中验证其能保留拓扑且避免虚假同调。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25194 2026-08-26 math.AT cs.CG math-ph quant-ph 版本更新 50%

Hodge Spectral Surrogates for Topology-Constrained Optimization

用于拓扑约束优化的霍奇谱替代方法

Satoshi Kanno, Yoshi-aki Shimada

专题命中 点云 :point cloud(abstract)

AI总结 提出基于霍奇谱松弛的微分框架,通过低通谱滤波器实现拓扑约束优化,克服贝蒂数和持续同调的离散组合困难。

Comments 57 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 1 篇

2407.00500 2026-08-26 cs.CV cs.AI cs.GR cs.LG 版本更新 79%

Intrinsic PAPR: Tackling Misattribution in 3D Intrinsic Decomposition via Proximity Attention Point Rendering

内在PAPR:通过邻近注意力点渲染解决3D内在分解中的属性误分配问题

Alireza Moazeni, Shichong Peng, Yanshu Zhang, Chirag Vashist, Ke Li

专题命中 新视角合成 :NeRF(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 该研究针对3D内在分解中属性误分配问题,提出Intrinsic PAPR框架,通过邻近注意力点渲染实现逐点监督,在新视图合成和反照率估计上优于多种现有方法。

Comments Accepted to ECCV 2026. 21 pages + 34-page supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 2 篇

2608.19567 2026-08-26 cs.CV 版本更新 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23943 2026-08-26 cs.CV cs.AI cs.GR 新提交 62%

Luce: Relightable Gaussians for 3D Asset Generation

Luce:用于3D资产生成的可重光照高斯模型

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

机构 * Apple(苹果公司)

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。

Comments 27 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 2 篇

2608.23650 2026-08-26 cs.RO 新提交 57%

Concept-Guided Exploration: Building Persistent, Actionable Scene Graphs

概念引导探索:构建持久、可执行的场景图

Noé Zapata, Gerardo Pérez, Alejandro Torrejón, Pedro Núñez, Pablo Bustos

机构 * University of Extremadura(埃斯特雷马杜拉大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 该研究提出以概念为先的认知分布式架构,通过房间、门两类概念智能体协作,基于分层约束传播与预测-匹配循环构建无需全局度量地图的持久可执行室内场景图,实现机器人空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18778 2026-08-26 cs.RO cs.AI 版本更新 57%

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

VGGT-DP:基于视觉基础模型的通用机器人控制

Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 该研究提出 VGGT-DP 视觉运动策略框架,采用 VGGT 作为视觉编码器并设计 FTR 机制与随机令牌剪枝,在 MetaWorld 任务上较 DP、DP3 等基线表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏