arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-24 至 2026-08-24 共收录 23 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 3 篇

2606.18250 2026-08-24 cs.CV 版本更新 79%

Future Dynamic 3D Reconstruction: Toward 3D World Modeling with Disentangled Ego-Motion

未来动态3D重建:一种具有解耦自运动的3D世界模型

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 三维重建 :3D reconstruction(title,abstract);分类 cs.CV

AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。

Comments ICML 2026. Project page: this https URL (https://fr3d-wm.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01479 2026-08-24 cs.CV 版本更新 74%

RecGen3D: Reconstruction-Guided 3D Generation in a Shared Canonical Space

UniRecGen:统一多视图3D重建与生成

Zhisheng Huang, Jiahao Chen, Cheng Lin, Chenyu Hu, Hanzhuo Huang, Zhengming Yu, Mengfei Li, Yuheng Liu, Zekai Gu, Zibo Zhao, Yuan Liu, Xin Li, Wenping Wang

机构 * Macau University of Science and Technology(澳门科技大学) Xidian University(西安电子科技大学) ShanghaiTech University(上海科技大学) Hong Kong University of Science and Technology(香港科技大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 三维重建 :3D generation(title);分类 cs.CV

AI总结 UniRecGen融合了高效重建与生成模型,通过共享空间协作学习提升多视图3D模型的完整性和一致性,实验显示其在稀疏观测下生成更精确稳定的3D模型。

Comments Accepted to SIGGRAPH Asia 2026 (Conference Papers). 21 pages including supplementary material. Code: this https URL (https://github.com/zsh523/RecGen3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20748 2026-08-24 cs.CV 新提交 70%

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

为视觉几何接地Transformer生成多视角对抗样本

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 三维重建 :3D vision(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本研究针对3D基础模型VGGT的安全漏洞,提出MVAP-G多视角对抗扰动生成器,通过跨视角对抗对齐机制生成一致扰动,可无需迭代优化即可显著降低VGGT性能,为3D视觉系统鲁棒性研究提供了新方向。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Gaussian Splatting 4 篇

2409.11307 2026-08-24 cs.CV 版本更新 91%

GS-Net: Heterogeneous Vehicle Data Reuse via Generalizable Plug-and-Play 3DGS Module

GS-Net:通过通用即插即用3DGS模块实现异构车辆数据复用

Yichen Zhang, Zihan Wang, Jiali Han, Peilin Li, Jiaxun Zhang, Jianqiang Wang, Lei He, Keqiang Li

专题命中 Gaussian Splatting :3DGS(title,title_cn);point cloud(abstract);分类 cs.CV

AI总结 该研究针对自动驾驶跨车辆数据复用受限问题,提出即插即用的GS-Net模块,结合SfM点云与3DGS提升视图渲染质量,构建首个跨传感器视图合成基准CARLA-NVS,实验证实其在插值与外推视图上的性能及效率优势。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20813 2026-08-24 cs.CV 版本更新 85%

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization

SubSplat:通过亚像素高斯重参数化实现高分辨率像素对齐的3DGS

Jiun Lee, Jaekwang Kim, Sangmin Lee

机构 * AimFuture(c)(AimFuture公司) Sungkyunkwan University(成均馆大学) Korea University(韩国大学)

专题命中 Gaussian Splatting :3DGS(title,title_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究像素对齐高斯渲染高分辨率与成本权衡问题,提出SubSplat方法,通过亚像素高斯重参数化器细分高斯并结合特征聚合提升质量,实验证明该方法能高效实现高保真渲染,解决了相关权衡问题。

Comments ECCV 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20687 2026-08-24 cs.CV cs.GR 新提交 85%

TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction

TopoSurfel:闭合高斯面元与网格间的循环以实现表面重建

Chuanjin Fan, Wenjie Chang, Bohao Liao, Yujia Chen, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Deep Space Exploration Laboratory(深空探测实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract,abstract_cn);3DGS(abstract,abstract_cn);novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯溅射直接提取高保真表面易产生伪影和浮点数的问题,提出闭合高斯面元与网格循环的TopoSurfel框架,通过动态生成代理网格及相关策略实现高质量表面重建与新视图合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20602 2026-08-24 eess.IV cs.CV 新提交 84%

Sparse Light Field Sampling Improves Casual 3D and 4D Reconstruction

稀疏光场采样提升 casual 三维与四维重建

Shamus Li, Ruiming Cao, Laura Waller, Kristina Monakhova, Sara Fridovich-Keil

专题命中 Gaussian Splatting :3DGS(summary_cn,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文针对消费级多视图相机,提出稀疏视图3DGS与4DGS基线方法,验证多相机稀疏采样可显著提升单帧、少帧及casual视频的三维与四维重建质量,尤其适用于动态场景。

Comments Project page: this https URL (https://shamus.li/lightfield-gaussian-splatting)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 点云 8 篇

2608.20740 2026-08-24 cs.CV 新提交 83%

VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds

VisTa3D:用于从视觉、触觉和三维点云重建薄物体的数据集与基准

Shania Guo, Yeongsik Seo, Andrew Fu, Mei Hao, Iris Xia, Jiwon Jenny Lee, Xinyi Mary Xie, Hyoungseob Park, Aaron Dollar, Alex Wong

机构 * Yale University(耶鲁大学) Yale Vision Laboratory(耶鲁视觉实验室) GRAB Lab(GRAB实验室)

专题命中 点云 :point cloud(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 VisTa3D是首个含视觉、触觉等数据的薄物体重建数据集,作者在其上基准测试现有模型发现其保真度低,还提出视觉-深度-触觉基线模型以探究触觉数据对薄物体重建的辅助作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20872 2026-08-24 math.NA cs.CE 新提交 78%

Point Cloud Quality for Meshfree Methods

无网格方法的点云质量

Mohsen Abdolahzadeh, Oleg Davydov, Isabel Michel, Pratik Suchde

专题命中 点云 :point cloud(title,abstract)

AI总结 本研究针对无网格点云质量展开系统研究,对比分析现有指标并引入新指标,经大量数值测试后确定六项可靠指标,同时指出部分常用指标预测精度的能力较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20891 2026-08-24 cs.RO cs.CV 新提交 62%

IMU-Free Body-Frame State Estimation with Sparse Scene Flow for Quadcopters

面向四旋翼无人机的基于稀疏场景流的无IMU机体坐标系状态估计

Daniel Grønhaug, Sofie Markeset, Mathias Kolberg

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出一种无IMU的四旋翼仅视觉状态估计系统,采用扩展卡尔曼滤波与4视图光束平差法,生成机体坐标系状态估计与稀疏场景流,无需GPS等世界坐标系基础设施。

Comments 56 pages, 5 figures, 2 tables. Evaluated on the VID dataset ( arXiv:2103.11152 (https://arxiv.org/abs/2103.11152) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11645 2026-08-24 cs.CV 版本更新 57%

Cloak of Invisibility: Real-Time Privacy-Preserving Volumetric Video Streaming

隐形斗篷:实时隐私保护的体视频流

Hossein Khalili (UCLA), Philip Do (UCLA), Alexander Vilesov (UCLA), Achuta Kadambi (UCLA), Kittipat Apicharttrisorn (Nokia Bell Labs), Nader Sehatbakhsh (UCLA)

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09431 2026-08-24 cs.CV 版本更新 57%

Vision Foundation Model Driven Foreground-Aware Pseudo-LiDAR Generation for Monocular 3D Object Detection

视觉基础模型驱动的面向前景感知的伪激光雷达生成方法用于单目3D目标检测

Bonan Ding, Jin Xie, Jing Nie, Jiale Cao, Yanwei Pang

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出VFMM3D框架,利用DAM和SAM的先验生成前景感知伪激光雷达,在KITTI、Waymo数据集上实现最优性能,可无缝集成至多种激光雷达3D目标检测器。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09307 2026-08-24 physics.comp-ph 版本更新 50%

Constitutive Priors for Inverse Design

本构先验用于逆设计

Jinkyo Han, Bahador Bahmani

专题命中 点云 :point cloud(abstract)

AI总结 本文提出了一种端到端框架,直接在本构行为空间中进行弹性网络的逆设计。通过潜在表示构建本构先验,定义可接受的材料定律流形并保证热力学一致性。逆问题被建模为具有潜在本构变量的PDE约束优化问题,通过同伦策略提高非凸优化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13862 2026-08-24 quant-ph 版本更新 50%

Quantum Topological Analysis on Digraphs

有向图上的量子拓扑分析

Yunpeng Zi, Muchun Yang, D. L. Zhou

专题命中 点云 :point cloud(abstract)

AI总结 该研究针对有向图路径同调提出量子算法,设计了量子编码协议,在路径空间可高效访问时实现指数级加速,标准有向图输入下实现多项式级加速,为拓扑数据分析提供新的量子方法。

Comments 26 pages, 2 figures, To be appeared on Quantum Science and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10573 2026-08-24 cs.CL cs.LG 版本更新 50%

The Intrinsic Dimension of Prompts in Internal Representations of Large Language Models

大语言模型内部表示中提示的固有维度

Karthik Viswanathan, Yuri Gardinazzi, Giada Panerai, Alberto Cazzaniga, Matteo Biagetti

专题命中 点云 :point cloud(abstract)

AI总结 本研究通过固有维度视角分析大语言模型提示的内部表示几何,发现其与下一个 token 不确定性等相关,训练的线性探测模型可在生成前区分恶意与良性提示,准确率优于现有安全工具,为 LLM 安全提供了新信号。

Comments 12+14 pages, 18 figures, matches published version on Transactions of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 新视角合成 2 篇

2604.13416 2026-08-24 cs.CV cs.AI 版本更新 83%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 70%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 新视角合成 :3D reconstruction(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 3D生成 3 篇

2608.20448 2026-08-24 cs.GR cs.CV 新提交 81%

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube:具有部件级语义与空间控制的组合式三维生成

Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV、cs.GR

AI总结 MultiCube是一种组合式三维生成方法,通过两阶段扩散过程与部件布局适配器,实现了对三维对象部件级语义和空间的精确控制,可生成高质量且布局独特的组合式三维对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19567 2026-08-24 cs.CV 版本更新 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Code is not ready for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20759 2026-08-24 cs.CV 新提交 57%

DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion

DiGS-Avatar:基于UV空间扩散的单图像可动画三维人体重建

Jiakun Li, Li Fang, Hao Zhu, Fei Hu, Long Ye, Yuan Zhang, Jinyao Yan

机构 * Key Laboratory of Media Audio and Video (Communication University of China)(中国传媒大学媒体音频与视频重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 3D生成 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出DiGS-Avatar,将单图像可动画三维人体重建转化为UV空间扩散的潜变量补全任务,通过师生框架优化后解码为三维高斯基元,实现了高效高质量的重建与零样本泛化。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 空间理解 3 篇

2608.21136 2026-08-24 cs.CV 新提交 57%

Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding

Stream3Dv2:几何-语义融合增强的流式零样本3D场景理解

Jie Xu, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 针对现有开放词汇零样本3D场景理解模型难以处理流式RGB-D输入、易受2D分割掩码噪声影响的问题,提出无训练框架Stream3Dv2,通过几何-语义融合等策略提升性能,在相关任务上优于基准,可与LLM智能体集成用于开放世界具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20691 2026-08-24 cs.CV 新提交 57%

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

连接语言与球面空间:面向全景生成的以对象为中心的控制方法

Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 针对现有文本到全景生成方法难以对齐对象级方向描述的问题,提出以对象为中心的可控框架PanoCtrl,构建相关数据集并实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11055 2026-08-24 cs.CV 版本更新 57%

Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection

Crane:用于零样本异常检测的上下文引导提示学习与注意力优化

Alireza Salehi, Mohammadreza Salehi, Reshad Hosseini, Cees G. M. Snoek, Makoto Yamada, Mohammad Sabokrou

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本研究提出基于CLIP的框架Crane,通过相关性注意力模块、上下文引导提示学习等改进零样本异常检测,在7个工业基准上显著提升图像级AP与像素级AUPRO,还衍生出更强变体Crane+。

Comments British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏