arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 21 信号源:cs.CV, cs.GR, cs.RO

1. 新视角合成 21 篇

2606.20531 2026-08-18 cs.CV 版本更新 90%

VisDom: Sparse Novel View Synthesis with Visible Domain Constraint

VisDom: 具有可见域约束的稀疏新视角合成

Mariia Gladkova, Tarun Yenamandra, Edmond Boyer, Robert Maier, Tony Tung, Daniel Cremers

机构 * TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心)

专题命中 新视角合成 :NeRF(summary_cn,abstract);novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出VisDom,一种无学习的几何约束,通过最小多视角可见性要求增强视觉外壳重建,作为稀疏新视角合成中的空间先验,集成到NeRF和GS管线中,从四张输入图像实现高质量重建。

Comments Accepted to GCPR 2026 (Oral). Project page and code: https://tarun738.github.io/visdom/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新 87%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 新视角合成 :novel view synthesis(title,abstract);3DGS(abstract,abstract_cn);Gaussian Splatting(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13416 2026-07-07 cs.CV cs.AI 版本更新 83%

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

DF3DV-1K:用于无干扰新视角合成的大规模数据集与基准

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学) University of Sydney(悉尼大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);Gaussian Splatting(abstract);分类 cs.CV

AI总结 为弥补无干扰辐射场领域缺乏大规模真实世界数据集的空白,构建了包含1048个场景、每场景提供干净和杂乱图像集的DF3DV-1K数据集,并基于此基准测试了九种最新方法,识别出最鲁棒的方法和最具挑战的场景。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10981 2026-06-17 cs.CV 版本更新 83%

SceneCompleter: Dense 3D Scene Completion for Generative Novel View Synthesis

SceneCompleter:面向生成式新视角合成的密集3D场景补全

Weiliang Chen, Jiayi Bi, Yuanhui Huang, Wenzhao Zheng, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 提出SceneCompleter,通过几何-外观双流扩散模型在RGBD潜空间进行密集3D场景补全,并引入场景嵌入器整合全局信息,实现跨视角一致的生成式新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12442 2026-08-20 cs.CV 版本更新 79%

MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis

MV2:用于新视角合成的多视角多车辆驾驶数据集

Sanjay Bhargav Dharavath, Hanvitha Saraswathi Mukkamala, Faizan Farooq Khan, Ioannis Kakogeorgiou, Aditya Arun, C V Jawahar, Zakaria Laskar

机构 * International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) IIT, National Centre for Scientific Research “Demokritos”(德谟克利特国家科学研究中心 IIT) Adobe MDSR, India(奥多比印度MDSR部门) Indian Institute of Science Education and Research, Thiruvananthapuram(特里凡得琅印度科学教育与研究学院)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 针对驾驶场景新视角合成的难题,提出含50个场景12000张图像的MV2多车辆数据集,经严格配准验证,基准测试显示视角差异增大NVS性能下降,前馈位姿估计器弱于优化方法。

Comments 38 pages, 25 figures, ECCV 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新 79%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29496 2026-07-07 cs.CV 版本更新 79%

Rectifying Mask via Entropy for Distractor-Free 3DGS in Ambiguous Scenarios

通过熵修正掩码实现模糊场景中无干扰的3D高斯泼溅

Wongi Park, Jiyeon Lim, Minjae Lee, Myeongseok Nam, Seongjun Choi, Jungwoo Kim, Soomok Lee, William J. Beksi, Sang-Hyun Lee

机构 * Samsung Electronics(三星电子) Georgia Institute of Technology(佐治亚理工学院) GenGenAI Yonsei University(延世大学) Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 新视角合成 :3DGS(title);novel view synthesis(abstract);分类 cs.CV

AI总结 提出RefineSplat框架,利用熵感知自适应掩码和密度控制方法,有效识别并移除模糊场景中的动态干扰物,实现无干扰的新视角合成。

Comments 28 pages, 30 figures, and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17918 2026-07-07 cs.CV 版本更新 79%

Do Flat Minima Improve Sparse Novel View Synthesis?

平坦最小值能改善稀疏新视图合成吗?

Youngsik Yun, Dongjun Gu, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 研究新视图合成中损失锐度与泛化的关系,提出结构感知锐度并根据局部图像结构自适应调整锐度正则化权重,可在保持细节重建所需锐度的同时促进泛化,提升多种基线方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 新视角合成 :novel view synthesis(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23413 2026-08-03 cs.CV 版本更新 77%

I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation

I3DM:隐式3D-aware记忆检索与注入用于一致的视频场景生成

Jia Li, Han Yan, Yihang Chen, Siqi Li, Xibin Song, Yifu Wang, Jianfei Cai, Tien-Tsin Wong, Pan Ji

机构 * Monash University(莫纳什大学) Vertex Lab(Vertex实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 新视角合成 :novel view synthesis(abstract,abstract_cn);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出I3DM,一种隐式3D-aware记忆机制,通过预训练FF-NVS模型的中间特征进行视图相关性评分,提升复杂遮挡下的场景一致性生成效果。

Comments Project page: https://riga2.github.io/i3dm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 77%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 新视角合成 :point cloud(abstract);novel view synthesis(abstract);3D generation(abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05876 2026-06-16 cs.CV cs.RO 版本更新 76%

Systematic Evaluation of Novel View Synthesis for Video Place Recognition

面向视频地点识别的合成新视角系统性评估

Muhammad Zawad Mahmud, Samiha Islam, Damian Lyons

专题命中 新视角合成 :novel view synthesis(title);分类 cs.CV、cs.RO

AI总结 系统评估合成新视角对视频地点识别的影响,发现少量合成视角可提升识别性能,且视角变化幅度不如添加数量和图像类型重要。

Comments Submitted to IEEE IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 62%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 新视角合成 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15022 2026-06-29 cs.CV cs.GR cs.LG 版本更新 62%

Complex-Valued 2D Gaussian Representation for Computer-Generated Holography

复值二维高斯表示用于计算机生成全息术

Yicheng Zhan, Xiangjun Gao, Long Quan, Kaan Akşit

机构 * University College London(伦敦大学学院) Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV、cs.GR

AI总结 提出基于复值二维高斯基元的全息图表示,通过最小化空间-频率不确定性并利用可微分光栅化器实现端到端优化,在减少显存和加速优化的同时,显著提升重建质量与渲染速度。

Comments 36 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05868 2026-08-11 cs.RO 版本更新 57%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20853 2026-08-06 cs.CV cs.AI cs.LG eess.IV 版本更新 57%

MODEST: Multi-Optics Depth-of-Field Stereo Dataset

MODEST:多光学深度景深立体数据集

Nisarg K. Trivedi, Vinayaka A. Belludi, Li-Yun Wang

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。

Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28828 2026-07-28 cs.CV 版本更新 57%

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video

Ground4D: 从单目视频进行一致性感知的四维重建

Qing Zhao, Weijian Deng, Pengxu Wei, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 新视角合成 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 提出Ground4D框架,结合3D基础模型进行几何初始化与动态高斯泼溅进行一致性优化,实现从单目视频的高保真4D重建与新视角渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 57%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 57%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 新视角合成 :3D vision(abstract);分类 cs.CV

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新 57%

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14366 2026-06-15 cs.CV 版本更新 57%

Optimizing Rank for High-Fidelity Implicit Neural Representations

优化秩以实现高保真隐式神经表示

Julian McGinnis, Florian A. Hölzl, Suprosanna Shit, Florentin Bieder, Paul Friedrich, Mark Mühlau, Bjoern Menze, Daniel Rueckert, Benedikt Wiestler

机构 * University of Cambridge(剑桥大学)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文通过训练中稳定秩的调控,证明简单MLP也能实现高保真隐式神经表示,使用Muon优化器可显著提升性能,在多种任务上PSNR提升高达9 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏