arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 4400 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 4400 篇

2603.18795 2026-03-20 cs.CV cs.AI 57%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 57%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO 57%

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.RO

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12789 2026-03-19 cs.CV 57%

Coherent Human-Scene Reconstruction from Multi-Person Multi-View Video in a Single Pass

从多视角多人物视频中单次通过进行一致的人-场景重建

Sangmin Kim, Minhyuk Hwang, Geonho Cha, Dongyoon Wee, Jaesik Park

机构 * Seoul National University(首尔国立大学) NAVER Cloud(NAVER云)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CHROMM框架,通过单次处理联合估计相机、场景点云和人体网格,无需额外模块或预处理,提升多视角人体姿态估计性能。

Comments Project page: https://nstar1125.github.io/chromm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16612 2026-03-18 cs.GR 57%

Retrieval-Augmented Sketch-Guided 3D Building Generation

增强检索的草图引导3D建筑生成

Zhengyang Wang, Nuttapong Rochanavibhata, Yuxiao Ren, Xusheng Du, Ye Zhang, Haoran Xie

专题命中 三维重建 :3D generation(abstract);分类 cs.GR

AI总结 本文提出多阶段3D生成框架,通过结合生成与检索方法实现组件级编辑与个性化定制,解决日本独栋房屋早期设计阶段因缺乏统一表示导致的设计漂移问题。

Comments 10 pages, 4 figures, Proceeding of CAADRIA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07107 2026-03-18 cs.CV 57%

COREA: Coupled Relightable 3D Gaussians and SDFs for Efficient Normal Alignment

COREA:耦合可重照明3D高斯与SDF用于高效的法线对齐

Jaeyoon Lee, Hojoon Jung, Sungtae Hwang, Jihyong Oh, Jongwon Choi

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 三维重建 :3DGS(abstract);分类 cs.CV

AI总结 COREA是首个统一的三任务框架,结合SDF和可重照明3D高斯(3DGS)以联合支持基于球谐函数的新型视角合成(NVS)、表面重建和逆物理渲染(逆PBR)。通过共享底层表面,利用几何约束的可重照明3DGS提供可靠深度信号,SDF的连续法线场为高斯法线学习提供空间一致监督。

Comments Project page: https://cau-vilab.github.io/COREA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14150 2026-03-17 cs.CV 57%

CIPHER: Culvert Inspection through Pairwise Frame Selection and High-Efficiency Reconstruction

CIPHER: 通过成对帧选择和高效重建进行涵洞检查

Seoyoung Lee, Zhangyang Wang

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种高效的RGB基3D重建管道,用于在视觉重复环境中对涵洞结构进行自动检查,通过成对帧选择和实时重建提升检查效率。

Comments Accepted by ICCV 2026 End-to-End 3D Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14021 2026-03-17 cs.CV cs.AI 57%

EI-Part: Explode for Completion and Implode for Refinement

EI-Part: 分解以完成,聚合以细化

Wanhu Sun, Zhongjin Luo, Heliang Zheng, Jiahao Chang, Chongjie Ye, Huiang He, Shengchu Zhao, Rongfei Jia, Xiaoguang Han

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 EI-Part通过分解与聚合状态生成高质量3D部件,实现结构连贯性和几何精确性,达到部分级3D生成的最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09160 2026-03-17 cs.CV 57%

WonderVerse: Extendable 3D Scene Generation with Video Generative Models

WonderVerse:基于视频生成模型的可扩展3D场景生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Qi Dou, Jingyu Hu, Zhengzhe Liu

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出WonderVerse框架,利用视频生成模型中的世界级先验知识生成沉浸式且几何一致的3D环境,并引入可控扩展技术与异常序列检测模块,实现高效高质量的可扩展3D场景生成。

Comments Accepted at CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13585 2026-03-17 cs.RO 57%

Sonar-MASt3R: Real-Time Opti-Acoustic Fusion in Turbid, Unstructured Environments

Sonar-MASt3R:在浑浊、无结构环境中实时优化声学融合

Amy Phung, Richard Camilli

机构 * Applied Ocean Physics and Engineering, Woods Hole Oceanographic Institution, Deep Submergence Laboratory, Woods Hole, MA, USA(应用海洋物理与工程,伍兹霍尔海洋研究所,深潜实验室,马萨诸塞州伍兹霍尔,美国) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院,剑桥,马萨诸塞州,美国)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出Sonar-MASt3R方法,通过实时提取光学相机数据的密集对应关系并与声学3D重建的几何线索结合,提升在浑浊环境中的鲁棒性。

Comments This paper has been accepted for publication in ICRA 2026. Copyright IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13387 2026-03-17 cs.CV 57%

Cylindrical Mechanical Projector for Omnidirectional Fringe Projection Profilometry

圆柱形机械投影仪用于全方位光带投影轮廓测量

Mincheol Choi, Gaeun Kim, Jae-Sang Hyun

机构 * Department of Mechanical Engineering, Yonsei University(延世大学机械工程系)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出基于圆柱形机械投影仪的新型3D重建方法,通过旋转台和带有ON/OFF槽的圆柱形图案生成器实现多频相移光带的全方位投影,结合多波长解包裹算法和准校准技术,实现高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 57%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13172 2026-03-16 cs.CV 57%

LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

LongStream: 长序列流式自回归视觉几何

Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

机构 * HKUST (GZ)(香港科技大学(广州)) Horizon Robotics ZJU(浙江大学) CSU(中国科学技术大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 LongStream通过抛弃首帧锚点、引入正交尺度学习和缓存一致性训练,解决长序列流式3D重建中的姿态漂移和注意力偏差问题,实现千帧级稳定重建。

Comments CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07504 2026-03-13 cs.CV 57%

High-Fidelity Medical Shape Generation via Skeletal Latent Diffusion

通过骨骼潜在扩散实现高保真的医学形状生成

Guoqing Zhang, Jingyun Yang, Siqi Chen, Anping Zhang, Yang Li

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。

Comments 11 pages, 5 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10606 2026-03-12 cs.GR 57%

TopGen: Learning Structural Layouts and Cross-Fields for Quadrilateral Mesh Generation

TopGen:学习四边形网格生成的结构布局和交叉字段

Yuguang Chen, Xinhai Liu, Xiangyu Zhu, Yiling Zhu, Zhuo Chen, Dongyu Zhang, Chunchao Guo

专题命中 三维重建 :point cloud(abstract);分类 cs.GR

AI总结 TopGen通过同时预测结构布局和交叉字段,实现高效且稳健的四边形网格生成,提供直观可编辑的基础以提升几何保真度和拓扑合理性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10390 2026-03-12 cs.RO 57%

ScanDP: Generalizable 3D Scanning with Diffusion Policy

ScanDP: 可泛化的3D扫描与扩散策略

Itsuki Hirako, Ryo Hakoda, Yubin Liu, Matthew Hwang, Yoshihiro Sato, Takeshi Oishi

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 ScanDP提出一种基于扩散策略的高效3D扫描框架,通过占据网格映射和混合方法提升鲁棒性和泛化能力,实现对多样化物体的高效扫描。

Comments 8 pages, 7 figures, 5 tables. Project Page: https://treeitsuki.github.io/ScanDP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08254 2026-03-10 cs.CV 57%

DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving

DynamicVGGT: 为自动驾驶中的4D场景重建学习动态点图

Zhuolin He, Jing Li, Guanghao Li, Xiaolei Chen, Jiacheng Tang, Siyang Zhang, Zhounan Jin, Feipeng Cai, Bin Li, Jian Pu, Jia Cai, Xiangyang Xue

机构 * Fudan University(复旦大学) Huawei(华为) Yinwang Intelligent Technology(依文智能技术) Shanghai Innovation Institute(上海创新研究院) CUHK(香港中文大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 DynamicVGGT通过联合预测当前和未来点图,结合Motion-aware Temporal Attention模块和动态3D高斯点散射头,实现了自动驾驶中4D动态场景的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07441 2026-03-10 cs.CV 57%

DogWeave: High-Fidelity 3D Canine Reconstruction from a Single Image via Normal Fusion and Conditional Inpainting

DogWeave: 通过法线融合与条件修复从单张图像实现高保真3D犬只重建

Shufan Sun, Chenchen Wang, Zongfu Yu

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 DogWeave通过法线融合与条件修复技术,从单张图像实现高保真3D犬只重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19914 2026-03-10 cs.RO 57%

They See Me Rolling: High-Speed Event Vision-Based Tactile Roller Sensor for Large Surface Inspection

他们能看到我滚动:基于高速事件视觉的触觉滚轮传感器用于大表面检测

Akram Khairi, Hussain Sajwani, Abdallah Mohammad Alkilany, Laith AbuAssi, Mohamad Halwani, Islam Mohamed Zaid, Ahmed Awadalla, Dewald Swart, Abdulla Ayyad, Yahya Zweiri

机构 * Advanced Research and Innovation Center(先进研究与创新中心) Khalifa University(卡利法大学) Department of Aerospace Engineering(航空航天工程系) Research and Development(研发部) Strata Manufacturing PJSC(斯特拉制造公司)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出了一种基于高速事件视觉的触觉滚轮传感器,实现高速连续高分辨率的大面积表面检测,扫描速度达0.5m/s,精度达100微米以内,且通过多参考贝叶斯融合策略提升准确性。

Comments Accepted to IEEE T-RO - Project Page: https://akramekhairi.github.io/TheySeeMeRolling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17635 2026-03-10 cs.CV 57%

LangSurf: Language-Embedded Surface Gaussians for 3D Scene Understanding

LangSurf: 语言嵌入的表面高斯用于3D场景理解

Hao Li, Minghan Qin, Zhengyu Zou, Diqi He, Xinhao Ji, Bohan Li, Bingquan Dai, Dingewn Zhang, Junwei Han

机构 * Brain and Artificial Intelligence Lab, Northwestern Polytechnical University(脑科学与人工智能实验室,西北工业大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学) School of Artifical Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 三维重建 :Gaussian Splatting(abstract);分类 cs.CV

AI总结 LangSurf通过语言嵌入的表面高斯实现3D场景理解,提升2D和3D分割精度,扩展了下游任务如去除和编辑。

Comments \url{https://langsurf.github.io}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07144 2026-03-10 cs.CV 57%

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Yuan, Long Quan, Xin Wang, Xueying Qin

机构 * SDU(1 南开大学) LIGHTSPEED(2 LIGHTSPEED) UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) HKUST(4 香港理工大学) PKU(5 北京大学)

专题命中 三维重建 :3D generation(abstract);分类 cs.CV

AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06982 2026-03-10 cs.CV cs.IR 57%

Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning

优化多模态模型用于基于图像的形状检索:预对齐和硬对比学习的作用

Paul Julius Kühn, Cedric Spengler, Michael Weinmann, Arjan Kuijper, Saptarshi Neil Sinha

机构 * Fraunhofer IGD(弗劳恩霍夫图像研究中心) Delft University of Technology(代尔夫特理工大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出通过预对齐和硬对比学习优化多模态模型,提升基于图像的形状检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06971 2026-03-10 cs.CV 57%

SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation

SurgCUT3R: 术场景感知的连续时间3D表示理解

Kaiyuan Xu, Fangzhou Hong, Daniel Elson, Baoru Huang

机构 * The Hamlyn Centre for Robotic Surgery, Imperial College London(机器人手术中心,帝国理工学院伦敦分校) S-Lab, College of Computing and Data Science, Nanyang Technological University(S实验室, computing and Data Science学院,南洋理工大学) Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SurgCUT3R通过数据生成、混合监督和分层推理框架,解决手术场景中3D重建的准确性和效率问题,实现稳健的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06684 2026-03-10 cs.CV eess.IV 57%

Three-dimensional reconstruction and segmentation of an aggregate stockpile for size and shape analyses

三维重建与堆料堆的分割用于尺寸和形状分析

Erol Tutumluer, Haohang Huang, Jiayi Luo, Issam Qamhia, John M. Hart

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 本文提出了一种基于移动设备的3D成像方法,用于现场快速获取堆料颗粒的3D尺寸和形状信息,以提高道路建设材料的质量控制效率。

Comments 7 pages, 4 figures, Proceedings of the 20th International Conference on Soil Mechanics and Geotechnical Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21302 2026-03-10 cs.CV 57%

Quantized Visual Geometry Grounded Transformer

量化视觉几何基础变换器

Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出QuantVGGT,首个针对大规模VGGT的量化框架,通过双平滑细粒度量化和噪声过滤多样化采样技术,在保持高精度的同时实现显著的内存减少和加速。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05787 2026-03-09 cs.CV 57%

Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction

特征上采样器在2D到3D场景重建中的频谱探测

Ling Xiao, Yuliang Xiu, Yue Chen, Guoming Wang, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) Westlake University(西湖大学) Zhejiang University(浙江大学) The University of Tokyo(东京大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出频谱诊断框架,通过六个指标评估特征上采样器对3D重建的影响,发现频谱一致性比空间细节更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 57%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05506 2026-03-06 cs.CV 57%

FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

FaceCam: 通过尺度感知条件化实现人像视频相机控制

Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔塞德斯分校) Adobe Research(Adobe研究)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。

Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05312 2026-03-06 cs.RO 57%

UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data

UltraDexGrasp: 为双臂机器人学习通用灵巧抓取

Sizhe Yang, Yiman Xie, Zhixuan Liang, Yang Tian, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.RO

AI总结 UltraDexGrasp通过合成数据训练出高效抓取策略,实现双臂机器人在多种物体上的高成功率抓取。

Comments Published at International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04614 2026-03-06 cs.CV 57%

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

SGR3模型:三维场景图检索-推理模型

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Shenzhen University(深圳大学) Hunan University(湖南大学)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏