arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-09-01 至 2026-09-01 共收录 21 信号源:cs.CV, cs.GR, cs.RO

1. 点云 21 篇

2608.20740 2026-09-01 cs.CV 版本更新 83%

VisTa3D: A Dataset and Benchmark for Thin Object Reconstruction from Vision, Tactile, and 3D Point Clouds

VisTa3D:用于从视觉、触觉和三维点云重建薄物体的数据集与基准

Shania Guo, Yeongsik Seo, Andrew Fu, Mei Hao, Iris Xia, Jiwon Jenny Lee, Xinyi Mary Xie, Hyoungseob Park, Aaron Dollar, Alex Wong

机构 * Yale University(耶鲁大学) Yale Vision Laboratory(耶鲁视觉实验室) GRAB Lab(GRAB实验室)

专题命中 点云 :point cloud(title,abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 VisTa3D是首个含视觉、触觉等数据的薄物体重建数据集,作者在其上基准测试现有模型发现其保真度低,还提出视觉-深度-触觉基线模型以探究触觉数据对薄物体重建的辅助作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30279 2026-09-01 cs.CV 新提交 79%

Motion-Saliency Complementary Masked Modeling for Point Cloud Video Understanding

面向点云视频理解的运动显著性互补掩码建模

Wei Wang, Yiding Sun, Yuyan Wang, Zhuoyue Zhang, Zhengqiao Li, Dongfu Yin, Chen Li

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) State Key Laboratory of Intelligent Geotechnics and Tunnelling (FSDI)(智能岩土与隧道工程国家重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Information and Communication Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究提出MoSaiC框架,结合CMSM、NFM、CTCP组件实现自监督点云视频表示学习,在多个下游任务上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29793 2026-09-01 cs.CV 新提交 79%

GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation

GridFlow:用于无缝城市级三维点云生成的结构化潜在流

Xinyu Wang, Muhammad Ibrahim, Atif Mansoor, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究提出GridFlow框架,结合多模态条件生成城市级无缝三维点云,并构建City3D-MultiGen基准,实验显示其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29434 2026-09-01 cs.LG cs.AI cs.CV 新提交 79%

Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations

潜在规划在点云场景中是否可行?面向几何观测的动作条件JEPA世界模型

Fabio F. Oberweger, Michael Schwingshackl

机构 * AIT Austrian Institute of Technology(奥地利技术研究所) Assistive & Autonomous Systems(辅助与自主系统)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 该研究将JEPA模型扩展至点云场景,验证了三种JEPA设计可在点云规划中有效工作,其中动作敏感型模型表现最优,还实现了无需目标观测的3D目标接口构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08753 2026-09-01 cs.CV stat.ML 版本更新 79%

Simultaneous Monitoring of Shape and Surface Color via 4D Point Clouds: A Registration-free Approach

通过4D点云同时监测形状和表面颜色:一种无需配准的方法

Mariafrancesca Patalano, Giovanna Capizzi, Kamran Paynabar

机构 * Department of Statistical Sciences, University of Padua(帕多瓦大学统计科学系) School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院工业与系统工程学院)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出一种无需配准的框架,利用4D点云同时监测形状和颜色,通过拉普拉斯-贝特拉米算子的谱特性捕捉几何特征和形状与颜色的关系,有效检测形状变形和颜色异常。

Comments 38 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29433 2026-09-01 cs.CV cs.RO 新提交 62%

Calibration and Comparative Analysis of Forward-Looking Sonar and 3D Sonar for Enhanced Underwater Object Recognition

用于增强水下目标识别的前视声呐与三维声呐的校准及对比分析

Aditya Penumarti, Khanh Dong, Zi-Hao Zhang, Yongkyoon Park, Zhenqi Wu, Trung Dong, Shahriar Negahdaripour, Xiaomin Lin, Jane Shin

机构 * College of Engineering at the University of Florida(佛罗里达大学工程学院) Seoul National University(首尔大学) University of South Florida(南佛罗里达大学) University of Miami(迈阿密大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 该研究针对声呐噪声导致水下目标识别困难的问题,采用前视声呐与三维声呐两种模态,通过自动校准过滤噪声特征,提升了特征提取性能,为水下目标识别提供了有效方案。

Comments 6 pages, Accepted to IEEE OCEANS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28913 2026-09-01 cs.CV cs.GR cs.LG eess.SP 新提交 62%

mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis

mmIR:用于3D毫米波雷达ADC合成的频率空间逆渲染方法

Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

机构 * Cornell Tech(康奈尔科技学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 提出开源可微分的FMCW雷达逆渲染器mmIR,采用LiDAR辅助逆渲染,在ColoRadar数据集上实现高分辨率3D雷达数据合成,相关性能优于Sionna-RT且可跨雷达硬件迁移。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://mmwave-inverse-rendering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30451 2026-09-01 cs.CV 新提交 57%

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

SeqAlign3DVG:用于3D视觉定位的序列对齐基准与体素推理框架

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对现有3D视觉定位基准的文本-观测对齐松散、忽略时间顺序的问题,提出SeqAlign3DVG基准及含ROVM、PLVF的体素推理框架,在无深度协议下实现最优性能,提升复杂关系目标定位效果。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30371 2026-09-01 cs.CV 新提交 57%

MCSeg: Pre-training and Fine-tuning Volumetric Pyramid Transformer for Multi-modal Cardiac Image Segmentation

MCSeg:用于多模态心脏图像分割的体积金字塔Transformer的预训练与微调

Zhiyu Ye, Hairong Zheng, Tong Zhang

机构 * Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 本研究提出MCSeg网络,通过新型SFP连接ViT编码器与CNN解码器,结合自监督预训练与RMI损失,在多模态心脏图像分割任务中优于11种SOTA方法,小样本场景也表现出色

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30149 2026-09-01 cs.CV 新提交 57%

CedarCypress3D: an annotated UAV-LiDAR dataset of individual trees in planted cedar and cypress forests

CedarCypress3D:人工林杉树和柏树中单株树木的带标注无人机激光雷达数据集

Katsuto Shimizu, Fumiaki Kitahara, Tomohiro Nishizono, Hideki Saito, Masayoshi Takahashi, Shingo Obata, Shunsuke Tei, Naoyuki Furuya, Tomoya Goto, Eiji Kodani, Yusuke Yamada

机构 * Forestry and Forest Products Research Institute(森林综合研究所) Green Kogyo

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出CedarCypress3D,为温带人工林提供含1627棵树标注的无人机激光雷达数据集,可支撑单株树木分割等相关研究,且部分样地附带地面激光雷达数据。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29426 2026-09-01 cs.CV cs.AI cs.LG 新提交 57%

Polis: 3D Self-Supervision at City Scale

Polis:城市规模的3D自监督学习

Alexander Rusnak, Sophia Kovalenko, Jingru Wang, Ismail Moudden, Xiru Wang, Frédéric Kaplan

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 研究针对城市规模3D场景设计的Polis,结合SIGReg等技术,在14个城市与建筑规模基准上,提升了语义表示性能,同时展现了该领域自监督学习专业化的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29285 2026-09-01 cs.CV 新提交 57%

3D-MRL: Nested Multimodal 3D Representations via Matryoshka Representation Learning

3D-MRL:基于套娃表示学习的嵌套多模态3D表示

Márcus Lobo, Vitor Matias, Jeová Farias, Moacir Ponti

机构 * Bowdoin College(鲍登学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究针对现有多模态3D预训练方法需多模型适配不同计算预算的问题,提出3D-MRL框架,可通过单个模型生成不同维度3D表示,在多数据集上提升了3D识别与检索性能。

Comments Accepted at the British Machine Vision Conference (BMVC) 2026. Project page: https://usmarcv.github.io/3DMRL_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29080 2026-09-01 cs.RO 新提交 57%

GHOST in the Robots: Real-Time Exocentric Dual-Robot VR Teleoperation from Onboard Cameras

机器人中的GHOST:基于机载摄像头的实时异中心双机器人VR遥操作

Yichen Wei, Faisal Zaghloul, Soujanya C Aryal, Aanya K. Agrawal, Chengfan Li, Jason Xinyu Liu, James Tompkin, Stefanie Tellex

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出开源VR遥操作系统GHOST,可让单操作员通过机载传感以直接低级命令控制两台移动操作机器人,其在多机器人遥操作任务上的成功率和速度均优于商用平板界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28891 2026-09-01 cs.CV 新提交 57%

Pixel-wise Geo-registration of Drone and Satellite Images

无人机与卫星图像的像素级地理配准

Qingyang Liu, David G Shatwell, Parth Parag Kulkarni, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能学院)

专题命中 点云 :3D reconstruction(abstract);分类 cs.CV

AI总结 针对现有跨视角地理定位基准仅提供单坐标GPS标签、未充分探索密集配准的问题,推出SkyReg数据集与基准,评估多类基线并训练几何感知重建管线,实现无人机与卫星图像像素级地理配准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28762 2026-09-01 cs.CV 新提交 57%

Inter-3D VQA: A Roadside Multimodal Benchmark for 3D Spatiotemporally Grounded Visual Question Answering

Inter-3D VQA:用于3D时空视觉问答的路侧多模态基准

Shaozu Ding, Linan Song, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出用于交叉口3D时空视觉问答的路侧多模态基准Inter-3D VQA,构建含40.7万问答对的数据集,提出基线模型Inter-Geo与评估框架Inter-Metrics,实验显示Inter-Geo在接地时空推理任务上优于基于图像的VLM。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28669 2026-09-01 cs.CV cs.PL cs.SE 新提交 57%

MIRAGE-CAD: Construction-Mediated Multimodal Generation of Executable CAD Programs

MIRAGE-CAD:面向可执行CAD程序的构造介导多模态生成

Jizong Zhan

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 MIRAGE-CAD针对四类输入实现可执行CAD程序的多模态生成,在2500个保留查询上取得构建与STEP导出成功率,证实需分别评估可执行性、几何保真度等指标。

Comments 64 pages, 5 figures, 20 tables, 7 appendices. Code, evaluation scripts and run reports: https://github.com/Cad-Kernel/MIRAGE-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-09-01 cs.CV 版本更新 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30917 2026-09-01 eess.SP 新提交 50%

Intrinsic Scatterer Representation for Forward Scattering Modeling of Complex Radar Targets

复杂雷达目标前向散射建模的内在散射体表示

Ziyu Yue, Feng Xu

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种基于内在散射体表示的前向散射建模框架,通过改进RANSAC等技术提取并优化散射体,可高效、可解释地生成复杂雷达目标的SAR图像,性能优于电磁仿真与实测数据对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28888 2026-09-01 stat.ME stat.AP 新提交 50%

Bayesian model averaging of risk set probabilities using a geometric representation of multivariate extremes

基于多元极值的几何表示的风险集概率的贝叶斯模型平均

Elizabeth S. Lawler, Benjamin A. Shaby

专题命中 点云 :point cloud(abstract)

AI总结 本研究针对多元极值建模,提出结合删失似然的贝叶斯模型平均方法,在小样本下提升尾风险概率预测性能,并通过火灾气象指数验证其环境应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21247 2026-09-01 stat.ML cs.LG math.DG physics.data-an 版本更新 50%

Accelerate Vector Diffusion Maps by Landmarks

通过地标加速向量扩散图

Sing-Yuan Yeh, Yi-An Wu, Hau-Tieng Wu, Mao-Pei Tsui

机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)

专题命中 点云 :point cloud(abstract)

AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17809 2026-09-01 cs.IT math.IT 版本更新 50%

A Multi-Modal Channel Sounding System for Environment-Aware Channel Measurements in 6G Dynamic Scenarios

一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测

Xuejian Zhang, Ruisi He, Mi Yang, Zhengyu Zhang, Ziyi Qi

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。

Comments Substantially revised version after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏