arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2025-12-09 至 2025-12-09 共收录 34 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 3 篇

2512.04686 2025-12-09 cs.CV 57%

Towards Cross-View Point Correspondence in Vision-Language Models

面向视觉-语言模型的跨视图点对应研究

Yipu Wang, Yuheng Ji, Yuyang Liu, Enshen Zhou, Ziqiang Yang, Yuxuan Tian, Ziheng Qin, Yue Liu, Huajie Tan, Cheng Chi, Zhiyuan Ma, Daniel Dajun Zeng, Xiaolong Zheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北航大学) Jilin University(吉林大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Huazhong University of Science And Technology(华中科技大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出跨视图点对应任务和 CrossPoint-Bench 基准,通过 CroPond 模型在 CrossPoint-Bench 上取得超越 Gemini-2.5-Pro 的准确率,推动跨视图对应研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 57%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 空间理解 :3DGS(abstract);分类 cs.CV

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. SLAM与定位 2 篇

2512.06868 2025-12-09 cs.RO cs.CV 62%

Dynamic Visual SLAM using a General 3D Prior

利用通用3D先验的动态视觉SLAM

Xingguang Zhong, Liren Jin, Marija Popović, Jens Behley, Cyrill Stachniss

机构 * Center for Robotics, University of Bonn(博恩大学机器人中心) MAVLab, TU Delft(代尔夫特理工大学MAVLab) Lamarr Institute for Machine Learning and Artificial Intelligence(兰玛尔人工智能与机器学习研究所)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.CV、cs.RO

AI总结 本文提出一种利用通用3D先验的单目视觉SLAM系统,通过结合前馈重建模型与集束调整,提升动态场景中相机姿态估计的鲁棒性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07309 2025-12-09 cs.IT cs.AI math.IT 50%

Radiance-Field Reinforced Pretraining: Scaling Localization Models with Unlabeled Wireless Signals

基于辐射场的强化预训练:利用未标记无线信号扩展定位模型

Guosheng Wang, Shen Wang, Lei Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(计算系,香港理工大学,香港,中国)

专题命中 SLAM与定位 :NeRF(abstract)

AI总结 本文提出RFRP框架,通过结合大规模未标记无线信号数据提升定位模型的跨场景泛化能力,实验表明其显著降低定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏