arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-08-25 至 2026-08-25 共收录 37 信号源:cs.CV, cs.GR, cs.RO

1. 3D生成 1 篇

2608.19567 2026-08-25 cs.CV 版本更新 79%

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

专题命中 3D生成 :3D generation(title,abstract);分类 cs.CV

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 空间理解 2 篇

2608.22757 2026-08-25 cs.CV cs.AI 新提交 83%

Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation

Object-Uni:面向以物体为中心的空间理解与可控生成的统一模型

Mining Tan, Yinuo Wang, Ziqi Zhou, Weize Quan, Sifei Li, Jingdong Chen, DanDan Zheng, Libin Wang, Weiming Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与 mobility学院) Ant Group(蚂蚁集团)

专题命中 空间理解 :spatial understanding(title,abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 提出Object-Uni统一模型,通过视角方向抽象与UniSpatial-80K基准,实现以物体为中心的空间理解与可控生成,提升位姿理解及可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17885 2026-08-25 cs.CV cs.AI cs.RO 版本更新 62%

PEAfowl: Perception-Enhanced Multi-View Vision-Language-Action for Bimanual Manipulation

PEAfowl:感知增强的多视角视觉-语言-动作用于双臂操作

Qingyu Fan, Zhaoxiang Li, Jinrui Hu, Yi Lu, Wang Chen, Qiu Shen, Xiao-xiao Long, Yinghao Cai, Tao Lu, Shuo Wang, Xun Cao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO

AI总结 PEAfowl通过增强感知的多视角视觉-语言-动作策略,提升双臂操作在复杂环境中的稳定性和成功率。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2026. This version includes an extended appendix with additional implementation details, deployment analysis, robustness evaluation, and real-world evaluation protocol. DOI: https://doi.org/10.1109/LRA.2026.3726379

详情

展开后加载摘要…

URL PDF HTML 收藏

3. SLAM与定位 3 篇

2604.15052 2026-08-25 cs.RO 版本更新 57%

CAVERS: Multimodal SLAM Data from a Natural Karstic Cave with Ground Truth Motion Capture

CAVERS:从自然喀斯特洞穴获取多模态SLAM数据并采用地面真实运动捕捉

Giacomo Franchini, David Rodríguez-Martínez, Alfonso Martínez-Petersen, C. J. Pérez-del-Pulgar, Marcello Chiaberge

机构 * Polytechnic of Turin Interdepartmental Centre for Service Robotics (PIC4SeR)(都灵理工大学服务机器人跨部门研究中心(PIC4SeR)) Systems Engineering and Automation Department, Universidad de Málaga(马德里大学系统工程与自动化系)

专题命中 SLAM与定位 :3D reconstruction(abstract);分类 cs.RO

AI总结 本文提出CAVERS数据集,通过地面真实运动捕捉系统提供高精度姿态和速度数据,验证了多模态传感器在复杂洞穴环境中的SLAM算法性能。

Comments 8 pages, 4 figures, accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13183 2026-08-25 cs.CV cs.MM 版本更新 57%

GeoLink: A 3D-aware Framework to Improve Generalization for Cross-view Geo-localization

GeoLink:一种面向跨视角地理定位更好泛化的3D-aware框架

Hongyang Zhang, Yinhao Liu, Haitao Zhang, Zhongyi Wen, Zhenyu Kuang, Shuxian Liang, Xian-Sheng Hua

机构 * CUHK(SZ)(香港中文大学(深圳)) XMU(厦门大学) UESTC(电子科技大学) Foshan University(佛山大学) Tongji University(同济大学)

专题命中 SLAM与定位 :point cloud(abstract);分类 cs.CV

AI总结 本文提出GeoLink框架,通过3D感知的语义一致方法提升跨视角地理定位的泛化能力,实验表明其在多个基准测试中优于现有方法,能适应未见领域和多变天气。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22029 2026-08-25 cs.LG math-ph q-bio.BM q-bio.QM 新提交 50%

ARCHER: Amortized cross-specimen pose estimation for cryo-electron microscopy

ARCHER:用于冷冻电子显微镜的摊销跨样本姿态估计

Nhan D. Nguyen, Bao Pham

机构 * Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系)

专题命中 SLAM与定位 :3D reconstruction(abstract)

AI总结 该研究提出ARCHER模型,通过离散旋转网格建模姿态后验,实现冷冻电镜跨结构通用的零样本姿态估计,在测试结构和实验颗粒上均达到高精度,且保留下游构象信号。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他3D视觉 1 篇

2607.14935 2026-08-25 cs.CV 版本更新 70%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他3D视觉 :3D vision(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏