arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-11 至 2025-12-11 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 4 篇

2512.07596 2025-12-11 cs.CV cs.RO 76%

More than Segmentation: Benchmarking SAM 3 for Segmentation, 3D Perception, and Reconstruction in Robotic Surgery

超越分割:在机器人手术中评估SAM 3用于分割、3D感知和重建的基准测试

Wenzhen Dong, Jieming Yu, Yiming Huang, Hongqiu Wang, Lei Zhu, Albert C. S. Chung, Hongliang Ren, Long Bai

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Technical University of Munich(慕尼黑技术大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO、cs.CV

AI总结 本文评估了SAM 3在机器人手术中的分割、3D感知和重建能力,展示了其在动态视频跟踪中的有效性,同时指出了基于语言提示的局限性及进一步改进的必要性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09463 2025-12-11 cs.CV cs.AI 62%

Privacy-Preserving Computer Vision for Industry: Three Case Studies in Human-Centric Manufacturing

工业隐私保护计算机视觉:人类导向制造中的三个案例研究

Sander De Coninck, Emilio Gamba, Bart Van Doninck, Abdellatif Bey-Temsamani, Sam Leroux, Pieter Simoens

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种隐私保护的计算机视觉框架,通过三个工业案例验证,展示如何在监控中减少隐私风险,为人类导向的AI应用提供指导。

Comments Accepted to the AAAI26 HCM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09619 2025-12-11 cs.RO 57%

GLaD: Geometric Latent Distillation for Vision-Language-Action Models

GLaD:面向视觉-语言-动作模型的几何潜在蒸馏

Minghao Guo, Meng Cao, Jiachen Tao, Rongtao Xu, Yan Yan, Xiaodan Liang, Ivan Laptev, Xiaojun Chang

机构 * MBZUAI University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 GLaD通过引入几何意识的预训练机制,提升了视觉-语言-动作模型的空间推理和策略泛化能力,无需依赖深度传感器或3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09995 2025-12-11 cs.CV 57%

PlayerOne: Egocentric World Simulator

PlayerOne:第一人称真实世界模拟器

Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, Hengshuang Zhao

机构 * HKU(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(华盘实验室) HUST(华中科技大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。

Comments Project page: https://playerone-hku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏