arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-22 至 2026-01-22 共收录 7 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 7 篇

2601.14921 2026-01-22 cs.RO cs.AI 81%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15282 2026-01-22 cs.CV cs.AI cs.RO 80%

Rethinking Video Generation Model for the Embodied World

重新思考具身世界的视频生成模型

Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。

Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05234 2026-01-22 cs.RO cs.LG 79%

Context-aware Learned Mesh-based Simulation via Trajectory-Level Meta-Learning

基于轨迹级元学习的上下文感知学得网格模拟

Philipp Dahlinger, Niklas Freymuth, Tai Hoang, Tobias Würth, Michael Volpp, Luise Kärger, Gerhard Neumann

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于轨迹级元学习的网格模拟方法,利用运动原语实现快速且准确的模拟,提升模拟精度并降低运行成本。

Comments 35 pages. Submitted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14438 2026-01-22 cs.CV cs.AI cs.CL cs.LG 67%

Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation

基于视觉的自然语言场景理解用于自动驾驶:一个扩展数据集和一个用于交通场景描述生成的新模型

Danial Sadrian Zadeh, Otman A. Basir, Behzad Moshiri

机构 * Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰大学电气与计算机工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出了一种基于视觉的自然语言场景理解模型,通过扩展数据集和混合注意力机制,提升自动驾驶中交通场景描述生成的准确性和丰富性。

Comments Under review at Computer Vision and Image Understanding (submitted July 25, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05999 2026-01-22 cs.CV cs.AI 62%

Geo-Registration of Terrestrial LiDAR Point Clouds with Satellite Images without GNSS

无需GNSS的地面LiDAR点云与卫星图像地理配准

Xinyu Wang, Muhammad Ibrahim, Haitian Wang, Atif Mansoor, Xiuping Jia, Ajmal Mian

机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) School of Engineering and Technology, University of New South Wales(工程与技术学院,新南威尔士大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出了一种无需GNSS的LiDAR点云与卫星图像地理配准方法,通过点云分割、道路骨架提取和刚性变换实现高精度配准,显著降低地理偏移误差。

Comments Submitted to IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. Under reviewing now

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 57%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17372 2026-01-22 cs.CV 57%

Coupled Laplacian Eigenmaps for Locally-Aware 3D Rigid Point Cloud Matching

耦合拉普拉斯特征映射用于局部感知的3D刚性点云匹配

Matteo Bastico, Etienne Decencière, Laurent Corté, Yannick Tillier, David Ryckelynck

机构 * Mines Paris, Université PSL(巴黎 Mines 学院,巴黎大学) Centre des Matériaux (MAT), UMR7633 CNRS(材料中心(MAT),CNRS UMR7633) Centre de Morphologie Mathématique (CMM)(数学形态学中心(CMM)) Centre de Mise en Forme des Matériaux (CEMEF), UMR7635 CNRS(材料成型中心(CEMEF),CNRS UMR7635)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出基于耦合拉普拉斯特征映射的3D点云匹配方法,通过考虑局部结构提升匹配精度,应用于物体异常检测和骨侧估计任务。

Comments This paper has been accepted at Computer Vision and Patter Recognition (CVPR) 2024

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 3447-3458

详情

展开后加载摘要…

URL PDF HTML 收藏