arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-19 至 2026-01-19 共收录 10 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 10 篇

2601.11266 2026-01-19 cs.RO 88%

Skill-Aware Diffusion for Generalizable Robotic Manipulation

面向可泛化的机器人操作技能感知扩散

Aoshen Huang, Jiaming Chen, Jiyu Cheng, Ran Song, Wei Pan, Wei Zhang

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 SADiff通过整合技能层面信息提升机器人操作的泛化能力,引入IsaacSkill数据集进行评估与迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11394 2026-01-19 cs.RO cs.SY eess.SY 83%

The Mini Wheelbot Dataset: High-Fidelity Data for Robot Learning

Mini Wheelbot 数据集:用于机器人学习的高质量数据

Henrik Hose, Paul Brunzema, Devdutt Subhasish, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering (DSME), RWTH Aachen University(机械工程数据科学研究所(DSME),亚琛工业大学)

专题命中 机器人数据与评测 :robot learning(title);robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种高质量数据集,用于训练和评估机器人学习算法,涵盖动态模型学习、状态估计和时间序列分类等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20294 2026-01-19 cs.LG cs.AI 81%

Dynamics-Aligned Latent Imagination in Contextual World Models for Zero-Shot Generalization

情境世界模型中的动态对齐潜在想象用于零样本泛化

Frank Röder, Jan Benad, Manfred Eppe, Pradeep Kr. Banerjee

机构 * Institute for Data Science Foundations(数据科学基础研究所)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 DALI通过动态对齐潜在想象在情境世界模型中实现零样本泛化,通过自监督编码器预测前向动力学,连接感知与控制,提升情境适应能力。

Comments 36 pages, 6 figures, accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11269 2026-01-19 cs.CV cs.AI 73%

X-Distill: Cross-Architecture Vision Distillation for Visuomotor Learning

X-Distill:跨架构视觉蒸馏用于视觉-运动学习

Maanping Shao, Feihong Zhang, Gu Zhang, Baiye Cheng, Zhengrong Xue, Huazhe Xu

机构 * Tsinghua University(清华大学) Institute for Interdisciplinary Information Sciences(交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 X-Distill通过跨架构知识蒸馏结合视觉转换器和紧凑型CNN,实现了在数据有限的机器人操作任务中优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18631 2026-01-19 cs.RO cs.AI 62%

Generalizable Domain Adaptation for Sim-and-Real Policy Co-Training

可泛化领域适应的仿真与现实策略协同训练

Shuo Cheng, Liqian Ma, Zhenyang Chen, Ajay Mandlekar, Caelan Garrett, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA Corporation(英伟达公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种仿真与现实协同训练框架,通过学习领域不变的特征空间,利用仿真数据提升现实世界操作策略的泛化能力,实现实验成功率提升30%。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11078 2026-01-19 cs.RO cs.AI 62%

Visual Marker Search for Autonomous Drone Landing in Diverse Urban Environments

面向异质城市环境的自主无人机着陆视觉标记搜索

Jiaohong Yao, Linfeng Liang, Yao Deng, Xi Zheng, Richard Han, Yuankai Qi

机构 * School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于模拟的评估套件,研究异质城市环境中自主无人机着陆的视觉标记搜索问题,通过对比启发式策略与强化学习方法,探讨复杂场景对着陆性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10835 2026-01-19 cs.CV cs.AI 62%

Can Vision-Language Models Understand Construction Workers? An Exploratory Study

视觉-语言模型能理解建筑工人吗?一项探索性研究

Hieu Bui, Nathaniel E. Chodosh, Arash Tavakoli

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Villanova University(维拉诺瓦大学) Department of Computing Sciences(计算科学系) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本研究评估了三种视觉-语言模型在识别建筑工人行为和情绪方面的性能,发现GPT-4o表现最佳,但需进一步改进以提高实际应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11574 2026-01-19 cs.CV 57%

Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis

通过多视角对应分析评估基础模型的3D理解

Valentina Lilova, Toyesh Chakravorty, Julian I. Bibo, Emma Boccaletti, Brandon Li, Lívia Baxová, Cees G. M. Snoek, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。

Comments NeurIPS 2025 UniReps workshop, to be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19859 2026-01-19 eess.SY cs.FL cs.SC cs.SY 50%

Scalable and Approximation-free Symbolic Control for Unknown Euler-Lagrange Systems

可扩展且无近似符号控制用于未知欧拉-拉格朗日系统

Ratnangshu Das, Shubham Sawarkar, Pushpak Jagtap

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出了一种可扩展且无近似符号控制方法,用于确保未知欧拉-拉格朗日系统满足时序逻辑规范,同时减少计算和内存需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14666 2026-01-19 eess.SY cs.SY 50%

Equivariant Filter (EqF)

等变滤波器(EqF)

Pieter van Goor, Tarek Hamel, Robert Mahony

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 等变滤波器通过利用系统输出的等变性减少线性化误差,提高滤波性能。

Comments 20 pages, 3 figures, published in IEEE TAC

Journal ref in IEEE Transactions on Automatic Control, vol. 68, no. 6, pp. 3501-3512, June 2023

详情

展开后加载摘要…

URL PDF HTML 收藏