arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-28 至 2026-01-28 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2601.19406 2026-01-28 cs.RO cs.AI 88%

Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation

仿真与人类协同训练用于数据高效且可泛化的机器人操作

Kaipeng Fang, Weiqing Liang, Yuyang Li, Ji Zhang, Pengpeng Zeng, Lianli Gao, Jingkuan Song, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 SimHum通过结合仿真数据和人类数据,实现了数据高效且可泛化的机器人操作,实验表明其在现实任务中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18923 2026-01-28 cs.RO cs.CV 86%

DeFM: Learning Foundation Representations from Depth for Robotics

DeFM:从深度学习基础表示以供机器人应用

Manthan Patel, Jonas Frey, Mayank Mittal, Fan Yang, Alexander Hansson, Amir Bar, Cesar Cadena, Marco Hutter

机构 * Robotic Systems Lab (RSL), ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA(NVIDIA公司)

专题命中 机器人数据与评测 :robotics(title);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 DeFM通过自监督学习从深度图像中学习基础表示,为机器人应用提供强大的泛化能力和仿真到现实的迁移性能。

Comments Under review, 19 pages, 15 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19234 2026-01-28 cs.RO 79%

iFAN Ecosystem: A Unified AI, Digital Twin, Cyber-Physical Security, and Robotics Environment for Advanced Nuclear Simulation and Operations

iFAN生态系统:一个统一的AI、数字孪生、网络物理安全和机器人环境,用于高级核模拟和操作

Youndo Do, Chad Meece, Marc Zebrowitz, Spencer Banks, Myeongjun Choi, Xiaoxu Diao, Kai Tan, Michael Doran, Jason Reed, Fan Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.RO

AI总结 iFAN生态系统通过整合AI、数字孪生、网络物理安全和机器人技术,为核模拟和操作提供高保真度的虚拟测试平台,支持自主和网络容错的核操作验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18443 2026-01-28 cs.RO 76%

PneuGelSight: Soft Robotic Vision-Based Proprioception and Tactile Sensing

PneuGelSight:基于视觉的柔性机器人本体感觉与触觉感知

Ruohan Zhang, Uksang Yoo, Yichen Li, Arpit Agarwal, Wenzhen Yuan

机构 * University of Illinois, Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University, USA(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)

AI总结 PneuGelSight通过内置相机实现高分辨率本体感觉与触觉感知,结合模拟到现实的管道,为柔软机器人提供新颖的传感方法。

Comments 16 pages, 12 figures, International Journal of Robotics Research (accepted), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04056 2026-01-28 cs.RO cs.LG 73%

Problem Space Transformations for Out-of-Distribution Generalisation in Behavioural Cloning

行为克隆中面向分布外泛化的问题空间变换

Kiran Doshi, Marco Bagatella, Stelian Coros

机构 * Department of Computer Science at ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出通过问题空间变换提升行为克隆在分布外泛化中的性能,通过实验验证了姿态等价性和局部性对动作预测的改进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19484 2026-01-28 cs.CV 70%

Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes

动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作

Yin Wang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * Beihang University(北航大学) University of Durham(达勒姆大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09110 2026-01-28 cs.CV cs.AI 62%

Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding

合成对象组合用于检测、分割和接地任务中的可扩展和准确学习

Weikai Huang, Jieyu Zhang, Taoyang Jia, Chenhao Zheng, Ziqi Gao, Jae Sung Park, Winson Han, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 合成对象组合(SOC)通过新的以对象为中心的组合策略,实现了准确且可扩展的数据合成流程,提升了检测、分割和接地任务的性能,尤其在低数据和封闭词汇场景中表现突出。

Comments Project website: https://github.com/weikaih04/Synthetic-Detection-Segmentation-Grounding-Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19514 2026-01-28 cs.RO 61%

PALM: Enhanced Generalizability for Local Visuomotor Policies via Perception Alignment

PALM:通过感知对齐提升局部视觉-运动策略的泛化能力

Ruiyu Wang, Zheyu Zhuang, Danica Kragic, Florian T. Pokorny

机构 * Division of Robotics, Perception and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 PALM通过感知对齐提升局部视觉-运动策略的泛化能力,有效减少非分布条件下的性能下降。

Journal ref IEEE Robotics and Automation Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19048 2026-01-28 cs.CV 57%

NuiWorld: Exploring a Scalable Framework for End-to-End Controllable World Generation

NuiWorld:探索一个可扩展的端到端可控世界生成框架

Han-Hung Lee, Cheng-Yu Yang, Yu-Lun Liu, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Simon Fraser University, CIFAR AI Chair, Amii(西蒙弗雷泽大学、CIFAR人工智能主席、Amii)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 NuiWorld通过生成性自bootstrap策略和可扩展场景生成技术,解决世界生成中的可控性、可扩展性和效率问题,实现端到端可控世界生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21715 2026-01-28 cs.CV 57%

Impact of Underwater Image Enhancement on Feature Matching

水下图像增强对特征匹配的影响

Jason M. Summers, Mark W. Jones

机构 * Department of Computer Science Swansea University(计算机科学系萨瑟兰大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出了一种评估水下图像增强效果的框架,通过分析增强对特征匹配的影响,验证了其在SLAM算法中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11003 2026-01-28 cs.CV 57%

ForensicHub: A Unified Benchmark & Codebase for All-Domain Fake Image Detection and Localization

ForensicHub: 一个统一的基准与代码库用于所有领域伪造图像检测与定位

Bo Du, Xuekang Zhu, Xiaochen Ma, Chenfan Qu, Kaiwen Feng, Zhe Yang, Chi-Man Pun, Jian Liu, Ji-Zhe Zhou

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 ForensicHub 提出一个统一的基准与代码库,用于所有领域伪造图像检测与定位,通过模块化架构和配置驱动设计,实现跨领域灵活组合和深入分析。

Comments NeurIPS 2025 DB Track Paper. Code available at: https://github.com/scu-zjz/ForensicHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 50%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏