arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 22164 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

1909.10159 2020-03-10 cs.RO 76%

Self-supervised 6D Object Pose Estimation for Robot Manipulation

Xinke Deng, Yu Xiang, Arsalan Mousavian, Clemens Eppner, Timothy Bretl, Dieter Fox

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Accepted to International Conference on Robotics and Automation (ICRA), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06302 2020-02-18 cs.RO 76%

Applying Depth-Sensing to Automated Surgical Manipulation with a da Vinci Robot

Minho Hwang, Daniel Seita, Brijen Thananjeyan, Jeffrey Ichnowski, Samuel Paradis, Danyal Fer, Thomas Low, Ken Goldberg

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Camera-ready version for the International Symposium on Medical Robotics (ISMR) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09563 2019-09-06 cs.RO 76%

A Distributed Predictive Control Approach for Cooperative Manipulation of Multiple Underwater Vehicle Manipulator Systems

Shahab Heshmati-Alamdari, George C. Karras, Kostas J. Kyriakopoulos

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Accepted in IEEE International Conference on Robotics and Automation (ICRA), Montreal, Canada, 2019. arXiv admin note: text overlap with arXiv:1905.04531

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.05172 2018-05-16 cs.RO 76%

Closing the Loop for Robotic Grasping: A Real-time, Generative Grasp Synthesis Approach

Douglas Morrison, Peter Corke, Jürgen Leitner

专题命中 机器人操作 :robotic(title);分类 cs.RO;robotics(comments)

Comments Robotics: Science and Systems (RSS), 2018. Code: http://github.com/dougsm/ggcnn Video: http://www.youtube.com/watch?v=7nOoxuGEcxA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17628 2026-08-19 cs.RO cs.AI cs.LG eess.IV 新提交 75%

Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision

迭代抓取位姿优化:一种面向二维视觉的深度强化学习方法

Amir Arsalan Nematollahi, Shayan Ahmadi, Mehdi Tale Masouleh, Ahmad Kalhor

机构 * University of Tehran(德黑兰大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究提出结合关键点表征与DQN的强化学习框架,通过迭代优化抓取位姿,在Dex-Net数据集300个物体上对几何判定不可抓取物体实现100%成功率,且可实现仿真到真实的迁移,为接触丰富的操作任务提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09948 2026-08-19 cs.AI cs.CV cs.RO 版本更新 75%

LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

LoopVLA: 在视觉-语言-动作模型中学习充分性

Boyang Shen, Kaixiang Yang, Hao Wang, Qiuyu Yu, Qiang Xie, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10232 2026-08-12 cs.RO cs.AI cs.LG 新提交 75%

FACT: Failure-Aware Causal Training for World-Action Models

FACT:面向世界-动作模型的故障感知因果训练方法

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 75%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19638 2026-06-23 cs.RO cs.CV cs.LG 75%

Sensor-Invariant Tactile Representation

不变的触觉表示

Harsh Gupta, Yuchen Mo, Shengmiao Jin, Wenzhen Yuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出一种新的方法,用于提取传感器不变的触觉表示,以实现跨光学触觉传感器的零样本迁移。通过基于变压器的架构训练多样化的模拟传感器数据集,实现对新传感器的最小校准泛化。实验结果展示了该方法在多种触觉传感应用中的有效性。

Comments Accepted to ICLR'25. Project webpage: https://hgupt3.github.io/sitr/

Journal ref International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19451 2026-06-19 cs.LG cs.CV cs.RO 新提交 75%

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

3D-DLP:自监督3D物体中心场景表示学习

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出3D-DLP模型,通过自监督学习将场景级RGB-D或体素观测分解为3D潜在粒子,每个粒子编码解耦属性,实现可解释的逐粒子分割图,并支持场景操控和下游机器人操作。

Comments ICML 2026. Project webpage: https://eubooks3003.github.io/3d-dlp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14981 2026-06-16 cs.RO cs.AI cs.LG 新提交 75%

Inference-time Policy Steering via Vision and Touch

通过视觉和触觉进行推理时策略引导

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 75%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 75%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 75%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09451 2026-06-09 cs.RO cs.CV cs.LG 新提交 75%

Dense Force Estimation with an Event-based Optical Tactile Sensor

基于事件的光学触觉传感器的稠密力估计

Agis Politis, René Zurbrügg, Valentina Cavinato

机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ETH Zürich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04188 2026-06-04 cs.LG cs.AI cs.RO 75%

Dual Advantage Fields

双优势场

Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin, Dmitry V. Dylov, Fakhri Karray, Vladislav Kurenkov, Martin Takáč, Arip Asadulaev

机构 * NUST MISIS(努斯大学材料科学与工程学院) MSU(莫斯科大学) Computational Imaging Lab(计算成像实验室) MBZUAI(马斯喀特人工智能研究院) dunnolab(杜诺实验室) Innopolis University(因诺波利斯大学)

专题命中 机器人操作 :manipulation(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出双优势场(DAF)方法,利用双线性对偶值模型生成局部优势信号,通过动作-效应模型预测折扣特征位移并与目标方向对齐来评分动作,实现离线目标条件强化学习中的策略提取。

Comments Accepted by ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09877 2026-06-02 cs.CV cs.AI cs.RO 75%

Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction

Genie 4D:语义先验引导的4D动态场景重建

Yiru Yang, Zhuojie Wu, Nishant Kumar Singh, Max Schulthess

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19433 2026-06-01 cs.RO cs.AI cs.CV 75%

Mixture of Horizons in Action Chunking

动作分块中的视野混合

Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对视觉-语言-动作模型中动作分块长度(视野)的权衡问题,提出混合视野策略,通过并行处理不同视野的动作片段并融合输出,同时提升长期预见与短期精度,实现性能与泛化性的改进。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13959 2026-05-15 cs.LG cs.AI cs.RO 75%

WarmPrior: Straightening Flow-Matching Policies with Temporal Priors

WarmPrior: 通过时间先验使流匹配策略更加平直

Sinjae Kang, Chanyoung Kim, Kaixin Wang, Li Zhao, Kimin Lee

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV 75%

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14388 2026-03-17 eess.SY cs.SY 75%

Context-Aware Adaptive Shared Control for Magnetically-Driven Bimanual Dexterous Micromanipulation

具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 75%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13395 2026-03-17 cs.CV cs.LG cs.RO 75%

COT-FM: Cluster-wise Optimal Transport Flow Matching

COT-FM:分簇最优传输流匹配

Chiensheng Chiang, Kuan-Hsun Tu, Jia-Wei Liao, Cheng-Fu Chou, Tsung-Wei Ke

机构 * National Taiwan University(台湾大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 COT-FM通过分簇策略优化流匹配框架,提升生成速度与可靠性,适用于图像生成和机器人任务。

Comments 18pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 75%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13865 2026-02-17 cs.AI cs.LG cs.RO 75%

Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay

通过 hindsight 经验回放实现稀疏奖励下的选项学习

Gabriel Romio, Mateus Begnini Melchiades, Bruno Castro da Silva, Gabriel de Oliveira Ramos

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出2HER方法,通过双目标重新标记策略提升稀疏奖励多目标任务中的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11643 2026-02-13 cs.RO cs.AI cs.CV 75%

ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning

ViTaS: 用于视觉-运动学习的视觉触觉软融合对比学习

Yufeng Tian, Shuiqi Cheng, Tianming Wei, Tianxing Zhou, Yuanhang Zhang, Zixian Liu, Qianwei Han, Zhecheng Yuan, Huazhe Xu

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 ViTaS通过融合视觉和触觉信息,利用软融合对比学习提升视觉-运动学习的性能。

Comments Published to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08043 2026-02-12 cs.GR cs.CV cs.LG cs.RO 75%

Neural-Augmented Kelvinlet for Real-Time Soft Tissue Deformation Modeling

神经增强的凯尔文让用于实时软组织变形建模

Ashkan Shahbazi, Kyvia Pereira, Jon S. Heiselman, Elaheh Akbari, Annie C. Benson, Sepehr Seifi, Xinyuan Liu, Garrison L. Johnston, Jie Ying Wu, Nabil Simaan, Michael I. Miga, Soheil Kolouri

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出一种结合凯尔文让分析先验与大规模FEM数据的神经模拟框架,用于实时软组织变形建模,提升预测精度与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21037 2026-01-30 cs.LG cs.AI cs.CL cs.CV 75%

Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning

基于框架的思考:视觉上下文和测试时扩展如何增强视频推理

Chengzu Li, Zanyi Wang, Jiaang Li, Yi Xu, Han Zhou, Huanyu Zhang, Ruichuan An, Dengyang Jiang, Zhaochong An, Ivan Vulić, Serge Belongie, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) Hong Kong University of Science(香港科学大学) University of California San Diego(加州大学圣地亚哥分校) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。

Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16842 2025-12-19 cs.CV cs.AI cs.RO 75%

OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction

OPENTOUCH:将全手触觉带入现实世界交互

Yuxin Ray Song, Jinzhou Li, Rao Fu, Devin Murphy, Kaichen Zhou, Rishi Shiv, Yaqi Li, Haoyu Xiong, Crystal Elaine Owens, Yilun Du, Yiyue Luo, Xianyi Cheng, Antonio Torralba, Wojciech Matusik, Paul Pu Liang

机构 * MIT(麻省理工学院) Duke University(杜克大学) Brown University(布朗大学) University of Washington(华盛顿大学) Harvard University(哈佛大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 OpenTouch是首个现实场景的第一人称全手触觉数据集,通过同步视频-触觉-姿态数据和详细注释,推动多模态感知和机器人操作研究。

Comments https://opentouch-tactile.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 75%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏