arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8699 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8699 篇

2606.05873 2026-06-05 cs.RO cs.AI cs.CV cs.LG 70%

LadderMan: Learning Humanoid Perceptive Ladder Climbing

LadderMan: 学习人形机器人感知爬梯

Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

机构 * Amazon FAR(亚马逊FAR) USC(美国南加州大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出LadderMan系统,通过两阶段学习管道和视觉基础模型,使人形机器人能够鲁棒地攀爬多种梯子并在梯子上进行操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05159 2026-06-04 cs.RO 70%

X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation

X4Val: 学习方差缩减策略评估的神经代理模型

Rachel Luo, Michael Watson, Apoorva Sharma, Heng Yang, Han Qi, Edward Schmerling, Sushant Veer, Boris Ivanovic, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究院) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出X4Val框架,通过嵌入多域数据并学习可迁移预测器,结合控制变量估计器实现无配对样本下的方差缩减,在自动驾驶和机器人操作任务中方差降低达38.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04829 2026-06-04 cs.RO 70%

M3imic: Learning a Versatile Whole-Body Controller for Multimodal Motion Mimicking

M3imic: 学习用于多模态运动模仿的通用全身控制器

Zuxing Lu, Ziang Zheng, Yao Lyu, Jingyu Liu, Feihong Zhang, Song Lu, Xin Yuan, Changyin Sun, Xingxing Zuo, Shengbo Eben Li

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence(马尔代夫比兹亚德大学人工智能学院机器人系)

专题命中 机器人数据与评测 :manipulation(abstract,abstract_cn);分类 cs.RO

AI总结 提出M3imic框架,通过模态特定编码器将异构运动参考模态(机器人关节角度、人体姿态轨迹、末端执行器位姿)映射到共享潜在空间,并利用大规模强化学习训练单一策略,实现无需模态特定重训练的sim-to-real迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04773 2026-06-04 cs.CV cs.CL 70%

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

NextMotionQA: 使用视觉语言模型基准测试和评判人体运动理解

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Saarland Informatics Campus(萨尔兰州信息学院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 提出NextMotionQA基准,通过三项互补任务和多粒度难度分层,系统评估视觉语言模型在人体运动理解中的能力,并揭示其在细粒度评判中的局限性。

Comments 23 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02246 2026-06-02 cs.CV 70%

Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark

Ego-METAS:面向自我中心的在线多模态节能时间动作分割基准

Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus, Giovanni Maria Farinella, Antonino Furnari

机构 * University of Zaragoza - I3A(萨拉戈塔大学 - I3A) Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系)

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.CV

AI总结 为解决资源受限设备上的能耗感知问题,提出了首个自我中心在线多模态节能时间动作分割基准Ego-METAS,包含超过100小时未裁剪视频和5种模态,要求模型动态选择传感器并遵守能量预算,评估显示最优路由高度依赖场景,现有方法难以适应连续环境。

Comments Project Page: https://maria-sanvil.github.io/Ego-METAS-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29973 2026-06-02 cs.RO 70%

Replicable Simulation-Based Robot Validation through Provenance

通过数据溯源实现可复现的基于仿真的机器人验证

Argentina Ortega, Samuel Wiest, Frederik Pasch, Nico Hochgeschwender

机构 * Argentine Institute of Technology(阿根廷技术研究所)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 针对基于仿真的机器人验证可复现性不足的问题,提出将数据溯源与FAIR原则集成到测试流程中,通过追踪工件链接和附加机器可读元数据来增强可复现性,并在移动机器人导航数据集上验证了该方法。

Comments Accepted for publication at 2026 IEEE RAS International Conference on Engineering Reliable Autonomous Systems (ERAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14010 2026-06-02 cs.RO 70%

URDF-Anything+: End-to-End Generation for Simulation-Ready Articulated Assets

URDF-Anything+:面向仿真就绪铰接资产的端到端生成

Zhuangzhe Wu, Yue Xin, Chengkai Hou, Minghao Chen, Yaoxu Lyu, Jieyu Zhang, Shanghang Zhang

机构 * Peking University(北京大学) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出URDF-Anything+,一种端到端自回归扩散框架,从单张RGB图像直接生成仿真就绪的URDF模型,统一建模部件几何与铰接结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28110 2026-05-28 cs.RO 70%

STR Robot: Design of an Autonomous Mobile Robot from Simulation to Reality

STR机器人:从仿真到现实的自主移动机器人设计

Vinh Nguyen, Gia-Uy Le, Tien-Dat Nguyen, Tri-Tin Nguyen, Vinh-Hao Nguyen

机构 * Faculty of Electrical and Electronic Engineering, Ho Chi Minh City University of Technology, VNU-HCM(电子工程学院,胡志明市技术大学,VNU-HCM)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于现有机械平台的自主移动机器人仿真到现实实现方法,重点开发机载控制、自定位和自主导航系统,并通过仿真和实验验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14075 2026-05-28 cs.RO cs.SY eess.SY 70%

RCM Constraint-Consistent Dynamic Control in Surgical Robots

手术机器人中的RCM约束一致性动态控制

Yu Li, Hamid Sadeghian, Zewen Yang, Valentin Le Mesle, Sami Haddadin

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich, Germany(慕尼黑机器人与机器智能研究所,慕尼黑技术大学,德国) Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 将远程运动中心(RCM)建模为流变完整约束,并集成到基于投影的逆动力学控制器中,实现扭矩层面的约束一致控制,降低RCM残差并平滑扭矩曲线。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09458 2026-05-26 cs.RO 70%

Stein Variational Ergodic Surface Coverage with SE(3) Constraints

Stein变分遍历曲面覆盖与SE(3)约束

Jiayun Li, Yufeng Jin, Sangli Teng, Dejian Gong, Georgia Chalvatzaki

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Honda Research Institute Europe GmbH(本田欧洲研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 70%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20774 2026-05-21 cs.RO 70%

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

VLA-REPLICA: 一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准

Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

机构 * Intelligent Robotics and Vision Lab, University of Texas at Dallas(德克萨斯大学达拉斯分校智能机器人与视觉实验室) Allen High School(艾伦高中)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出VLA-REPLICA,一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准,通过使用现成组件构建,提供一致的环境用于政策评估,并包含多样化的操作任务和小规模演示数据集,用于目标域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07303 2026-05-20 cs.RO 70%

Robots that learn to evaluate models of collective behavior

能够评估集体行为模型的机器人

Mathis Hocke, Andreas Gerken, David Bierbach, Jens Krause, Tim Landgraf

机构 * Department of computer science, Freie Universität Berlin(自由大学柏林计算机科学系) SCIoI Excellence Cluster, Technische Universität Berlin(柏林技术大学SCIoI卓越中心) Faculty of Life Sciences, Humboldt-Universität zu Berlin(柏林洪堡大学生命科学学院) Department of Fish Biology, Fisheries, and Aquaculture, Leibniz Institute of Freshwater Ecology and Inland Fisheries(莱比锡淡水生态与内陆渔业研究所鱼类生物学、渔业与水产养殖系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于强化学习的框架,利用仿生机器人鱼评估活鱼行为的计算模型,通过闭环交互量化真实鱼与模拟鱼行为的差异,展示了学习驱动的机器人实验如何发现行为模型的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16309 2026-05-20 eess.IV cs.CV physics.med-ph 70%

Rapid patient-specific neural networks for intraoperative X-ray to volume registration

快速的患者特异性神经网络用于术中X射线到体积的配准

Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach, Sarah Frisken, Neel Dey, Polina Golland

机构 * Harvard-MIT Health Sciences and Technology, Massachusetts Institute of Technology(哈佛-麻省理工健康科学与技术, 麻省理工学院) Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(计算机科学与人工智能实验室, 麻省理工学院) Department of Radiology, Harvard Medical School(哈佛医学院放射科) Saint Luke’s Marion Bloch Neuroscience Institute(圣路易斯马里恩布洛克神经科学研究所) Department of Critical Care Medicine, Shriners Children’s Hospital(谢尔曼儿童医院重症医学科) Department of Interventional Neuroradiology, Boston Children’s Hospital(波士顿儿童医院介入神经放射科) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提努拉A·马丁诺斯生物医学成像中心, 麻省总医院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出了一种自监督框架xvr,结合患者特异性神经网络和梯度优化,实现了快速且准确的2D到3D配准,通过物理模拟生成训练数据,无需手动标注,提升了临床和研究社区的广泛应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19136 2026-05-20 cs.RO 70%

Automatically Improving Simulation Physics for Articulated Objects

自动提升仿真的物理特性用于关节物体

Anh-Quan Pham

机构 * Penn(宾夕法尼亚大学) PennPAL Lab(宾夕法尼亚大学PAL实验室)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文研究了如何通过量化评估框架和多模态仿真反馈方法,提升关节物体在仿真中的物理真实性和稳定性,从而提高机器人学习的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14462 2026-05-15 cs.CV 70%

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

Real2Sim在HOI中的应用:从单目视频中向物理合理性迈进的HOI重建

Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent IEG(腾讯IEG)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 本文提出HA-HOI框架,通过单目视频重建物理合理的4D HOI动画,改进了人-物对齐、接触一致性、时间稳定性及模拟准备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 70%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21625 2026-05-13 cs.RO 70%

Tacmap: Bridging the Tactile Sim-to-Real Gap via Geometry-Consistent Penetration Depth Map

Tacmap: 通过几何一致的穿透深度图弥合触觉仿真到现实的差距

Lei Su, Zhijie Peng, Renyuan Ren, Shengping Mao, Juan Du, Kaifeng Zhang, Xuezhou Zhu

机构 * Sharpa HKUST(香港科技大学) NVIDIA(英伟达)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Tacmap通过统一的变形地图表示弥合触觉仿真与现实的差距,利用体积穿透深度实现高保真且高效的触觉仿真,验证了在抓取任务中仿真政策的零样本迁移能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 70%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 70%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 70%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 机器人数据与评测 :embodied AI(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07943 2026-05-11 cs.RO cs.AI cs.CV cs.LG 70%

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

TAVIS:一种用于第一人称主动视觉和预见性注视的模仿学习基准

Giacomo Spigler

机构 * Department of Intelligent Systems(智能系统系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 TAVIS提出了一种评估主动视觉模仿学习的基础设施,包含两个任务集和两个仿人躯干机器人,通过实验发现主动视觉对任务类型和条件具有任务依赖性,且多任务策略在分布偏移下表现下降,模仿学习能产生与人类参考相当的预见性注视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO 70%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人数据与评测 :robotics(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00146 2026-05-04 cs.CV 70%

Real-Time Frame- and Event-based Object Detection with Spiking Neural Networks on Edge Neuromorphic Hardware: Design, Deployment and Benchmark

基于边缘神经形态硬件的实时帧级和事件级目标检测:设计、部署与基准测试

Udayanga G. W. K. N. Gamage, Yan Zeng, Cesar Cadena, Matteo Fumagalli, Silvia Tolu

机构 * Department of Electrical and Photonics Engineering, Technical University of Denmark(电气与光子工程系,丹麦技术大学) Autonomous Systems Lab, ETH zürich(自主系统实验室,苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出了一种针对神经形态平台的通用SNN检测架构设计方法,并在Intel Loihi 2上进行部署与基准测试,展示了SNN在低功耗实时目标检测中的优势。

Comments 11 figures, 7 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27578 2026-05-01 cs.CV 70%

World2Minecraft: Occupancy-Driven Simulated Scenes Construction

World2Minecraft: 基于占用率的模拟场景构建

Lechao Zhang, Haoran Xu, Jingyu Gong, Xuhong Wang, Yuan Xie, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出World2Minecraft,通过3D语义占用率预测将现实场景转换为结构化的Minecraft环境,提升模拟场景的质量与灵活性,通过定制化数据集MinecraftOcc验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27106 2026-05-01 cs.CV cs.AI cs.LG cs.RO 70%

Reconstruction by Generation: 3D Multi-Object Scene Reconstruction from Sparse Observations

通过生成进行重建:从稀疏观测中进行3D多物体场景重建

Andrii Zadaianchuk, Leonardo Barcellona, Lennard Schuenemann, Christian Gumbsch, Zehao Wang, Muhammad Zubair Irshad, Fabien Despinoy, Rahaf Aljundi, Stratis Gavves, Sergey Zakharov

机构 * University of Amsterdam(阿姆斯特丹大学) Toyota Research Institute(丰田研究中心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出RecGen框架,通过生成方法估计物体和部分形状及其姿态,有效处理遮挡和部分可见性,实现复杂场景的高精度重建。

Comments Website: https://reconstruction-by-generation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25670 2026-04-29 cs.RO 70%

GEGLU-Transformer for IMU-to-EMG Estimation with Few-Shot Adaptation

基于GEGLU-Transformer的IMU到EMG估计与少样本适应框架

Miroljub Mihailovic, Luca Tonin, Stefano Tortora, Emanuele Menegatti

机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于GEGLU-Transformer的IMU到EMG估计框架,通过跨受试者泛化和快速个性化实现可靠估计,实验显示在少量适应数据下性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24729 2026-04-28 cs.LG 70%

SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning

SpecRLBench: 一种用于规范引导强化学习中泛化能力的基准测试

Zijian Guo, İlker Işık, H. M. Sabbir Ahmad, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出SpecRLBench基准测试,用于评估基于线性时序逻辑的规范引导强化学习方法的泛化能力,涵盖导航和操作领域多个难度层级,包含静态和动态环境、多样机器人动力学和观测模态,通过实验揭示现有方法的优缺点及复杂性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21545 2026-04-21 cs.RO 70%

UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning

UniDomain:从真实世界演示中预训练一个统一的PDDL领域以实现可泛化的机器人任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 UniDomain通过预训练统一的PDDL领域,结合机器人操作演示,实现可泛化的任务规划,实验显示其在零样本情况下任务成功率和计划优化度显著提升。

Comments Accepted at NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29254 2026-04-16 cs.RO 70%

SuperGrasp: Single-View Object Grasping via Superquadric Similarity Matching, Evaluation, and Refinement

SuperGrasp:基于超二次曲面相似性匹配的单视角物体抓取

Lijingze Xiao, Jinhong Du, Supeng Diao, Yu Ren, Yang Cong

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出SuperGrasp框架,通过超二次曲面相似性匹配和E-RNet网络,实现单视角平行爪抓取的高效候选生成与稳定评估,实验验证其在新物体和杂乱场景中的泛化能力。

Comments Minor revisions to the manuscript content, author order, and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏