EasyLabel: A Semi-Automatic Pixel-wise Object Annotation Tool for Creating Robotic RGB-D Datasets
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO、cs.CV
Comments 7 pages, 8 figures, ICRA2019, Draft
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO、cs.CV
Comments 7 pages, 8 figures, ICRA2019, Draft
专题命中 机器人数据与评测 :navigation(title);分类 cs.RO、cs.CV
通过仿真到现实的视觉运动学习克服手术机器人中的不完美运动学
机构 * Hamlyn Centre for Robotic Surgery, Institute of Global Health Innovation, Imperial College London(伦敦帝国理工学院全球健康创新研究所哈姆林机器人手术中心) ; Department of Surgery and Cancer, Imperial College London(伦敦帝国理工学院外科与癌症系) ; Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)
专题命中 机器人数据与评测 :robotics(title,comments);分类 cs.RO
AI总结 提出基于教师-学生框架的视觉运动学习策略,融合不可靠内部读数与精确外部视觉数据,实时补偿运动学误差,在达芬奇研究套件上验证可行性。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026
PneuGelSight:基于视觉的柔性机器人本体感觉与触觉感知
机构 * University of Illinois, Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University, USA(卡内基梅隆大学)
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)
AI总结 PneuGelSight通过内置相机实现高分辨率本体感觉与触觉感知,结合模拟到现实的管道,为柔软机器人提供新颖的传感方法。
Comments 16 pages, 12 figures, International Journal of Robotics Research (accepted), 2025
机构 * Faculty of Electrical Engineering, University of Sarajevo(萨拉热窝大学电气工程学院) ; Agile Robots SE
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(journal_ref)
Journal ref IEEE Transactions on Robotics, 2025, ras.tro.25-0686.35660151
专题命中 机器人数据与评测 :manipulation(title);分类 cs.RO;robotics(comments)
Comments Published at Robotics: Science and Systems (RSS) 2025
专题命中 机器人数据与评测 :robotics(title,comments);分类 cs.RO
Comments This abstract has been accepted for the Robotics: Science and Systems (RSS) Pioneers Workshop, 2024
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)
Comments 2023 International Conference on Robotics and Automation (ICRA)
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(comments)
Comments Under review at Robotics and Autonomous Systems (RAS) - Special issue: Semantic Policy and Action Representations for Autonomous Robots (SPAR)
专题命中 机器人数据与评测 :robotic(title);分类 cs.CV;robotics(journal_ref)
Journal ref IEEE Robotics and Automation Letters, vol.6, issue 4, October 2021
专题命中 机器人数据与评测 :robotic(title);分类 cs.RO;robotics(journal_ref)
Comments 8 pages, 8 figures, To appear in the proceedings of IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2019 Macau
Journal ref IEEE Robotics and Automation Letters (RA-L) 2019
在仿真环境中预训练视觉灵巧性
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Scale AI(Scale AI公司)
专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 该研究提出SPD仿真预训练框架,采集75小时多任务灵巧操作数据预训练因果Transformer,经微调后在真实任务中优于从头训练的行为克隆策略,为真实世界灵巧操作提供可行预训练来源。
Comments Project page: https://spd.bot
通过信息瓶颈和向量量化实现带宽高效的多智能体通信
机构 * Department of Electrical and Computer Engineering, University of Arkansas at Little Rock(电气与计算机工程系,阿肯色大学小岩分校)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本研究通过信息瓶颈与向量量化方法,实现多智能体通信的带宽高效优化,提升协调性能并减少带宽消耗。
Comments Accepted at IEEE ICRA 2026, Vienna, Austria. 8 pages, 4 figures, 4 tables. v2: replaces v1 with the accepted camera-ready version and corrects a typo in the bandwidth reduction (41.4% -> 71.4%) in the abstract, Sec. I, Fig. 2 caption, Sec. VI and Sec. VII. Sec. V-A and Table I (800 vs 2800 bits/episode) were already correct; no results or conclusions changed
基于共享体素地图的多智能体软演员-评论家控制器协同室内无人机导航
专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究室内无人机协同导航问题,提出结合共享体素地图与多智能体软演员-评论家控制器的框架,多无人机融合LiDAR观测构建地图并提供给各智能体,模拟中控制器成功率达90.3%,经微调后在现实实验中实现稳定协同操作,证明该地图表示有效且可扩展。
Comments 11 pages, 17 figures
用于空中多模态大语言模型智能体的零样本任务级评估
专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。
Comments Preprint
学习用于可变形物体模拟的物理引导残差动力学
机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) ; Columbia University(哥伦比亚大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。
Comments Website: https://pgrd-robot.github.io/
规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Beijing Normal University(北京师范大学) ; Guangzhou University(广州大学)
专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。
MagicSim: 可执行具身交互的统一基础设施
机构 * Northwestern University(西北大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ShanghaiTech University(上海科技大学)
专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。
EgoPhys: 从第一人称视频学习可变形物体的通用物理模型
机构 * UC San Diego(加州大学圣地亚哥分校)
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。
Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys
EgoTraj: 用于多模态预测的现实世界人轨迹数据集
机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) ; Meta Reality Labs(Meta现实实验室) ; School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。
Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj
MotionBricks: 可扩展的实时动作生成与模块化潜在生成模型及智能原语
机构 * NVIDIA ; Simon Fraser University(西蒙·弗雷泽大学) ; The University of Texas at Austin(得克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出MotionBricks,通过模块化潜在生成模型和智能原语实现实时动作生成,解决工业应用中实时可扩展性和多模态控制的挑战,展示了高质量和实时性能。
Comments ACM Transactions on Graphics; SIGGRAPH 2026. Project page: https://nvlabs.github.io/motionbricks/
SIM1:物理对齐的模拟器作为零样本数据放大器在变形世界中
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 SIM1通过物理对齐的仿真方法,将稀疏观测转化为高保真的合成监督,实现变形物体 manipulation 的高效训练,取得与真实数据相当的性能。
Comments Website: https://internrobotics.github.io/sim1.github.io/
StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发
机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)
专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。
Comments Open-source VLA infra, Technical Report
ManiTwin:将数据生成-ready的数字对象数据集扩展到10万
机构 * The University of Hong Kong(香港大学) ; Xspark AI ; Deemos Tech ; Shanghai Jiao Tong University(上海交通大学) ; ShanghaiTech University(上海交通大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; D-Robotics ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Shenzhen University(深圳大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。
Comments Website: https://manitwin.github.io/
AtomicVLA:解锁机器人中原子技能学习的潜力
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 AtomicVLA通过原子技能抽象和动态专家组合提升机器人长周期任务的性能
Comments Accepted by CVPR2026
EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)
专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。
记忆、基准与机器人:一种用于通过强化学习解决复杂任务的基准
机构 * AXXX ; MIRIAI ; ITMO University(ITMO大学)
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出MIKASA基准,旨在通过强化学习解决复杂任务,包含32个记忆密集型任务,用于评估智能体在桌面机器人操作中的记忆能力。
Comments 57 pages, 29 figures, 11 tables
UrbanVerse: 通过观看城市游览视频扩大城市模拟
专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 UrbanVerse 通过将众包城市游览视频转化为物理-aware 的模拟场景,实现了城市模拟的扩展,提升了城市导航中代理的泛化能力和现实任务完成效率。
Comments Accepted to ICLR 2026. Project page: https://urbanverseproject.github.io/
去噪粒子滤波:基于单步目标的学习状态估计
机构 * Learning AI for Dextrous Robots Lab, Technical University of Munich(灵活机器人学习人工智能实验室,慕尼黑技术大学)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出了一种基于单步目标的去噪粒子滤波方法,通过隐式学习测量模型和动力学模型,实现高效的机器人状态估计,具有可组合性和良好的性能表现。
从开放式对话中推断目标
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。
Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119