arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 497 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 497 篇

2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交 75%

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16202 2026-06-16 cs.CV cs.AI cs.RO 新提交 75%

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys: 从第一人称视频学习可变形物体的通用物理模型

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出EgoPhys框架,从第一人称RGB视频中通过可泛化先验构建可变形物体的物理数字孪生,无需测试时优化即可预测弹簧刚度场,在重建、未来预测和零样本泛化上优于基线。

Comments Project Page: https://hjhyunjinkim.github.io/EgoPhys

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03490 2026-08-05 cs.RO cs.CV 新提交 74%

Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation

基于Mamba知识蒸馏的轻量型3D目标检测

Quoc Cuong Ninh, Huy Xuan Pham, Anh Tung Nguyen, Dinh Hoan Trinh

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 本研究提出基于Mamba的知识蒸馏框架,通过选择性体素空间特征对齐实现轻量型3D目标检测,在保持精度的同时显著降低计算负载。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31329 2026-07-02 cs.RO cs.AI 新提交 74%

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中桥接规划与控制

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

机构 * Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金载哲人工智能研究生院) Graduate School of Artificial Intelligence, POSTECH(浦项工业大学人工智能研究生院) KRAFTON AI

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出3D HAMSTER框架,通过让规划器直接输出度量可靠的3D轨迹,弥合2D引导与3D低层策略之间的差距,在3D轨迹预测、仿真和真实操作中优于现有方法。

Comments Published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. Code: https://github.com/DAVIAN-Robotics/3D_HAMSTER. Project page: https://davian-robotics.github.io/3D_HAMSTER/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09528 2026-08-11 cs.RO 新提交 74%

Robotic Fabric Alignment System for Sewing Using Global Local Weighted ICP

采用全局局部加权迭代最近点(GLW-ICP)的缝纫用机器人布料对位系统

Wenbo Dong, Dipankar Bhattacharya Member, Kai Tang, Akinari Kobayashi, Fuyuki Tokuda, Akira Seino, Norman C. Tien, Kazuhiro Kosuge

机构 * The University of Hong Kong(香港大学) Imperial College London(帝国理工学院) Tohoku University(东北大学) Fukushima University(福岛大学) City University of Hong Kong(香港城市大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 该研究提出采用GLW-ICP方法的机器人布料对位系统,可实现布料全局边缘与局部缝纫线的精准对齐,在有无遮挡下均达毫米级精度,适用于自动缝纫场景。

Comments 16 pages, 10 figures, https://bhattner143.github.io/rfas-glwicp.github.io/

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 23, pp. 13391-13406, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20352 2026-07-23 cs.RO 新提交 74%

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

具有安全保障的自重构机器人船分布式运动规划

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

机构 * KU Leuven(鲁汶大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) SMART(新加坡制造技术研究院) SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。

Comments Submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23152 2026-06-23 cs.RO 新提交 74%

ShotcreteDepth: A Bi-modal Dataset for Robust Robotic Depth Perception in Shotcrete Construction Environments

ShotcreteDepth:用于喷射混凝土施工环境中鲁棒机器人深度感知的双模态数据集

Jakub Gregorek, Lars Arnold Dethlefsen, Patrick Schmidt, Mads Essenbæk, Jonas Flink Bentzen, Lazaros Nalpantidis

机构 * Technical University of Denmark, Department of Electrical and Photonics Engineering(丹麦技术大学电气与光子工程系) Pioneer Centre for AI(人工智能先锋中心) Christiansen & Essenbæk A/S(Christiansen & Essenbæk 公司)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 针对喷射混凝土施工环境中的感知挑战,提出双模态数据集ShotcreteDepth,包含立体RGB图像和LiDAR点云,并附带轻量级标注工具,支持立体匹配、深度补全和深度估计研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16910 2026-06-16 cs.CL cs.AI 新提交 74%

IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset

IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果

Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 机器人数据与评测 :manipulation(title);分类 cs.AI

AI总结 构建IMPACTeen数据集,包含1021个青少年社交影响场景文本,从五个视角标注,支持社交影响检测、标注者分歧及跨语言建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14284 2026-08-17 cs.RO cs.CV 新提交 73%

PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment

PRM-as-a-Judge 1.5:机器人过程评估工具包

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang, Tianfeng Long, Zixuan Yin, Yipu Wang, Ziheng Qin, Wenxing Tan, Yang Shi, Mingyu Cao, Runze Xiao, Ziqi Wang, Zhixin Yin, Shiwei Chu, Yi-Fan Zhang, Yao Mu, Yuheng Ji, Yihao Wang, Jun Yan, Zhongyuan Wang, Pengwei Wang, Xiaolong Zheng

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究推出PRM-as-a-Judge 1.5工具包,新增三个评估指标并结合RoboPulse++,发布含基准与可视化工具的评估套件,呼吁建立透明可复现的机器人评估体系。

Comments Project page: https://prm-as-a-judge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10648 2026-08-12 cs.CV cs.RO 新提交 73%

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

结合边缘感知与形状感知深度网络的织物叠堆顶层织物精确分割

Wenbo Dong, Dipankar Bhattacharya, Akinari Kobayashi, Akira Seino, Fuyuki Tokuda, Xuzhao Huang, Kai Tang, Norman C. Tien, Kazuhiro Kosuge

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对织物叠堆顶层分割的复杂挑战,提出结合边缘感知与形状感知分支的编码器-解码器训练架构,在真实数据集上验证其性能优于现有基准。

Comments 7 pages, 3 figures. Published in IEEE ICMA 2025. Author's accepted manuscript. Code: https://github.com/bhattner143/top-layer-fab-seg

Journal ref 2025 IEEE International Conference on Mechatronics and Automation (ICMA), Beijing, China, Aug. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 73%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26121 2026-07-30 cs.RO cs.AI cs.CY 新提交 73%

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

面向可信赖的具身智能:一个系统框架与分级可信赖性水平

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

机构 * THU(清华大学) PKU(北京大学) HKUST (GZ)(香港科技大学(广州))

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。

Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24023 2026-07-28 cs.AI cs.HC cs.RO eess.SP 新提交 73%

Self-Supervised Consistency Enhanced Disentangled Learning for Neural Decoding Generalization in Brain-Machine Interface

用于脑机接口神经解码泛化的自监督一致性增强解缠学习

Jiyu Wei, Di Hong, Zhanjie Zhang, Dazhong Rong, Qinming He, Yueming Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanhu Brain-Computer Interface Institute(南湖脑机接口研究院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究脑机接口因神经漂移致性能下降问题,提出自监督一致性增强解缠学习框架(SSCDL)。通过设计一致性增强神经解码器及采用互补解缠泛化机制,学习鲁棒表征,实现跨日泛化,提升解码性能,展现长期交互潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16146 2026-07-20 cs.RO cs.CV 新提交 73%

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

VTLoc:基于学习的视觉点云中触觉接触定位

Zhiyuan Wu, Zhuo Chen, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉与触觉融合的接触定位问题,提出VTLoc框架,通过几何多模态对齐模块和迭代定位更新器,利用视觉点云从触觉读数定位接触点,在新基准上减少对应模糊性,改善单触接触定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 73%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 73%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05869 2026-07-08 cs.RO cs.CV 新提交 73%

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation

GraspIT:一个弥合模拟与现实差距并用于验证抓取SE(3)姿态生成的数据集

Paul Koch. Adem Karakurt, André Sers

机构 * Fraunhofer IPK(弗劳恩霍夫研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对新型物体抓取,提出GraspIT数据集。通过在Isaac Sim中对桌面场景进行物理滑动测试标注,经Real↔Sim循环反向投影到真实场景。贡献约31.6万个带注释RGBD帧集及开源工具,可用于桌面操作策略学习等。

Comments Preprint, release soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31073 2026-07-01 cs.AI cs.MA cs.RO 新提交 73%

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning

MultiUAV-Plat:面向多无人机协同任务规划的LLM平台、基准测试与框架

Sheng Zhang, Qinglin Li, Yuechao Zang, Xueqin Huang, Yijia Fu, Cheng Zhu

机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(国防科技大学信息系统工程国家重点实验室)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出MultiUAV-Plat平台与基准测试,以及Agent4Drone框架,通过LLM驱动的工具交互实现多无人机协同任务规划,在任务通过率等指标上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20209 2026-06-19 cs.RO cs.AI 新提交 73%

FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching

FlowMaps: 使用流匹配建模长期多模态物体动态

Francesco Argenziano, Miguel Saavedra-Ruiz, Sacha Morin, Charlie Gauthier, Daniele Nardi, Liam Paull

机构 * Sapienza University of Rome(罗马大学) Université de Montréal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowMaps模型,通过潜在流匹配学习物体位置的多模态时空分布,预测动态物体未来位置,提升机器人在变化家庭环境中的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 73%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 73%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12207 2026-06-11 cs.RO cs.AI 新提交 73%

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

具身基准构建的智能自动化:流程、具身、模拟器与趋势

Jinshan Lai, Jianwei Hu, Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Tingxuan Huang, Xi Ren, Qiang Ma

机构 * University of Electronic Science and Technology of China(电子科技大学) Qiyuan Lab(启元实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文综述具身智能基准构建的五阶段流程,分析从人工到自动化再到智能体闭环的转变,指出自动化将成本转向验证与治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00464 2026-08-04 cs.RO 新提交 72%

Learning to Predict Contact Force Distributions from Vision Leveraging Object Geometry Priors

利用物体几何先验从视觉学习预测接触力分布

Ryo Hanai, Yukiyasu Domaea, Ixchel G. Ramirez-Alpizar, Abdullah Mustafa, Floris Erich, Tetsuya Ogata

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO

AI总结 本文提出融入物体几何先验的模型,从单张RGB图像预测三维接触力分布,经模拟与真实环境评估,该方法提升了力预测精度与下游任务性能,且可从模拟泛化到真实场景。

Comments Published in Advanced Robotics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22289 2026-06-23 cs.CR cs.SY eess.SY 新提交 71%

Control-Aware Manipulation of ArduPilot via Legitimate MAVLink Commands: Simulation and Hardware Validation

通过合法MAVLink命令对ArduPilot进行控制感知操纵:仿真与硬件验证

Feras Benchellal andLotfi Ben Othmane, Yasaswini Konapalli, Cihan Tunc, Bharat Bhargava

专题命中 机器人数据与评测 :manipulation(title)

AI总结 研究针对ArduPilot无人机的控制感知攻击,通过修改PID增益、改变EKF配置和违反故障安全假设,导致无人机失控坠毁,并在SITL仿真和Pixhawk硬件平台上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17962 2026-08-19 cs.RO 新提交 70%

PRISM: Precision and contact-rich Real-world Industrial Skill dataset with Multimodal sensing

PRISM:具备多模态感知的高精度高接触真实工业技能数据集

Tengbo Yu, Jiahao Wu, Hanning Wang, Rui Chen, Chuanhou Liu, Chuang Sun, Hangxin Liu

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Delta Intelligence(三角洲智能公司) PKU-Wuhan Institute for Artificial Intelligence(北京大学武汉人工智能研究院) Hubei Humanoid Robot Innovation Center Co., Ltd.(湖北人形机器人创新中心有限公司) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文介绍PRISM——一个面向高接触工业操作的大规模多模态数据集,涵盖25余项操作任务,包含5000余条共45小时的遥操作演示,为高精度工业场景的多模态感知与控制提供真实基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16715 2026-08-18 cs.RO 新提交 70%

MatchingPolicy: Correspondence-Aware Policy Enables Cross-Object In-Context Learning

MatchingPolicy:具备对应感知能力的策略实现跨物体的上下文学习

Qijin She, Hanyang Yu, Zeming Li, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究提出MatchingPolicy框架,通过解耦演示-场景匹配与策略学习,结合视觉基础模型和两阶段匹配算法,在RLBench及真实操作任务上实现了跨物体的少样本泛化性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 70%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15605 2026-08-18 cs.CV 新提交 70%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at https://github.com/CKL9001/AlloEgo-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 70%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08016 2026-08-11 cs.CV 新提交 70%

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking

EgoTrack3D:一种用于第一人称视角三维目标跟踪的模块化框架

Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang, Boyang Sun, Marc Pollefeys, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft Research(微软研究院) TUM(慕尼黑工业大学) MCML(慕尼黑计算与机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 EgoTrack3D是一种模块化框架,可从第一人称视角RGB视频重建动态三维场景,在ADT数据集上较基线提升11% PCL,还能在退化观测下维持准确空间表示。

详情

展开后加载摘要…

URL PDF HTML 收藏