arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-24 至 2026-02-24 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 20 篇

2412.13877 2026-02-24 cs.RO cs.AI 85%

RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation

RoboMIND:机器人操作多躯体智能规范数据集基准

Kun Wu, Chengkai Hou, Jiaming Liu, Zhengping Che, Xiaozhu Ju, Zhuqin Yang, Meng Li, Yinuo Zhao, Zhiyuan Xu, Guang Yang, Shichao Fan, Xinhua Wang, Fei Liao, Zhen Zhao, Guangyu Li, Zhao Jin, Lecheng Wang, Jilei Mao, Ning Liu, Pei Ren, Qiang Zhang, Yaoxu Lyu, Mengzhen Liu, Jingyang He, Yulin Luo, Zeyu Gao, Chenxuan Li, Chenyang Gu, Yankai Fu, Di Wu, Xingyu Wang, Sixiang Chen, Zhenyu Wang, Pengju An, Siyuan Qian, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI

AI总结 RoboMIND是一个大规模多躯体机器人操作数据集,包含107万条演示轨迹和5000条失败示例,用于提升机器人模仿学习和多任务性能。

Comments 21 pages, 17 figures, Robotics: Science and Systems 2025

Journal ref Robotics: Science and Systems XXI (RSS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10116 2026-02-24 cs.CV cs.RO 84%

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

SAGE: 适用于具身人工智能的可扩展代理3D场景生成

Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang, Shuran Song, Fangyin Wei

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :embodied AI(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 SAGE通过代理框架生成可扩展的3D环境,用于具身人工智能的策略训练和泛化能力提升。

Comments Project Page: https://research.nvidia.com/labs/dir/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23575 2026-02-24 cs.RO 83%

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

可泛化的粗到细机器人操作 via 语言对齐的3D关键点

Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 CLAP通过任务分解、VLM微调和3D感知表示,提升机器人操作在新指令和环境下的泛化能力,实现更高的样本效率和操作精度。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27623 2026-02-24 cs.AI cs.CL cs.CV 81%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI、cs.CV

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19850 2026-02-24 cs.RO 80%

TactiVerse: Generalizing Multi-Point Tactile Sensing in Soft Robotics Using Single-Point Data

TactiVerse: 在软机器人中利用单点数据通用多点触觉感知

Junhui Lee, Hyosung Kim, Saekwang Nam

机构 * Graduate School of Data Science at Kyungpook National University(韩国庆北国立大学数据科学研究院)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 TactiVerse通过单点数据实现多点触觉感知,提升软机器人中复杂接触几何的预测能力。

Comments 6 pages, 7 figures, accepted at 9th IEEE-RAS International Conference on Soft Robotics (RoboSoft)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10040 2026-02-24 cs.RO 77%

Diffusion Trajectory-guided Policy for Long-horizon Robot Manipulation

用于长时程机器人操作的扩散轨迹引导策略

Shichao Fan, Quantao Yang, Yajie Liu, Kun Wu, Zhengping Che, Qingjie Liu, Min Wan

机构 * School of Mechanical Engineering and Automation, BeiHang University(机械工程与自动化学院,北航) School of Computer Science and Engineering, BeiHang University(计算机科学与工程学院,北航) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Division of Robotics, Perception and Learning (RPL), KTH Royal Institute of Technology(机器人、感知与学习 division,皇家理工学院)

专题命中 机器人数据与评测 :manipulation(title);robotics(comments,journal_ref);分类 cs.RO

AI总结 本文提出DTP框架,通过生成轨迹减少模仿学习中的误差累积,提升长时程机器人任务的性能。

Comments 8 pages, 5 figures, accepted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 12, December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19651 2026-02-24 cs.RO cs.AI cs.LG 75%

Denoising Particle Filters: Learning State Estimation with Single-Step Objectives

去噪粒子滤波:基于单步目标的学习状态估计

Lennart Röstel, Berthold Bäuml

机构 * Learning AI for Dextrous Robots Lab, Technical University of Munich(灵活机器人学习人工智能实验室,慕尼黑技术大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于单步目标的去噪粒子滤波方法,通过隐式学习测量模型和动力学模型,实现高效的机器人状态估计,具有可组合性和良好的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07730 2026-02-24 cs.LG cs.RO 73%

Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning

多步准度量学习用于可扩展的目标导向强化学习

Bill Chunyuan Zheng, Vivek Myers, Benjamin Eysenbach, Sergey Levine

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于多步准度量学习的离线目标导向强化学习方法,通过多步蒙特卡洛回报提升长视野任务的性能,并在现实世界机器人操作中实现了多步拼接。

Journal ref ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17195 2026-02-24 cs.RO 70%

Depth-PC: A Visual Servo Framework Integrated with Cross-Modality Fusion for Sim2Real Transfer

Depth-PC: 一种集成跨模态融合的视觉伺服框架用于仿真到现实迁移

Haoyu Zhang, Yang Liu, Yimu Jiang, Weiyang Lin, Chao Ye

机构 * Research Institute of Intelligent Control and Systems, Harbin Institute of Technology(智能控制与系统研究所,哈尔滨工业大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Depth-PC通过跨模态融合和图神经网络实现零样本仿真到现实迁移的视觉伺服框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19652 2026-02-24 eess.SP 67%

Hardware-Accelerated Geometrical Simulation of Biological and Engineered In-Air Ultrasonic Systems

硬件加速的生物与工程空气中超声系统几何模拟

Wouter Jansen, Jan Steckel

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)

AI总结 SonoTraceUE是一种基于Unreal Engine的高保真声学仿真框架,通过硬件加速的射线追踪和蒙特卡洛衍射模型,实现动态多材料环境中的实时声学传感模拟,用于生物声学研究和机器人闭环系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19348 2026-02-24 cs.CV cs.AI 62%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 62%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 62%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18813 2026-02-24 cs.RO cs.LG 62%

Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

Habilis-β:一种快速运动且持续运行的设备端视觉-语言-动作模型

Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

机构 * Tommoro Robotics(Tommoro机器人公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 Habilis-β是一种快速运动且持续运行的设备端视觉-语言-动作模型,通过整合预训练和后训练方法,实现了在连续运行协议下的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18585 2026-02-24 cs.CV cs.AI 62%

BloomNet: Exploring Single vs. Multiple Object Annotation for Flower Recognition Using YOLO Variants

BloomNet:探索单 vs 多对象标注用于花卉识别的YOLO变体

Safwat Nusrat, Prithwiraj Bhattacharjee

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Leading University(领先大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 BloomNet研究通过比较单 vs 多对象标注策略,利用YOLO变体提升花卉识别精度,验证了SGD优化器在不同场景下的有效性。

Comments Accepted for publication in 7th International Conference on Trends in Computational and Cognitive Engineering (TCCE-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 62%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19943 2026-02-24 cs.RO 57%

Scaling Law of Neural Koopman Operators

神经Koopman算子的缩放规律

Abulikemu Abuduweili, Yuyang Pang, Feihan Li, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于神经Koopman算子的缩放律框架,通过理论推导和实验验证,建立了样本量、潜在空间维度与控制质量之间的关系,引入了两种正则化器以提升动态模型拟合和闭环控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19843 2026-02-24 cs.SE cs.AI 57%

MAS-FIRE: Fault Injection and Reliability Evaluation for LLM-Based Multi-Agent Systems

MAS-FIRE:基于大语言模型的多智能体系统故障注入与可靠性评估

Jin Jia, Zhiling Deng, Zhuangbin Chen, Yingqi Wang, Zibin Zheng

机构 * Sun Yat-sen University(中山大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 MAS-FIRE通过故障注入和分层分析,揭示多智能体系统在容错和鲁棒性方面的关键因素,为提升系统可靠性提供系统性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01379 2026-02-24 physics.flu-dyn cs.LG 57%

WAKESET: A Large-Scale, High-Reynolds Number Flow Dataset for Machine Learning of Turbulent Wake Dynamics

WAKESET: 一个大规模、高雷诺数流动数据集,用于机器学习湍流尾流动力学

Zachary Cooper-Baldock, Paulo E. Santos, Russell S. A. Brinkworth, Karl Sammut

机构 * Flinders University(弗林德斯大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 WAKESET是一个大规模高雷诺数湍流流动数据集,用于机器学习湍流尾流动力学,包含1,091个高保真度模拟,涵盖广泛的操作范围和高速度条件。

Comments 27 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10824 2026-02-24 cs.RO 57%

Evaluating and Improving the Robustness of LiDAR Odometry and Localization Under Real-World Corruptions

评估和改进在真实世界腐蚀下的LiDAR里程计与定位鲁棒性

Bo Yang, Tri Minh Triet Pham, Jinqiu Yang

机构 * Department of Computer Science and Software Engineering, Concordia University(计算机科学与软件工程系,康科迪亚大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出首个评估LiDAR里程计与定位在真实世界腐蚀下鲁棒性的基准,并提出轻量级过滤与学习微调策略以提升其鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏