arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61274 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22110 篇

2606.14561 2026-06-15 cs.RO cs.LG 新提交 79%

ORCA: A Platform for Open-Source Dexterity Research

ORCA: 开源灵巧性研究平台

Francesco Capuano, Maximilian Eberlein, Fabrice Bourquin, Clemens Claudio Christoph

机构 * University of Oxford(牛津大学) ETH Zurich(苏黎世联邦理工学院) Orca Dexterity

专题命中 机器人操作 :robotics(abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出ORCA学习栈,统一灵巧手控制、仿真、遥操作和重定向,集成机器人学习框架,实现端到端灵巧操作研究。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13970 2026-06-15 cs.RO cs.LG 新提交 79%

An Attention-based Model for Robust Forecasting with Missing Modality

基于注意力的缺失模态鲁棒预测模型

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

机构 * Simon Fraser University(西蒙菲莎大学) RBC Borealis

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。

Comments Work originally done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20242 2026-06-10 cs.CY cs.AI cs.RO 版本更新 79%

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

BadRobot: 在物理世界中越狱具身LLM智能体

Hangtao Zhang, Chenyu Zhu, Xianlong Wang, Ziqi Zhou, Changgan Yin, Minghui Li, Lulu Xue, Yichen Wang, Shengshan Hu, Aishan Liu, Peijin Guo, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Beihang University(北航) Griffith University(格里菲斯大学)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。

Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09827 2026-06-09 cs.RO cs.CV 新提交 79%

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Dexmal StepFun

专题命中 机器人操作 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。

Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04672 2026-06-02 cs.CV cs.GR cs.RO 79%

AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation

AGILE: 通过代理生成从视频重建手-物体交互

Jin-Chuan Shi, Binhong Ye, Tao Liu, Junzhe He, Yangjinhui Xu, Xiaoyang Liu, Zeju Li, Hao Chen, Chunhua Shen

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University of Technology(浙江工业大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出AGILE框架,利用视觉语言模型引导生成完整物体网格,结合锚定-跟踪策略和接触感知优化,从单目视频鲁棒重建手-物体交互,生成可直接用于仿真的资产。

Comments 16 pages, SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23280 2026-06-01 cs.LG cs.RO 79%

Mollified Value Learning

Mollified Value Learning

Hrishikesh Viswanath, Juanwu Lu, S. Talha Bukhari, Mihir Chauhan, Damon Conover, Ziran Wang, Aniket Bera

机构 * Department of Computer Science, Purdue University, USA(普渡大学计算机科学系) College of Engineering, Purdue University, USA(普渡大学工程学院) DEVCOM Army Research Laboratory, USA(美国国防部 DEVCOM 军事研究实验室)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对离线目标条件强化学习中值函数估计困难的问题,提出一种通过空间测度聚合约束(而非逐点微分约束)来诱导距离类值几何的方法,称为Mollified Value Learning(MVL),在导航和高维机器人操作任务中提升了目标达成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26552 2026-05-28 cs.LG cs.AI 79%

Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference

通过摊销基于样本的变分推断来对齐少步生成模型

Jaewoo Lee, Hyeongyu Kang, Dohyun Kim, Kyuil Sim, Woocheol Shin, Minsu Kim, Taeyoung Yun, Jeongjae Lee, Sanghyeok Choi, Tabitha Edith Lee, Jong Chul Ye, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila – Quebec AI Institute(魁北克AI研究院) University of Edinburgh(爱丁堡大学) Université de Montréal(蒙特利尔大学) Omelet

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出FAV框架,利用Stein变分梯度下降进行基于样本的变分推断,并通过固定点回归将粒子更新摊销到生成器参数中,实现对少步生成模型的对齐,在机器人操作和图像生成任务中优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11817 2026-05-19 cs.RO cs.CV 79%

See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

See What Matters: Differentiable Grid Sample Pruning for Generalizable Vision-Language-Action Model

Yixu Feng, Zinan Zhao, Yanxiang Ma, Chenghao Xia, Chengbin Du, Yunke Wang, Chang Xu

机构 * The University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于可微网格采样的视觉-语言-动作模型压缩方法,通过连续的token重采样保留关键空间信息,实现高达90%的计算量减少而不影响性能。

Journal ref Proceedings of the Forty-third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12878 2026-05-12 cs.CV cs.RO 79%

Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views

Uni-Hand:面向亲身体验视角的通用手部运动预测

Junyi Ma, Wentao Bao, Jingyi Xu, Guanzhong Sun, Yu Zheng, Erhang Zhang, Xieyuanli Chen, Hesheng Wang

机构 * IRMV Lab, Shanghai Jiao Tong University(上海交通大学IMV实验室) Meta Reality Labs(Meta现实实验室) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) China University of Mining and Technology(中国矿业大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学与技术学院)

专题命中 机器人操作 :manipulation(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Uni-Hand框架,通过多模态输入、多维多目标预测和多任务赋能,实现手部在2D和3D空间的精准预测,并引入目标指标预测手腕和指尖关节点,同时预测手-物体交互状态,提升下游任务性能。

Comments Accepted by T-PAMI 2026. Code and data: https://github.com/IRMVLab/UniHand

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18979 2026-03-05 cs.RO cs.CV 79%

Category-Level Object Shape and Pose Estimation in Less Than a Millisecond

小于毫秒内的类别级物体形状和姿态估计

Lorenzo Shaikewitz, Tim Nguyen, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院) Laboratory for Information and Decision Systems(信息与决策系统实验室) Boston University(波士顿大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种快速求解器,通过自一致场迭代在毫秒级时间内实现类别级物体形状和姿态估计,结合线性主动形状模型和最大后验优化,提供高效的全局最优性证书。

Comments Accepted to ICRA 2026. This version contains appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06690 2026-02-25 cs.RO cs.CV 79%

SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System

SpikePingpong: 基于尖峰视觉的快慢Pingpong机器人系统

Hao Wang, Chengkai Hou, Xianglong Li, Yankai Fu, Chenxuan Li, Ning Chen, Gaole Dai, Jiaming Liu, Tiejun Huang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SpikePingpong系统结合尖峰视觉与模仿学习,实现高精度乒乓球机器人控制,达到92%的30厘米精度成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22356 2026-02-02 cs.LG cs.RO 79%

PoSafeNet: Safe Learning with Poset-Structured Neural Nets

PoSafeNet: 基于偏序结构神经网络的安全学习

Kiwan Wong, Wei Xiao, Daniela Rus

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 PoSafeNet通过偏序结构神经网络实现安全学习,通过可微神经安全层在偏序一致约束顺序下进行闭式投影,提升机器人系统在多障碍导航、受约束操作和自动驾驶中的可行性、鲁棒性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18963 2026-01-28 cs.RO cs.AI 79%

Fauna Sprout: A lightweight, approachable, developer-ready humanoid robot

Fauna Sprout:一种轻量、易用、开发者友好的人形机器人

Fauna Robotics, :, Diego Aldarondo, Ana Pervan, Daniel Corbalan, Dave Petrillo, Bolun Dai, Aadhithya Iyer, Nina Mortensen, Erik Pearson, Sridhar Pandian Arunachalam, Emma Reznick, David Weis, Jacob Davison, Samuel Patterson, Tess Carella, Michael Suguitan, David Ye, Oswaldo Ferro, Nilesh Suriyarachchi, Spencer Ling, Erik Su, Daniel Giebisch, Peter Traver, Sam Fonseca, Mack Mor, Rohan Singh, Sertac Guven, Kangni Liu, Yaswanth Kumar Orru, Ashiq Rahman Anwar Batcha, Shruthi Ravindranath, Silky Arora, Hugo Ponte, Dez Hernandez, Utsav Chaudhary, Zack Walker, Michael Kelberman, Ivan Veloz, Christina Santa Lucia, Kat Casale, Helen Han, Michael Gromis, Michael Mignatti, Jason Reisman, Kelleher Guerin, Dario Narvaez, Christopher Anderson, Anthony Moschella, Robert Cochran, Josh Merel

机构 * Fauna Robotics(Fauna机器人公司)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 Fauna Sprout 是一种轻量、易用、开发者友好的人形机器人平台,通过强调安全、表达性和开发者可及性,解决现有机器人在人类环境中的部署难题,并为开发具身智能提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17824 2025-11-25 cs.CV cs.RO 79%

QAL: A Loss for Recall Precision Balance in 3D Reconstruction

QAL:用于3D重建中召回精度平衡的损失

Pranay Meshram, Yash Turkar, Kartikeya Singh, Praveen Raj Masilamani, Charuvahan Adhivarahan, Karthik Dantu

机构 * University at Buffalo, The State University of New York(布法罗大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 QAL是一种用于3D重建中平衡召回和精度的损失函数,通过结合覆盖加权最近邻项和未覆盖真实地面吸引项,提升了补全效果和机器人操作的可靠性。

Comments Accepted to WACV 2026. Camera-ready version to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26855 2025-11-03 cs.RO cs.AI 79%

Leveraging Foundation Models for Enhancing Robot Perception and Action

Reihaneh Mirjalili

机构 * Department Computer Science & Artificial Intelligence University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments Doctoral thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24591 2025-11-03 cs.RO cs.AI 79%

PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control

Haozhuo Zhang, Michele Caprio, Jing Shao, Qiang Zhang, Jian Tang, Shanghang Zhang, Wei Pan

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI

Comments The experimental setup and metrics lacks rigor, affecting the fairness of the comparisons

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01531 2025-10-03 cs.AI cs.CL cs.RO 79%

Information Seeking for Robust Decision Making under Partial Observability

Djengo Cyun-Jyun Fang, Tsung-Wei Ke

机构 * National Taiwan University(台湾大学)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments The project page is available at https://infoseekerllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24241 2025-09-30 cs.CV cs.RO 79%

FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation

Seungwook Kim, Seunghyeon Lee, Minsu Cho

机构 * POSTECH Ewha Womans University(成均馆大学) RLWRLD

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.CV

Comments 8 pages, 4 figures, accepted to CoRL 2025 LSRW workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18742 2025-08-26 cs.CV cs.RO 79%

3D Feature Distillation with Object-Centric Priors

Georgios Tziafas, Yucheng Xu, Zhibin Li, Hamidreza Kasaei

机构 * Department of Artificial Intelligence University of Groningen, the Neteherlands(格罗宁根大学人工智能系) School of Informatics University of Edinburgh, United Kingdom(爱丁堡大学信息学院) Department of Computer Science University College London, United Kingdom(伦敦大学学院计算机科学系)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01944 2025-06-03 cs.RO cs.AI 79%

Feel the Force: Contact-Driven Learning from Humans

Ademi Adeniji, Zhuoran Chen, Vincent Liu, Venkatesh Pattabiraman, Raunaq Bhirangi, Siddhant Haldar, Pieter Abbeel, Lerrel Pinto

机构 * New York University(纽约大学) UC Berkeley(加州大学伯克利分校) New York University Shanghai(纽约大学上海分校)

专题命中 机器人操作 :robotics(abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12278 2025-05-20 cs.RO cs.CV 79%

Emergent Active Perception and Dexterity of Simulated Humanoids from Visual Reinforcement Learning

Zhengyi Luo, Chen Tessler, Toru Lin, Ye Yuan, Tairan He, Wenli Xiao, Yunrong Guo, Gal Chechik, Kris Kitani, Linxi Fan, Yuke Zhu

机构 * Nvidia(英伟达) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

Comments Project page: https://zhengyiluo.github.io/PDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09099 2025-05-15 cs.RO cs.LG 79%

Imitation Learning for Adaptive Control of a Virtual Soft Exoglove

Shirui Lyu, Vittorio Caggiano, Matteo Leonetti, Dario Farina, Letizia Gionfrida

机构 * Department of Informatics, King’s College London(信息学院,伦敦国王学院) MyoLab Harvard Medical School(哈佛医学院) Spaulding Rehabilitation Hospital(斯波林康复医院) Department of Bioengineering, Faculty of Engineering, Imperial College London(生物工程系,伦敦帝国理工学院工程学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01828 2025-05-05 cs.RO cs.LG 79%

From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

Yilin Wu, Ran Tian, Gokul Swamy, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07544 2025-03-27 cs.LG cs.RO stat.ML 79%

Contractive Dynamical Imitation Policies for Efficient Out-of-Sample Recovery

Amin Abyaneh, Mahrokh G. Boroujeni, Hsiu-Chin Lin, Giancarlo Ferrari-Trecate

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

Comments International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15027 2024-11-25 cs.RO cs.AI cs.HC 79%

Time is on my sight: scene graph filtering for dynamic environment perception in an LLM-driven robot

Simone Colombani, Luca Brini, Dimitri Ognibene, Giuseppe Boccignone

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13691 2024-11-12 cs.RO cs.AI 79%

Jailbreaking LLM-Controlled Robots

Alexander Robey, Zachary Ravichandran, Vijay Kumar, Hamed Hassani, George J. Pappas

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13636 2024-10-28 cs.RO cs.LG 79%

Contrast Sets for Evaluating Language-Guided Robot Policies

Abrar Anwar, Rohan Gupta, Jesse Thomason

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

Comments Accepted to CoRL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06911 2024-10-10 cs.RO cs.AI 79%

Combining Planning and Diffusion for Mobility with Unknown Dynamics

Yajvan Ravan, Zhutian Yang, Tao Chen, Tomás Lozano-Pérez, Leslie Pack Kaelbling

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments Submitted to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03061 2024-09-06 cs.CV cs.GR cs.RO 79%

Incorporating dense metric depth into neural 3D representations for view synthesis and relighting

Arkadeep Narayan Chaudhury, Igor Vasiljevic, Sergey Zakharov, Vitor Guizilini, Rares Ambrus, Srinivasa Narasimhan, Christopher G. Atkeson

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Project webpage: https://stereomfc.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07890 2024-07-30 cs.RO cs.LG 79%

Hierarchical Policy Blending as Inference for Reactive Robot Control

Kay Hansel, Julen Urain, Jan Peters, Georgia Chalvatzaki

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

Comments 8 pages, 5 figures, 1 table, accepted at ICRA 2023

详情

展开后加载摘要…

URL PDF HTML 收藏