arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61441 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

2409.17389 2025-02-25 cs.RO 76%

Safe Leaf Manipulation for Accurate Shape and Pose Estimation of Occluded Fruits

Shaoxiong Yao, Sicong Pan, Maren Bennewitz, Kris Hauser

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Shaoxiong Yao and Sicong Pan have equal contributions. Publication to appear in IEEE International Conference on Robotics and Automation (ICRA), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07890 2024-11-13 cs.RO 76%

Minimally Invasive Flexible Needle Manipulation Based on Finite Element Simulation and Cross Entropy Method

Yanzhou Wang, Chang Chang, Junling Mei, Simon Leonard, Iulian Iordachita

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Submitted to IEEE International Conference on Robotics and Automation 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22910 2024-10-31 cs.RO 76%

An Efficient Representation of Whole-body Model Predictive Control for Online Compliant Dual-arm Mobile Manipulation

Wenqian Du, Ran Long, João Moura, Jiayi Wang, Saeid Samadi, Sethu Vijayakumar

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Under Review for IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00973 2024-07-02 cs.RO 76%

Locomotion as Manipulation with ReachBot

Tony G. Chen, Stephanie Newdick, Julia Di, Carlo Bosio, Nitin Ongole, Mathieu Lapotre, Marco Pavone, Mark R. Cutkosky

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(journal_ref)

Journal ref Science Robotics 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.11944 2020-04-29 cs.RO cs.SY eess.SY 76%

Sigma-3: Integration and Analysis of a 6 DOF Robotic Arm Configuration in a Rescue Robot

R. A. Bindu, A. A. Neloy, S. Alam, N. J Moni, S. Siddique

专题命中 机器人操作 :robotic(title);分类 cs.RO;robotics(comments)

Comments 6 pages, 4 figures, To be appear in the proceedings of 2019 4th International Conference on Robotics and Automation Engineering. Singapore November 22-24, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06743 2020-03-17 cs.RO 76%

Planning with Selective Physics-based Simulation for Manipulation Among Movable Objects

Muhammad Suhail Saleem, Maxim Likhachev

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments 2020 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.10159 2020-03-10 cs.RO 76%

Self-supervised 6D Object Pose Estimation for Robot Manipulation

Xinke Deng, Yu Xiang, Arsalan Mousavian, Clemens Eppner, Timothy Bretl, Dieter Fox

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Accepted to International Conference on Robotics and Automation (ICRA), 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06302 2020-02-18 cs.RO 76%

Applying Depth-Sensing to Automated Surgical Manipulation with a da Vinci Robot

Minho Hwang, Daniel Seita, Brijen Thananjeyan, Jeffrey Ichnowski, Samuel Paradis, Danyal Fer, Thomas Low, Ken Goldberg

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Camera-ready version for the International Symposium on Medical Robotics (ISMR) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09563 2019-09-06 cs.RO 76%

A Distributed Predictive Control Approach for Cooperative Manipulation of Multiple Underwater Vehicle Manipulator Systems

Shahab Heshmati-Alamdari, George C. Karras, Kostas J. Kyriakopoulos

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

Comments Accepted in IEEE International Conference on Robotics and Automation (ICRA), Montreal, Canada, 2019. arXiv admin note: text overlap with arXiv:1905.04531

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.05172 2018-05-16 cs.RO 76%

Closing the Loop for Robotic Grasping: A Real-time, Generative Grasp Synthesis Approach

Douglas Morrison, Peter Corke, Jürgen Leitner

专题命中 机器人操作 :robotic(title);分类 cs.RO;robotics(comments)

Comments Robotics: Science and Systems (RSS), 2018. Code: http://github.com/dougsm/ggcnn Video: http://www.youtube.com/watch?v=7nOoxuGEcxA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17628 2026-08-19 cs.RO cs.AI cs.LG eess.IV 新提交 75%

Iterative Grasp Pose Refinement: A Deep Reinforcement Learning Approach for 2D Vision

迭代抓取位姿优化:一种面向二维视觉的深度强化学习方法

Amir Arsalan Nematollahi, Shayan Ahmadi, Mehdi Tale Masouleh, Ahmad Kalhor

机构 * University of Tehran(德黑兰大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究提出结合关键点表征与DQN的强化学习框架,通过迭代优化抓取位姿,在Dex-Net数据集300个物体上对几何判定不可抓取物体实现100%成功率,且可实现仿真到真实的迁移,为接触丰富的操作任务提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09948 2026-08-19 cs.AI cs.CV cs.RO 版本更新 75%

LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

LoopVLA: 在视觉-语言-动作模型中学习充分性

Boyang Shen, Kaixiang Yang, Hao Wang, Qiuyu Yu, Qiang Xie, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10232 2026-08-12 cs.RO cs.AI cs.LG 新提交 75%

FACT: Failure-Aware Causal Training for World-Action Models

FACT:面向世界-动作模型的故障感知因果训练方法

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 75%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19638 2026-06-23 cs.RO cs.CV cs.LG 75%

Sensor-Invariant Tactile Representation

不变的触觉表示

Harsh Gupta, Yuchen Mo, Shengmiao Jin, Wenzhen Yuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出一种新的方法,用于提取传感器不变的触觉表示,以实现跨光学触觉传感器的零样本迁移。通过基于变压器的架构训练多样化的模拟传感器数据集,实现对新传感器的最小校准泛化。实验结果展示了该方法在多种触觉传感应用中的有效性。

Comments Accepted to ICLR'25. Project webpage: https://hgupt3.github.io/sitr/

Journal ref International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19451 2026-06-19 cs.LG cs.CV cs.RO 新提交 75%

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

3D-DLP:自监督3D物体中心场景表示学习

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出3D-DLP模型,通过自监督学习将场景级RGB-D或体素观测分解为3D潜在粒子,每个粒子编码解耦属性,实现可解释的逐粒子分割图,并支持场景操控和下游机器人操作。

Comments ICML 2026. Project webpage: https://eubooks3003.github.io/3d-dlp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14981 2026-06-16 cs.RO cs.AI cs.LG 新提交 75%

Inference-time Policy Steering via Vision and Touch

通过视觉和触觉进行推理时策略引导

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 75%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 75%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 75%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09451 2026-06-09 cs.RO cs.CV cs.LG 新提交 75%

Dense Force Estimation with an Event-based Optical Tactile Sensor

基于事件的光学触觉传感器的稠密力估计

Agis Politis, René Zurbrügg, Valentina Cavinato

机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ETH Zürich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04188 2026-06-04 cs.LG cs.AI cs.RO 75%

Dual Advantage Fields

双优势场

Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin, Dmitry V. Dylov, Fakhri Karray, Vladislav Kurenkov, Martin Takáč, Arip Asadulaev

机构 * NUST MISIS(努斯大学材料科学与工程学院) MSU(莫斯科大学) Computational Imaging Lab(计算成像实验室) MBZUAI(马斯喀特人工智能研究院) dunnolab(杜诺实验室) Innopolis University(因诺波利斯大学)

专题命中 机器人操作 :manipulation(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出双优势场(DAF)方法,利用双线性对偶值模型生成局部优势信号,通过动作-效应模型预测折扣特征位移并与目标方向对齐来评分动作,实现离线目标条件强化学习中的策略提取。

Comments Accepted by ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09877 2026-06-02 cs.CV cs.AI cs.RO 75%

Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction

Genie 4D:语义先验引导的4D动态场景重建

Yiru Yang, Zhuojie Wu, Nishant Kumar Singh, Max Schulthess

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19433 2026-06-01 cs.RO cs.AI cs.CV 75%

Mixture of Horizons in Action Chunking

动作分块中的视野混合

Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对视觉-语言-动作模型中动作分块长度(视野)的权衡问题,提出混合视野策略,通过并行处理不同视野的动作片段并融合输出,同时提升长期预见与短期精度,实现性能与泛化性的改进。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13959 2026-05-15 cs.LG cs.AI cs.RO 75%

WarmPrior: Straightening Flow-Matching Policies with Temporal Priors

WarmPrior: 通过时间先验使流匹配策略更加平直

Sinjae Kang, Chanyoung Kim, Kaixin Wang, Li Zhao, Kimin Lee

机构 * KAIST(韩国科学技术院) Microsoft Research(微软研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV 75%

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14388 2026-03-17 eess.SY cs.SY 75%

Context-Aware Adaptive Shared Control for Magnetically-Driven Bimanual Dexterous Micromanipulation

具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 75%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13395 2026-03-17 cs.CV cs.LG cs.RO 75%

COT-FM: Cluster-wise Optimal Transport Flow Matching

COT-FM:分簇最优传输流匹配

Chiensheng Chiang, Kuan-Hsun Tu, Jia-Wei Liao, Cheng-Fu Chou, Tsung-Wei Ke

机构 * National Taiwan University(台湾大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 COT-FM通过分簇策略优化流匹配框架,提升生成速度与可靠性,适用于图像生成和机器人任务。

Comments 18pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 75%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏