arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 22164 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

2410.04640 2024-11-01 cs.RO cs.AI cs.LG 76%

Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress

Christopher Agia, Rohan Sinha, Jingyun Yang, Zi-ang Cao, Rika Antonova, Marco Pavone, Jeannette Bohg

机构 * Stanford University(斯坦福大学) NVIDIA Research(英伟达研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robot learning(comments)

Comments Project page: https://sites.google.com/stanford.edu/sentinel. 35 pages, 9 figures. Accepted to the Conference on Robot Learning (CoRL) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17488 2024-10-24 cs.RO cs.CV cs.LG 76%

GenDP: 3D Semantic Fields for Category-Level Generalizable Diffusion Policy

Yixuan Wang, Guang Yin, Binghao Huang, Tarik Kelestemur, Jiuguang Wang, Yunzhu Li

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robot learning(comments)

Comments Accepted to Conference on Robot Learning (CoRL 2024). Project Page: https://robopil.github.io/GenDP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16118 2024-10-18 cs.RO cs.CV cs.LG 76%

D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement

Yixuan Wang, Mingtong Zhang, Zhuoran Li, Tarik Kelestemur, Katherine Driggs-Campbell, Jiajun Wu, Li Fei-Fei, Yunzhu Li

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robot learning(comments)

Comments Accepted to Conference on Robot Learning (CoRL 2024) as Oral Presentation. The first three authors contributed equally. Project Page: https://robopil.github.io/d3fields/

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09430 2024-05-13 cs.RO cs.AI cs.LG 76%

Action Conditioned Tactile Prediction: case study on slip prediction

Willow Mandil, Kiyanoush Nazari, Amir Ghalamzan E

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

Comments Proceeding of Robotics: Science and Systems (RSS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16528 2023-09-01 cs.CV cs.LG cs.RO 76%

SA6D: Self-Adaptive Few-Shot 6D Pose Estimator for Novel and Occluded Objects

Ning Gao, Ngo Anh Vien, Hanna Ziesche, Gerhard Neumann

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robot learning(journal_ref)

Journal ref Conference on Robot Learning (CoRL), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13133 2023-07-26 cs.RO cs.CV cs.LG 76%

simPLE: a visuotactile method learned in simulation to precisely pick, localize, regrasp, and place objects

Maria Bauza, Antonia Bronars, Yifan Hou, Ian Taylor, Nikhil Chavan-Dafle, Alberto Rodriguez

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments 33 pages, 6 figures, 2 tables, submitted to Science Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.15155 2022-03-30 cs.RO cs.AI cs.CV 76%

Learning to Synthesize Volumetric Meshes from Vision-based Tactile Imprints

Xinghao Zhu, Siddarth Jain, Masayoshi Tomizuka, Jeroen van Baar

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)

Comments To appear in the Proceedings of the IEEE International Conference on Robotics and Automation (ICRA 2022), Philadelphia (PA), USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.03386 2021-12-08 cs.RO cs.AI cs.LG 76%

Guided Imitation of Task and Motion Planning

Michael James McDonald, Dylan Hadfield-Menell

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robot learning(comments)

Comments 16 pages, 6 figures, 2 tables, submitted to Conference on Robot Learning 2021, to be published in Proceedings of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08229 2021-10-18 cs.RO cs.AI cs.LG cs.MA 76%

Influencing Towards Stable Multi-Agent Interactions

Woodrow Z. Wang, Andy Shih, Annie Xie, Dorsa Sadigh

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robot learning(comments)

Comments 15 pages, 5 figures, Published as an Oral at Conference on Robot Learning (CoRL) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.08903 2020-06-17 cs.CV cs.LG cs.RO eess.IV 76%

Depth by Poking: Learning to Estimate Depth from Self-Supervised Grasping

Ben Goodrich, Alex Kuefler, William D. Richards

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments IEEE International Conference on Robotics and Automation (ICRA) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06965 2020-03-17 cs.RO cs.CV cs.LG 76%

OmniTact: A Multi-Directional High Resolution Touch Sensor

Akhil Padmanabha, Frederik Ebert, Stephen Tian, Roberto Calandra, Chelsea Finn, Sergey Levine

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments Accepted at International Conference on Robotics and Automation (ICRA) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08105 2020-02-28 cs.RO cs.CV cs.LG 76%

Split Deep Q-Learning for Robust Object Singulation

Iason Sarantopoulos, Marios Kiatos, Zoe Doulgeri, Sotiris Malassiotis

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG;robotics(comments)

Comments Accepted for presentation in 2020 International Conference on Robotics and Automation (ICRA). Video attachment: https://youtu.be/ef1MKgVkN0E

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.03591 2019-03-11 cs.RO cs.AI cs.LG 76%

Learning to Identify Object Instances by Touch: Tactile Recognition via Multimodal Matching

Justin Lin, Roberto Calandra, Sergey Levine

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

Comments 6 pages; accepted to IEEE International Conference on Robotics and Automation 2019 (ICRA 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.01281 2018-09-25 cs.CV cs.LG cs.RO 76%

Object segmentation in depth maps with one user click and a synthetically trained fully convolutional network

Matthieu Grard, Romain Brégier, Florian Sella, Emmanuel Dellandréa, Liming Chen

专题命中 机器人操作 :robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

Comments This is a pre-print of an article published in Human Friendly Robotics, 10th International Workshop, Springer Proceedings in Advanced Robotics, vol 7. The final authenticated version is available online at: https://doi.org/10.1007/978-3-319-89327-3\_16, Springer Proceedings in Advanced Robotics, Siciliano Bruno, Khatib Oussama, In press, Human Friendly Robotics, 10th International Workshop, 7

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06961 2026-08-18 cs.RO cs.CV 版本更新 76%

Two by Two: Learning Multi-Task Pairwise Objects Assembly for Generalizable Robot Manipulation

两两配对:学习用于通用机器人操作的多任务成对物体装配

Yu Qi, Yuanchen Ju, Tianming Wei, Chi Chu, Lawson L. S. Wong, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Northeastern University(东北大学) IIIS, Tsinghua University(清华大学交叉信息研究院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.CV

AI总结 针对现有装配数据集无法适配日常物体装配的问题,提出2BY2数据集,并开发带等变特征的两步SE(3)位姿估计方法,在18项任务上取得最优性能且经机器人实验验证可靠泛化

Comments Accepted to CVPR 2025 (Conference on Computer Vision and Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30344 2026-06-30 cs.CV cs.AI 76%

Early Cue Precision Shapes Visual Shortcut Learning in Controlled Cue-Manipulation Benchmarks

早期线索精度塑造受控线索操作基准中的视觉捷径学习

Chanho Park, Woochan Lee, Janyeong Oh, Geongho Gong, Minshu Kim, Yeachan Kwak, Seongim Choi

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.CV

AI总结 通过合成形状-纹理任务和CIFAR-10基准,研究早期线索精度如何影响视觉分类器依赖低级线索的捷径学习,发现线索去相关需在下游适应中持续维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29898 2026-06-30 cs.RO cs.AI 76%

Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

关键区间均方误差:迈向机器人操作策略的可靠离线验证

Haoxu Huang, Tongsam Zheng, Yifan Chen, Jiacheng You, Yang Gao

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.AI

AI总结 提出关键区间均方误差(CI-MSE),通过限制误差计算到任务关键段并配合动作对齐,显著提升验证误差与真实性能的相关性,加速策略迭代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12263 2026-06-09 cs.CL cs.AI cs.LG 版本更新 76%

Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers

多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵

Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu

机构 * Georgetown University(乔治城大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院公园分校) Arizona State University(亚利桑那州立大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.LG

AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。

Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00253 2026-06-02 cs.RO cs.LG 76%

Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation

分组误差而非总MSE:微调视觉-语言-动作模型用于11自由度移动操作

Pau Montagut Bofi, Mario García Blasco, Tessa Pulli, Markus Vincze

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.LG

AI总结 针对异构关节空间的移动操作器微调视觉-语言-动作模型时,发现总MSE最低的检查点并非实际表现最佳,提出以分组误差作为更可靠的检查点选择指标。

Comments 4 pages, 3 figures, 3 tables. Accepted as poster at ICRA 2026 Workshop "From Data to Decisions: VLA Pipelines for Real Robots". Code: [https://github.com/paumontagut/per-group-mse-vla](https://github.com/paumontagut/per-group-mse-vla)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17111 2026-06-01 cs.RO cs.LG 76%

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

面向具身操作的高效视觉-语言-动作模型:系统综述

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA Nanjing University of Information Science and Technology(南京信息科学技术大学)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.LG

AI总结 本文系统综述了通过模型架构、感知特征、动作生成和训练/推理策略四个维度降低视觉-语言-动作模型延迟、内存占用及计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26156 2026-05-29 cs.CR cs.AI cs.LG 76%

Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

将偏见转化为漏洞:基于Bandit引导的LLM裁判风格操纵攻击

Xianglin Yang, Bryan Hooi, Gelei Deng, Tianwei Zhang, Jin Song Dong

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.LG

AI总结 提出BITE黑盒对抗框架,将风格编辑选择建模为上下文Bandit问题,通过LinUCB策略自适应选择编辑以误导LLM裁判并人为提高评分,攻击成功率超65%。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04929 2026-05-25 cs.RO cs.LG cs.SY eess.SY 76%

Neural Configuration-Space Barriers for Manipulation Planning and Control

用于操作规划与控制的神经构型空间障碍

Kehan Long, Ki Myung Brian Lee, Nikola Raicevic, Niyas Attasseri, Melvin Leok, Nikolay Atanasov

机构 * Contextual Robotics Institute, University of California San Diego(情境机器人研究所,加州大学圣地亚哥分校)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.LG

AI总结 提出一种基于神经构型空间距离函数障碍的统一方法,用于高维机器人操作规划与控制,通过分布鲁棒优化处理模型误差和传感器噪声,在杂乱动态环境中实现高效规划与鲁棒安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15713 2026-05-18 cs.RO cs.AI 76%

Learning Dynamic Pick-and-Place for a Legged Manipulator

学习动态抓取与放置用于四足机械臂

Moonkyu Jung, Jiseong Lee, Zhengmao He, Donghoon Youm, Juhyeok Mun, HyeongJun Kim, Hyunsik Oh, Donghyuk Choi, Jungwoo Hur, Jie Song, Jemin Hwangbo

机构 * Robotics and Artificial Intelligence Lab, KAIST(机器人与人工智能实验室,韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI

AI总结 本文提出一种分层强化学习框架,用于四足机械臂的动态抓取与放置任务,通过模拟和现实实验验证了其在不同负载和工作空间下的高成功率。

Comments Accepted to IEEE Robotics and Automation Letters 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7652-7659, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06225 2026-05-12 cs.LG cs.AI 76%

Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs

记忆 inception:用于引导 LLMs 的潜在空间 KV 缓存操作

Andy Zeyi Liu, Michael Zhang, Ilana Greenberg, Adam Alnasser, Lucas Baker, John Sous

机构 * Yale University(耶鲁大学) Princeton University(普林斯顿大学) Jump Trading

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.LG

AI总结 本文提出 memory inception 方法,通过在选定层插入文本衍生的键值对(KV)银行,在潜在注意力空间中引导 LLMs,实现更高效的控制与更少的存储消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10394 2026-04-02 cs.RO cs.LG 76%

RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI

RoboNeuron:面向具身AI的代理驱动编排中层基础设施

Weifan Guan, Qinghao Hu, Huasen Xi, Chenxiao Zhang, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA MAICRO

专题命中 机器人操作 :embodied AI(title);分类 cs.RO、cs.LG

AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07691 2026-03-10 cs.RO cs.CV 76%

RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation

RoboPCA:基于姿态的从人类示范中学习空间可及性的方法用于机器人操作

Zhanqi Xiao, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.CV

AI总结 RoboPCA通过联合预测接触区域和姿态,提升机器人操作中从人类示范中学习空间可及性的性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15684 2026-02-18 cs.RO cs.AI cs.HC cs.SY eess.SP eess.SY 76%

Estimating Human Muscular Fatigue in Dynamic Collaborative Robotic Tasks with Learning-Based Models

基于学习模型的动态协作机器人任务中人体肌肉疲劳估计

Feras Kiki, Pouya P. Niaz, Alireza Madani, Cagatay Basdogan

机构 * Robotics and Mechatronics Laboratory (RML) and the KUIS AI Center(机器人与机电实验室(RML)和KUIS人工智能中心)

专题命中 机器人操作 :robotic(title);分类 cs.RO、cs.AI

AI总结 本文提出基于学习模型的动态协作机器人任务中人体肌肉疲劳估计方法,利用sEMG数据通过回归模型预测疲劳周期分数,CNN模型表现最佳,展示了跨任务泛化的潜力。

Comments ICRA 2026 Original Contribution, Vienne, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09581 2026-02-11 cs.LG cs.AI 76%

Mitigating the Likelihood Paradox in Flow-based OOD Detection via Entropy Manipulation

通过熵操控缓解基于流的分布外检测中的可能性悖论

Donghwan Kim, Hyunsoo Yoon

机构 * University of Yonsei(延世大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.LG

AI总结 本文通过熵操控缓解基于流的分布外检测中的可能性悖论,利用语义相似性调整输入熵以提高检测性能。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 76%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 机器人操作 :manipulation(title);分类 cs.CV、cs.LG

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11076 2026-01-19 cs.RO cs.AI 76%

A3D: Adaptive Affordance Assembly with Dual-Arm Manipulation

A3D:基于双臂操作的自适应可达性组装

Jiaqi Liang, Yue Chen, Qize Yu, Yan Shen, Haipeng Zhang, Hao Dong, Ruihai Wu

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.AI

AI总结 A3D通过自适应可达性学习和双臂协作,实现家具组装任务的高效泛化。

Comments AAAI2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏