arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61441 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

2510.10602 2026-03-23 cs.RO cs.CV 73%

SpikeGrasp: A Benchmark for 6-DoF Grasp Pose Detection from Stereo Spike Streams

SpikeGrasp:一种从立体尖峰流中检测6自由度抓取姿态的基准

Zhuoheng Gao, Jiyao Zhang, Zhiyong Xie, Hao Dong, Zhaofei Yu, Rongmei Chen, Guozhang Chen, Tiejun Huang

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SpikeGrasp框架,通过模拟生物视觉运动通路,利用立体尖峰相机的原始异步事件直接推断抓取姿态,无需重建点云,在复杂和纹理缺失场景中优于传统点云方法。

Comments Some real machine experiments need to be supplemented, and the entire paper is incomplete

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14634 2026-03-20 cs.RO cs.CV 73%

Latent Representations for Visual Proprioception in Inexpensive Robots

视觉本体感觉中的低成本机器人潜在表示

Sahara Sheikholeslami, Ladislau Bölöni

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文探讨了低成本机器人通过单个外部摄像头图像进行视觉本体感觉的可行性,比较了CNN、VAE、ViT和fiducial标记袋等潜在表示方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 73%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09415 2026-03-11 cs.RO cs.AI 73%

From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation

从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略

Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过隐式最大似然估计基于的分布蒸馏,实现实时多模轨迹策略,提升机器人操作的高频闭环控制与鲁棒性。

Comments https://sites.google.com/view/flow2one, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07404 2026-03-10 cs.RO cs.AI 73%

Adaptive Capacity Allocation for Vision Language Action Fine-tuning

面向视觉语言动作微调的自适应容量分配

Donghoon Kim, Minji Bae, Unghui Nam, Gyeonghun Kim, Suyun Lee, Kyuhong Shim, Byonghyo Shim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学) Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,全北国立大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出LoRA-SP方法,通过自适应秩微调提升视觉语言动作模型在多任务场景中的性能和泛化能力。

Comments ICRA 2026 (Official Code: https://github.com/dhkim-furiosa/LoRA-SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03596 2026-03-10 cs.RO cs.LG 73%

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

MEM:多尺度具身记忆用于视觉语言动作模型

Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springenberg, Sergey Levine, Chelsea Finn, Danny Driess

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 MEM通过结合多模态记忆实现长期视觉语言动作任务的高效执行与适应性策略调整。

Comments Website: https://pi.website/research/memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06846 2026-03-10 cs.CV cs.RO 73%

MotionBits: Video Segmentation through Motion-Level Analysis of Rigid Bodies

MotionBits: 通过刚体的运动级分析进行视频分割

Howard H. Qian, Kejia Ren, Yu Xiang, Vicente Ordonez, Kaiyu Hang

机构 * Department of Computer Science(计算机科学系) Rice University(里士满大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 MotionBits通过运动学空间扭转等价性定义运动级视频分割单元,提出无需学习的图基分割方法,在MoRiBo基准上提升37.3%的mIoU,有效提升嵌入式推理与操作性能。

Comments 23 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17896 2026-03-05 cs.CV cs.AI 73%

EgoWorld: Translating Exocentric View to Egocentric View using Rich Exocentric Observations

EgoWorld:利用丰富的外参照观测将外参照视角转换为自身参照视角

Junho Park, Andrew Sangwoo Ye, Taein Kwon

机构 * AI Lab, LG Electronics(LG电子人工智能实验室) KAIST(韩国科学技术院) Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.CV

AI总结 EgoWorld通过重建丰富的外参照观测来实现外参照到自身参照视角的转换,展示了在增强现实、虚拟现实和机器人应用中的先进性能和鲁棒性。

Comments Accepted by ICLR 2026. Project Page: https://redorangeyellowy.github.io/EgoWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 73%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01469 2026-03-03 cs.RO cs.AI 73%

Mean-Flow based One-Step Vision-Language-Action

基于均流的单步视觉-语言-动作

Yang Chen, Xiaoguang Ma, Bin Zhao

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于均流的单步VLA方法,通过消除传统流匹配方法的一致性约束,显著提升生成效率,实现实时动作生成,实验表明其在机器人操作中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00151 2026-03-03 cs.RO cs.CV 73%

Multiview Progress Prediction of Robot Activities

机器人活动多视角进展预测

Elena Zoppellari, Federico Becattini, Marco Fiorucci, Lamberto Ballan

机构 * University of Padova, Italy(帕多瓦大学) University of Siena, Italy(锡耶纳大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种多视角架构,用于机器人操作任务中的动作进展预测,以提高机器人与人类协同工作的有效性和安全性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22862 2026-02-27 cs.RO cs.CV 73%

GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion

GraspLDP: 通过潜在扩散实现通用抓取策略

Enda Xiang, Haoxiang Ma, Xinzhu Ma, Zicheng Liu, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 GraspLDP通过引入潜在扩散框架和抓取先验知识,提升了抓取策略的精度和泛化能力,实验表明其在动态抓取任务中表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18374 2026-02-23 cs.RO cs.AI 73%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17951 2026-02-23 cs.CV cs.AI 73%

ROCKET: Residual-Oriented Multi-Layer Alignment for Spatially-Aware Vision-Language-Action Models

ROCKET:基于残差的多层对齐用于空间感知的视觉-语言-动作模型

Guoheng Sun, Tingting Du, Kaixi Feng, Chenxiang Luo, Xingguo Ding, Zheyu Shen, Ziyao Wang, Yexiao He, Ang Li

机构 * University of Maryland, College Park University of Wisconsin, Madison City University of Hong Kong St.\ Paul's School

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 ROCKET通过共享投影器和稀疏激活方案实现多层对齐,提升3D空间理解能力,在LIBERO等任务中达到98.5%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14968 2026-02-17 cs.RO cs.AI 73%

PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement

PhyScensis: 基于物理的LLM代理用于复杂物理场景布置

Yian Wang, Han Yang, Minghao Guo, Xiaowen Qiu, Tsun-Hsuan Wang, Wojciech Matusik, Joshua B. Tenenbaum, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Genesis AI MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 PhyScensis通过物理引擎驱动的LLM代理框架,生成复杂物理场景布局,提升机器人操作中的场景复杂性和物理准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12096 2026-02-13 cs.RO cs.AI 73%

Multi Graph Search for High-Dimensional Robot Motion Planning

多图搜索用于高维机器人运动规划

Itamar Mishani, Maxim Likhachev

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出多图搜索算法,用于高维机器人运动规划,通过多图扩展实现高效且可靠的路径搜索。

Comments Submitted for Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11660 2026-02-13 cs.CV cs.RO 73%

Clutt3R-Seg: Sparse-view 3D Instance Segmentation for Language-grounded Grasping in Cluttered Scenes

Clutt3R-Seg:用于语言引导抓取的稀疏视角3D实例分割

Jeongho Noh, Tai Hyoung Rhee, Eunho Lee, Jeongyun Kim, Sunwoo Lee, Ayoung Kim

机构 * Dept. of Mechanical Engineering, SNU(机械工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence, SNU(人工智能跨学科项目,首尔国立大学) Robotics Lab, Hyundai Motor Company(Hyundai Motor Company机器人实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Clutt3R-Seg通过引入层次实例树和开放词汇语义嵌入,实现了在杂乱场景中语言引导抓取的高效3D实例分割。

Comments Accepted to ICRA 2026. 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10943 2026-02-12 cs.CV cs.RO 73%

Towards Learning a Generalizable 3D Scene Representation from 2D Observations

从2D观测向量学习通用的3D场景表示

Martin Gromniak, Jan-Gerrit Habekost, Sebastian Kamp, Sven Magg, Stefan Wermter

机构 * University of Hamburg - Department of Informatics(汉堡大学信息学院) ZAL Center of Applied Aeronautical Research(应用航空研究中心) Hamburger Informatik Technologie-Center e.V. (HITeC)(汉堡信息科技中心(HITeC))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种通用神经辐射场方法,通过第一人称机器人观测学习3D场景表示,实现了对未见场景的泛化能力,并在真实场景中验证了其高精度的3D重建性能。

Comments Paper accepted at ESANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06653 2026-02-09 cs.RO cs.AI 73%

RAPID: Reconfigurable, Adaptive Platform for Iterative Design

RAPID: 可重构、自适应平台用于迭代设计

Zi Yin, Fanhong Li, Shurui Zheng, Jia Liu

机构 * Zi Yin Fanhong Li Shurui Zheng Jia Liu

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RAPID通过模块化硬件和软件栈实现机器人操作策略的快速迭代与多模态配置的高效实验

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00886 2026-02-03 cs.RO cs.LG 73%

RoDiF: Robust Direct Fine-Tuning of Diffusion Policies with Corrupted Human Feedback

RoDiF: 基于损坏人类反馈的扩散策略鲁棒直接微调

Amitesh Vatsa, Zhixian Xie, Wanxin Jin

机构 * Interactive Systems (IRIS) Lab, Arizona State University, Tempe AZ, USA.(智能机器人与交互系统实验室,亚利桑那州立大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 RoDiF通过几何假设切割视角和保守切割策略,实现无假设噪声分布的鲁棒直接微调,提升扩散策略在损坏人类反馈下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 73%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 73%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17895 2026-01-27 cs.CV cs.RO 73%

Masked Depth Modeling for Spatial Perception

遮蔽深度建模用于空间感知

Bin Tan, Changjiang Sun, Xiage Qin, Hanat Adai, Zelin Fu, Tianxiang Zhou, Han Zhang, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 LingBot-Depth通过遮蔽深度建模和自动化数据整理流水线,在深度精度和像素覆盖上优于顶级RGB-D相机,提供跨RGB和深度模态的对齐潜在表示。

Comments Tech report, 19 pages, 15 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16065 2026-01-23 cs.CV cs.RO 73%

DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models

DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型

Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He, Yuchen Li, Jingqun Tang

机构 * Australian National University(澳大利亚国立大学) University of California, San Diego(加州大学圣地亚哥分校) Chinese Academy of Sciences(中国科学院) Beijing Institute of Graphic Communication(北京印刷学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Baidu Search(百度搜索) Bytedance(字节跳动)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 DTP框架通过动态修剪干扰令牌提升视觉-语言动作模型的任务成功率,适用于多种新型VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04194 2026-01-08 cs.CV cs.GR cs.RO 73%

Choreographing a World of Dynamic Objects

编排动态物体的纷繁世界

Yanzhe Lyu, Chen Geng, Karthik Dharmarajan, Yunzhi Zhang, Hadi Alzayer, Shangzhe Wu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学) University of Maryland(马里兰大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出CHORD方法,通过蒸馏技术提取视频中隐藏的拉格朗日运动信息,实现通用动态物体生成,适用于多体4D动态生成和机器人操作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24965 2026-01-01 cs.CV cs.AI cs.HC 73%

ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands

ShowUI-$π$: 基于流的生成模型作为GUI灵巧手

Siyuan Hu, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.CV

AI总结 ShowUI-$π$ 是首个基于流的生成模型,通过统一动作、流式动作生成和拖动基准测试,实现了GUI灵巧手的高效拖动控制。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 73%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08920 2025-12-10 cs.RO cs.LG 73%

OSMO: Open-Source Tactile Glove for Human-to-Robot Skill Transfer

OSMO:开源触觉手套用于人到机器人技能转移

Jessica Yin, Haozhi Qi, Youngsun Wi, Sayantan Kundu, Mike Lambeta, William Yang, Changhao Wang, Tingfan Wu, Jitendra Malik, Tess Hellebrekers

机构 * Meta FAIR University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人操作 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 OSMO通过触觉手套实现人到机器人技能转移,利用触觉数据提升机器人操作性能。

Comments Project website: https://jessicayin.github.io/osmo_tactile_glove/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07215 2025-12-10 cs.CV cs.AI 73%

VFM-VLM: Vision Foundation Model and Vision Language Model based Visual Comparison for 3D Pose Estimation

基于视觉基础模型和视觉语言模型的3D姿态估计视觉比较:VFM-VLM

Md Selim Sarowar, Sungho Kim

机构 * Dept. of Electronic Engineering Yeungnam University Advanced Visual Intelligence Lab(电子工程系 韩国又南大学 高级视觉智能实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文比较了基于CLIP和DINOv2的视觉模型在3D姿态估计中的性能,展示了两者在语义理解和几何精度上的互补优势,为机器人抓取应用提供了模型选择依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22697 2025-12-01 cs.RO cs.CL cs.CV 73%

Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations

通过少样本示范机制性微调视觉-语言-动作模型

Chancharik Mitra, Yusen Luo, Raj Saravanan, Dantong Niu, Anirudh Pai, Jesse Thomason, Trevor Darrell, Abrar Anwar, Deva Ramanan, Roei Herzig

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出Robotic Steering方法,通过少样本示范机制性微调视觉-语言-动作模型,提升其在机器人任务中的适应性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏