arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61486 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22176 篇

2410.09072 2026-04-15 cs.RO 70%

iTeach: In the Wild Interactive Teaching for Failure-Driven Adaptation of Robot Perception

iTeach:真实环境中的交互教学用于机器人感知的故障驱动适应

Jishnu Jaykumar P, Cole Salvato, Vinaya Bomnale, Jikai Wang, Yu Xiang

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 iTeach通过故障驱动的交互教学框架,实现机器人感知在真实环境中的自适应。该方法通过人类与物体的短时交互暴露信息配置,结合少量样本进行迭代微调,提升分割性能和抓取成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11320 2026-04-14 cs.RO 70%

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取

Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) Peng Cheng Laboratory(鹏城实验室) Northeastern University(东北大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05499 2026-04-14 cs.RO 70%

TOSC: Task-Oriented Shape Completion for Open-World Dexterous Grasp Generation from Partial Point Clouds

TOSC:面向任务的形状补全用于从部分点云生成开放世界灵巧抓取

Weishang Wu, Yifei Shi, Zhiping Cai

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出面向任务的形状补全方法,通过生成任务导向的接触区域完成方案,提升开放世界中灵巧抓取的性能,改进抓取位移和 Chamfer 距离。

Comments Accepted to AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(13), 10781-10789 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03067 2026-04-14 cs.RO cs.SY eess.SY 70%

Statics of continuum planar grasping

连续体平面抓取的力学

Udit Halder

机构 * Department of Mechanical Engineering, University of South Florida(南佛罗里达大学机械工程系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于控制理论的框架,分析连续接触与平面物体的静态平衡,通过优化接触力提升抓取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04161 2026-04-13 cs.RO 70%

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

推理时的自适应动作分块

Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

机构 * National University of Singapore(新加坡国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Sangfor Technologies Inc.(深信服科技股份有限公司) Mininglamp Technology(明略科技) Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出自适应动作分块策略,通过动作熵动态调整分块大小,提升机器人操作的反应与一致性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06754 2026-04-09 cs.LG cs.CY 70%

The Rhetoric of Machine Learning

机器学习的修辞学

Robert C. Williamson

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.LG

AI总结 本文从修辞学角度探讨机器学习技术,指出其本质具有说服性,而非中立的客观建模方法,分析其修辞特征及'操纵即服务'的商业模式。

Comments 25 pages. Text of a talk given at AlphaPersuade 2.0, 26 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01224 2026-04-02 cs.RO 70%

Functional Force-Aware Retargeting from Virtual Human Demos to Soft Robot Policies

功能导向的软机器人策略的虚拟人演示重定向

Uksang Yoo, Mengjia Zhu, Evan Pezent, Jom Preechayasomboon, Jean Oh, Jeffrey Ichnowski, Amir Memar, Ben Abbatematteo, Homanga Bharadhwaj, Ashish Deshpande, Harsha Prahlad

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出SoftAct框架,通过显式考虑接触力来教软机器人手执行类人操作技能。采用虚拟现实技术捕获丰富的示范数据,结合两阶段力感知重定向算法,实现力平衡映射和实时接触优化,提升软机器人在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02768 2026-04-02 cs.RO cs.SY eess.SY 70%

Geometric Visual Servo Via Optimal Transport

通过最优传输的几何视觉伺服

Ethan Canzini, Simon Pope, Ashutosh Tiwari

机构 * University of Sheffield(谢菲尔德大学) Airbus UK(空客英国)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出基于最优传输的几何控制律,结合PD控制与重力补偿,实现机器人机械臂的位姿和图像视觉伺服控制。

Comments 19 pages, 5 figures. Accepted to Control Engineering Practice

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00202 2026-04-02 cs.RO 70%

DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors

DreamControl-v2:通过可训练引导扩散先验实现更简单且可扩展的自主人形技能

Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara, Srujan Deolasee, Dvij Kalaria, Srinath Sridhar, Sai Vemprala, Ashish Kapoor, Jonathan Chung-Kuan Huang

机构 * General Robotics, USA(美国通用机器人公司) Brown University, USA(美国布朗大学) University of California, Berkeley, USA(美国加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出改进的DreamControl框架,通过在人形机器人运动空间中训练引导扩散模型,整合多样化的人类和机器人数据集,提升技能范围和自动化程度,验证了生成参考轨迹的扩展性对下游RL策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 70%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25539 2026-03-27 cs.CV 70%

PAWS: Perception of Articulation in the Wild at Scale from Egocentric Videos

PAWS:从全景视频中大规模感知动作

Yihao Wang, Yang Miao, Wenshuai Zhao, Wenyan Yang, Zihan Wang, Joni Pajarinen, Luc Van Gool, Danda Pani Paudel, Juho Kannala, Xi Wang, Arno Solin

机构 * Aalto University(阿尔托大学) INSAIT, Sofia University(索菲亚大学INSAIT研究所) ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 PAWS通过直接提取手-物体互动中的动作结构,提升机器人、仿真和动画中的3D场景理解能力,实现大规模野外视频中的动作感知突破。

Comments 32 pages, 13 figures. Project page: https://aaltoml.github.io/PAWS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25481 2026-03-27 cs.RO 70%

LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation

LILAC:基于语言的物体中心光学流用于开环轨迹生成

Motonari Kambara, Koki Seno, Tomoya Kaichi, Yanan Wang, Komei Sugiura

机构 * Keio University(庆应义塾大学) KDDI Research Inc.(KDDI研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出LILAC模型,通过结合视觉与语言信息生成物体中心光学流,并转化为6自由度机械臂轨迹,实验显示其在多个基准和实际物体操作中表现更优。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22201 2026-03-26 cs.RO 70%

ACG: Action Coherence Guidance for Flow-based Vision-Language-Action models

ACG:基于流的视觉-语言-动作模型中的动作一致性指导

Minho Park, Kinam Kim, Junha Hyung, Hyojin Jang, Hoiyeong Jin, Jooyeol Yun, Hojoon Lee, Jaegul Choo

机构 * DAVIAN-Robotics, KAIST AI(DAVIAN机器人实验室,韩国科学技术院人工智能研究所)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出ACG算法,通过测试时指导提升视觉-语言-动作模型的动作一致性,从而在多种操作任务中提高成功率。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22263 2026-03-24 cs.RO 70%

DexDrummer: In-Hand, Contact-Rich, and Long-Horizon Dexterous Robot Drumming

DexDrummer: 手持式、接触密集且长周期的灵巧机器人敲击

Hung-Chieh Fang, Amber Xie, Jennifer Grannen, Kenneth Llontop, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) National Taiwan University(国立台湾大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出DexDrummer,通过模拟训练实现多手灵巧敲击,解决手持、接触密集和长周期操控难题,展示在模拟和现实中的优越性能。

Comments Website: https://dexdrummer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20236 2026-03-24 cs.RO 70%

EnergyAction: Unimanual to Bimanual Composition with Energy-Based Models

EnergyAction: 从单臂到双臂操作的能量模型框架

Mingchen Song, Xiang Deng, Jie Wei, Dongmei Jiang, Liqiang Nie, Weili Guan

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) PengCheng Laboratory(鹏城实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出EnergyAction框架,通过能量模型将单臂操作策略迁移至双臂任务,解决双臂操作中数据不足和动作协调难题,实验显示其在模拟和真实任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17065 2026-03-23 cs.RO 70%

TeleDex: Accessible Dexterous Teleoperation

TeleDex:易于使用的灵巧遥控

Omar Rayyan, Maximilian Gilles, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 TeleDex通过手机实现灵巧手和机械臂的直观遥控,降低硬件和设置门槛,支持模拟和现实任务中的演示收集,为机器人遥控提供统一可扩展接口。

Comments For project website and videos, see https://www.orayyan.com/teledex

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19231 2026-03-20 cs.CV 70%

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt:基于渐进结构推理的单目关节3D重建

Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, 637335 Singapore(南洋理工大学S实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 MonoArt通过渐进结构推理实现单目关节3D重建,无需外部运动模板或多阶段流程,提升重建精度和推理速度,并扩展至机器人操作和关节场景重建。

Comments Project page: https://lihaitian.com/MonoArt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 70%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18495 2026-03-20 cs.AI 70%

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

跨领域演示到代码的神经符号反事实推理

Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo

机构 * Department of Computer Science and Engineering, Sungkyunkwan University(Sungkyunkwan 大学计算机科学与工程系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 本文提出NeSyCR框架,通过神经符号反事实推理解决跨领域机器人编程中的过程不匹配问题,提升任务成功率31.14%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16270 2026-03-19 cs.RO 70%

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架

Kangxu Wang, Siang Chen, Chenxing Jiang, Shaojie Shen, Yixiang Dai, Guijin Wang

机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16853 2026-03-18 cs.RO cs.GR 70%

BrickSim: A Physics-Based Simulator for Manipulating Interlocking Brick Assemblies

BrickSim:一种基于物理的操纵互锁砖块组的模拟器

Haowei Wen, Ruixuan Liu, Weiyi Piao, Siyu Li, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 BrickSim通过紧凑的力基力学模型和凸二次规划解决互锁砖块的snap-fit机制,实现高保真的实时模拟,支持机器人构建和结构坍塌仿真,具有开源特性。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15618 2026-03-18 cs.CV 70%

Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models

先看再行动:增强视觉基础表示以用于视觉-语言-动作模型

Yulin Luo, Hao Chen, Zhuangzhe Wu, Bowen Sui, Jiaming Liu, Chenyang Gu, Zhuoyang Liu, Qiuxuan Feng, Jiale Yu, Shuo Gu, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DeepVision-VLA框架,通过视觉-语言混合变压器提升视觉表示,引入动作引导视觉剪枝技术,实现在模拟和现实任务中提升9.0%和7.5%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15410 2026-03-17 cs.RO 70%

End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset

从单视角点云通过多物体场景数据集实现端到端的灵巧抓取学习

Tao Geng, Dapeng Yang, Ziwei Liu, Le Zhang, Le Qi, WangYang Li, Yi Ren, Shan Luo, Fenglei Ni

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出DGS-Net,通过多物体场景的单视角点云学习密集抓取配置,改进了现有抓取数据集的局限性,实验显示其在仿真和真实机器人平台上的抓取成功率较高,且具有较低的穿透深度。

Comments 10 pages, 6 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13987 2026-03-17 cs.RO 70%

Vision-guided Autonomous Dual-arm Extraction Robot for Bell Pepper Harvesting

具有视觉引导的自主双臂提取机器人用于辣椒采摘

Kshitij Madhav Bhat, Tom Gao, Abhishek Mathur, Rohit Satishkumar, Francisco Yandun, Dominik Bauer, Nancy Pollard

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出VADER双臂机器人,用于室外环境中的自主辣椒采摘,通过鲁棒感知和双臂规划框架实现高精度采摘,实验显示采摘成功率超60%。

Comments 9 pages; first four authors have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13333 2026-03-17 cs.RO 70%

STL-SVPIO: Signal Temporal Logic guided Stein Variational Path Integral Optimization

STL-SVPIO:信号时序逻辑引导的Stein变分路径积分优化

Hongrui Zheng, Zirui Zang, Ahmad Amine, Cristian Ioan Vasile, Rahul Mangharam

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) Mechanical Engineering and Mechanics Department, Lehigh University(莱特大学机械工程与力学系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出STL-SVPIO方法,通过将信号时序逻辑转化为可微的奖励塑造机制,解决复杂STL约束下的长周期连续控制轨迹合成问题,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10712 2026-03-12 cs.RO 70%

FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model

FutureVLA: 视觉-运动联合预测用于视觉-语言-动作模型

Xiaoxu Xu, Hao Li, Jinhui Ye, Yilun Chen, Jia Zeng, Xinyi Chen, Linning Xu, Dahua Lin, Weixin Li, Jiangmiao Pang

专题命中 机器人操作 :embodied agent(abstract);manipulation(abstract);分类 cs.RO

AI总结 FutureVLA通过联合视觉-运动预测架构,解决视觉-语言-动作模型中联合建模的挑战,提升时间连续性和视觉监督解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10529 2026-03-12 cs.RO 70%

BinWalker: Development and Field Evaluation of a Quadruped Manipulator Platform for Sustainable Litter Collection

BinWalker:为可持续垃圾收集设计和评估四足操作平台

Giulio Turrisi, Angelo Bratta, Giovanni Minelli, Gabriel Fischer Abati, Amir H. Rad, João Carlos Virgolino Soares, Claudio Semini

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 BinWalker是一种四足机器人平台,用于自主收集户外垃圾,通过结合腿部运动和机械臂实现高效可持续的垃圾清理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10158 2026-03-12 cs.RO 70%

Cross-Hand Latent Representation for Vision-Language-Action Models

跨手的潜在表示用于视觉-语言-动作模型

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 XL-VLA通过统一的潜在动作空间实现跨手灵巧操作的可扩展学习,提升视觉-语言-动作模型的训练效率和性能。

Comments Website: https://xl-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08668 2026-03-10 cs.RO 70%

Exp-Force: Experience-Conditioned Pre-Grasp Force Selection with Vision-Language Models

Exp-Force:基于视觉-语言模型的经验条件预抓取力选择

Siqi Shang, Minchao Huang, Bill Fan, Lillian Chin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Exp-Force通过经验条件框架利用视觉-语言模型实现基于单张图像的预抓取力选择,显著提升了抓取力的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07652 2026-03-10 cs.CV 70%

GLASS: Graph and Vision-Language Assisted Semantic Shape Correspondence

GLASS: 图与视觉-语言辅助的语义形状对应

Qinfeng Xiao, Guofeng Mei, Qilong Liu, Chenyuan Yi, Fabio Poiesi, Jian Zhang, Bo Yang, Yick Kit-lun

机构 * Hong Kong Polytechnic University, HK SAR(香港理工大学) Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会) Laboratory for Artificial Intelligence in Design, HK SAR(设计中的人工智能实验室) University of Technology Sydney, Australia(悉尼科技大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 GLASS通过整合几何频谱分析与视觉-语言模型的语义先验,实现了在非等距变形和跨类设置中鲁棒的3D形状语义对应学习。

详情

展开后加载摘要…

URL PDF HTML 收藏