arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 163 篇

2606.18363 2026-06-18 cs.RO cs.AI 新提交 62%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17040 2026-06-16 cs.RO cs.CV 新提交 62%

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

R2RDreamer: 面向空间泛化的2D操作策略的3D感知数据增强

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) BUPT(北京邮电大学) GigaAI

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出R2RDreamer框架,通过轻量级3D编辑和2D视频补全,从少量真实演示生成几何一致的增强数据,提升2D操作策略的空间泛化能力。

Comments Project page: https://r2rdreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03896 2026-06-12 cs.CV cs.RO 版本更新 62%

GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert

GAE: 利用可泛化动作专家释放VLM的物理潜力

Mingyu Liu, Zheng Huang, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Yating Wang, Haoyi Zhu, Hao Chen, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30350 2026-05-29 cs.RO cs.LG 62%

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

DynaFLIP: 通过三模态动力学引导表示重新思考机器人感知

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * Seoul National University(首尔国立大学) University of Maryland, College Park(马里兰大学学院公园分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 部署与泛化 :VLA(abstract_cn);分类 cs.RO、cs.LG

AI总结 提出DynaFLIP,一种动力学感知的多模态预训练框架,通过图像-语言-3D流三元组训练图像编码器,利用单纯形体积最小化与余弦正则化和对比目标对齐三模态,提升机器人操作中的运动理解与泛化能力。

Comments Project website: https://dynaflip-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14245 2026-04-29 cs.LG cond-mat.mtrl-sci cs.AI cs.CE q-bio.BM 62%

Curriculum-guided multimodal representation learning enables generalizable prediction of nanomaterial-protein interactions

基于课程引导的多模态表示学习可实现纳米材料-蛋白质相互作用的通用预测

Hengjie Yu, Kenneth A. Dawson, Haiyun Yang, Shuya Liu, Yan Yan, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所在先进科技研究院) Centre for BioNano Interactions, School of Chemistry, University College Dublin(都柏林大学学院化学系生物纳米相互作用中心) School of Biomolecular and Biomedical Science, UCD Conway Institute of Biomolecular and Biomedical Research(都柏林大学学院生物分子与生物医学科学系,康沃利斯生物分子与生物医学研究学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CuMMI模型,通过多阶段课程学习和大规模数据集,实现纳米材料-蛋白质相互作用的通用预测,验证了其在不同数据集上的鲁棒性和可迁移性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07562 2026-04-21 cs.CL cs.AI cs.CY cs.LG 62%

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

基于推理的无监督文本聚类细化方法

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型作为语义评判者,对无监督聚类结果进行推理细化,通过三个阶段提升聚类的连贯性与可解释性,实验证明其在社交媒体数据中优于传统方法。

Comments Accepted to the Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16484 2026-04-21 cs.CV cs.AI 62%

DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks

DexWorldModel:基于因果潜在世界的建模以实现具身任务的自动化学习

Yueci Deng, Guiliang Liu, Kui Jia

机构 * DexForce AI

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLWM模型,通过分离交互语义与视觉噪声提升领域泛化能力,采用双状态测试时训练机制和推测异步推理方法,实现高效长周期任务处理,并通过EmbodiChain框架提升策略鲁棒性,实验表明其在复杂双臂仿真和物理机器人零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23893 2026-03-03 cs.CV cs.RO 62%

AoE: Always-on Egocentric Human Video Collection for Embodied AI

AoE: 始终在线的以自身为中心的人类视频采集用于具身AI

Bowen Yang, Zishuo Li, Yang Sun, Changtao Miao, Yifan Yang, Man Luo, Xiaotong Yan, Feng Jiang, Jinchuan Shi, Yankai Fu, Ning Chen, Junkai Zhao, Pengwei Wang, Guocai Yao, Shanghang Zhang, Hao Chen, Zhe Li, Kai Zhu

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.CV

AI总结 AoE系统通过利用人类和智能手机低成本采集以自身为中心的现实世界交互数据,解决具身AI的数据稀缺问题,提升现实世界泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08665 2026-01-14 cs.RO cs.CV 62%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21126 2025-09-26 cs.LG cs.AI 62%

Teaching RL Agents to Act Better: VLM as Action Advisor for Online Reinforcement Learning

Xiefeng Wu, Jing Zhao, Shu Zhang, Mingyu Hu

机构 * Wuhan University(武汉大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10884 2025-09-16 cs.RO cs.CV 62%

Nav-R1: Reasoning and Navigation in Embodied Scenes

Qingxiang Liu, Ting Huang, Zeyu Zhang, Hao Tang

机构 * Shanghai University of Engineering Science(上海工程技术大学) Peking University(北京大学)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12779 2025-09-03 cs.RO cs.LG 62%

From Experts to a Generalist: Toward General Whole-Body Control for Humanoid Robots

Yuxuan Wang, Ming Yang, Ziluo Ding, Yu Zhang, Weishuai Zeng, Xinrun Xu, Haobin Jiang, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05625 2025-09-01 cs.LG cs.AI 62%

SPIN-ODE: Stiff Physics-Informed Neural ODE for Chemical Reaction Rate Estimation

Wenqing Peng, Zhi-Song Liu, Michael Boy

机构 * Institute for Atmospheric and Earth Systems Research, University of Helsinki(大气与地球系统研究所,赫尔辛基大学) Department of Computational Engineering, Lappeenranta-Lahti University of Technology LUT(计算工程系,拉佩兰塔-拉赫蒂技术大学LUT) Atmospheric Modelling Centre-Lahti(拉赫蒂大气建模中心)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments Accepted at the European Conference on Artificial Intelligence (ECAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12236 2025-05-20 cs.CL cs.AI cs.LG 62%

Bridging Generative and Discriminative Learning: Few-Shot Relation Extraction via Two-Stage Knowledge-Guided Pre-training

Quanjiang Guo, Jinchuan Zhang, Sijie Wang, Ling Tian, Zhao Kang, Bin Yan, Weidong Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Information Engineering University(信息工程大学) National University of Defense Technology(国防科技大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 6 figures, Appear on IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16228 2025-01-09 cs.RO cs.LG 62%

Policy Adaptation via Language Optimization: Decomposing Tasks for Few-Shot Imitation

Vivek Myers, Bill Chunyuan Zheng, Oier Mees, Sergey Levine, Kuan Fang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO、cs.LG

Comments 27 pages, 14 figures

Journal ref Conference on Robot Learning, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15996 2024-12-06 cs.CV cs.AI 62%

Spatio-Temporal Context Prompting for Zero-Shot Action Detection

Wei-Jhe Huang, Min-Hung Chen, Shang-Hong Lai

机构 * National Tsing Hua University(国立清华大学) NVIDIA(英伟达)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

Comments Accepted by WACV2025. Project page: https://webber2933.github.io/ST-CLIP-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04491 2024-08-09 cs.CV cs.AI 62%

Towards Synergistic Deep Learning Models for Volumetric Cirrhotic Liver Segmentation in MRIs

Vandan Gorade, Onkar Susladkar, Gorkem Durak, Elif Keles, Ertugrul Aktas, Timurhan Cebeci, Alpay Medetalibeyoglu, Daniela Ladner, Debesh Jha, Ulas Bagci

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10189 2024-05-31 cs.CL cs.AI cs.LG 62%

Chem-FINESE: Validating Fine-Grained Few-shot Entity Extraction through Text Reconstruction

Qingyun Wang, Zixuan Zhang, Hongxiang Li, Xuan Liu, Jiawei Han, Huimin Zhao, Heng Ji

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments 16 pages. Accepted by Findings of the Association for Computational Linguistics: EACL 2024. Code and resources are available at https://github.com/EagleW/Chem-FINESE

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03599 2024-01-09 cs.RO cs.AI 62%

Disentangled Neural Relational Inference for Interpretable Motion Prediction

Victoria M. Dax, Jiachen Li, Enna Sachdeva, Nakul Agarwal, Mykel J. Kochenderfer

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI

Journal ref IEEE Robotics and Automation Letters, Date: FEBRUARY 2024 , Volume: 9, Issue: 2, ISSN: 2377-3766, pp1452-1459

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00690 2021-12-06 cs.CV cs.LG 62%

MDFM: Multi-Decision Fusing Model for Few-Shot Learning

Shuai Shao, Lei Xing, Rui Xu, Weifeng Liu, Yan-Jiang Wang, Bao-Di Liu

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.LG

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). arXiv admin note: text overlap with arXiv:2109.07785

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03022 2021-02-08 cs.RO cs.AI 62%

Active inference body perception and action for humanoid robots

Guillermo Oliver, Pablo Lanillos, Gordon Cheng

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18498 2026-08-20 cs.CV 新提交 57%

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交 57%

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09378 2026-07-13 quant-ph cs.AI cs.CR 新提交 57%

When Routes Run Out: Adversarial Co-Learning and Explainable Robustness in Quantum Repeater Networks

当路线耗尽时:量子中继器网络中的对抗协同学习与可解释鲁棒性

Brennan Bell, Inti Gabriel Mendoza Estrada, Andreas Trügler, Paul Erker

机构 * RFI-IRFOS and TU Graz(RFI-IRFOS和格拉茨技术大学) openmaind FlexCo and TU Graz(openmaind FlexCo和格拉茨技术大学) Know Center Research GmbH and University of Graz(Know Center Research GmbH和格拉茨大学) Atominstitut, TU Wien and IQOQI, ÖAW(原子院、维也纳技术大学和ÖAW IQOQI)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI

AI总结 研究量子中继器网络路由对抗博弈问题,通过对抗协同学习,发现保留率与参考值紧密跟踪,拟合决策树解释模型并报告忠实度,构建提示记录形成开源解释工作流程。

Comments 4 pages, 5 figures, submitted to IEEE QCE26, Workshop on Q-GenAI: Synergies between QC & GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14891 2026-07-07 cs.CV 版本更新 57%

GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects

高斯艺术:关节物体几何与运动的统一建模

Licheng Shen, Saining Zhang, Honghan Li, Peilin Yang, Zihao Huang, Zongzheng Zhang, Hao Zhao

机构 * BAAI(百度人工智能研究院) AIR, THU(清华大学人工智能研究院) NTU(国立台湾大学) BIT(北京理工大学) HUST(华中科技大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 研究关节物体重建,此前方法解耦几何与运动,本文用关节3D高斯联合建模,提升运动分解鲁棒性,支持多达20个部件的物体,还提出新基准测试,实验表明该方法在多任务中精度更优。

Comments 3DV 2026 Project Page: https://sainingzhang.github.io/project/gaussianart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 57%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09640 2026-06-09 cs.RO 新提交 57%

Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot Dynamics

面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应

Rishabh Dev Yadav, Samaksh Ujjawal, Sihao Sun, Spandan Roy, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) Delft University of Technology(代尔夫特理工大学) Newcastle University(纽卡斯尔大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO

AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00471 2026-05-04 cs.RO 57%

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

立体多阶段空间注意力用于在视觉尺度变化和干扰下的实时移动操作

Xianbo Cai, Hideyuki Ichiwara, Hyogo Hiruma, Masaki Yoshikawa, Hiroshi Ito, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(媒体艺术与科学系,早稻田大学) SB Intuitions Corp.(SB Intuitions公司) Research and Development Group, Hitachi, Ltd.(日立株式会社研发部) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出一种基于立体多阶段空间注意力的深度预测学习方法,用于实时移动操作,通过层次递归架构整合空间注意力点与机器人状态,提升在视觉尺度变化和干扰下的鲁棒性和任务成功率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 57%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17876 2026-04-21 cs.RO 57%

OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation

OFlow:注入对象感知的时间流匹配以实现稳健的机器人操作

Kuanning Wang, Ke Fan, Chenhao Qiu, Zeyu Shangguan, Yuqian Fu, Yanwei Fu, Daniel Seita, Xiangyang Xue

机构 * Fudan University(复旦大学) University of Southern California(南加州大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 OFlow通过统一时间预测和对象感知推理,提升机器人操作的鲁棒性,实验表明对象感知预测增强了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏