arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9881 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9200 篇

2608.11605 2026-08-13 cs.AI 新提交 83%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 83%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09516 2026-08-11 cs.RO 新提交 83%

HarnessWAM: Bridging Prediction and Deliberation in World Action Models

HarnessWAM:弥合世界动作模型中的预测与审议差距

Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) Beijing Institute of Technology(北京理工大学) Wuhan AI Research(武汉人工智能研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09492 2026-08-11 cs.RO 新提交 83%

Rethink Before You Execute: Adaptive Execution for World Action Models

执行前再思考:世界动作模型的自适应执行

Feng Ye, Yiming Zhao, Yong Yu, Hongxu Zhou, Yong Pan, Yuan Xue, Peng Jia, Chuanmin Jia

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文针对世界动作模型(WAMs)的固定执行 horizon 缺陷,提出自适应执行方案TempoWAM,经实验可改善WAM执行的效率-成功率权衡,在真实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 83%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00793 2026-08-07 cs.RO 版本更新 83%

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation

DynamicWAM:面向动态操作的世界-动作模型的双路径运动条件机制

Yunfan Lou, Hewen Gao, Xiyu Zhu, Zhuoran Qiao, Xuan Han, Yifan Yang, Yifan Ye, Boxian Yao, Zhibo Pang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对现有世界-动作模型在动态场景中运动感知与响应控制不足的问题,提出采用双路径运动条件机制的DynamicWAM,在DOMINO数据集及12项真实世界任务中均显著优于基线方法。

Comments 18 pages, 9 figures. Project page: https://dynamicwam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04996 2026-08-06 cs.RO 新提交 83%

DreamWAM: Beyond RGB Future Prediction for World Action Models

DreamWAM:超越RGB未来预测的世界动作模型

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04404 2026-08-06 cs.CV 新提交 83%

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

Faster-WAM:面向鲁棒世界动作模型的高效推理时未来条件化方法

Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 本文提出Faster-WAM,通过稀疏未来条件化框架等技术解决现有WAMs的性能效率矛盾,在多个机器人操控基准上实现更优权衡,提升了分布外泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01221 2026-08-04 cs.RO 新提交 83%

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型

Jinsong Lin, Zikang Pan, Wanhao Liu, Chi Kit Ng, Liangjing Shao, Zihang Yu, Ziyu Wang, Yin Wang, Jiaxi Wang, Jeremy Yuen-Chun Teoh, Zhiyong Xiong, Huxin Gao, Hongliang Ren

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 83%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 83%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交 83%

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22190 2026-05-28 astro-ph.IM astro-ph.CO cs.LG 83%

RGC: a radio AGN classifier based on deep learning. I. A semi-supervised multiclass model for VLA images

RGC: 基于深度学习的射电活动星系核分类器. I. VLA图像的半监督多类模型

M. S. Hossain, M. S. H. Shahal, K. M. B. Asad, P. Saikia, A. Khan, F. Akter, A. Ali, M. A. Amin, D. P. Guha, M. O. B. Jihad, A. Momen, S. Sen, A. K. M. M. Rahman

机构 * Center for Computational and Data Sciences, Independent University, Bangladesh, Dhaka 1229, Bangladesh(计算与数据科学中心,独立大学,孟加拉国,达卡1229,孟加拉国) Center for Astronomy, Space Science and Astrophysics, Independent University, Bangladesh, Dhaka 1229, Bangladesh(天文学、空间科学与天体物理学中心,独立大学,孟加拉国,达卡1229,孟加拉国) Department of Physical Sciences, Independent University, Bangladesh, Dhaka 1229, Bangladesh(物理科学系,独立大学,孟加拉国,达卡1229,孟加拉国) Department of Computer Science and Engineering, Independent University, Bangladesh, Dhaka 1229, Bangladesh(计算机科学与工程系,独立大学,孟加拉国,达卡1229,孟加拉国) Department of Astronomy and Physics, Yale University, New Haven, CT 06511, USA(天文学与物理学系,耶鲁大学,新 Haven,CT 06511,美国) Department of Agricultural and Biosystems Engineering, North Dakota State University, Fargo, ND 58108, USA(农业与生物系统工程系,北达科他州立大学,法戈,ND 58108,美国)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.LG

AI总结 提出半监督RGC模型,结合BYOL和E2CNN,利用2060个标注样本和20000个未标注样本,首次实现弯曲射电活动星系核(WAT/NAT)与直型Fanaroff-Riley类型(sFRI/sFRII)的多类分类,性能与监督模型相当且Grad-CAM关注形态结构。

Comments 12 pages, 8 pages appendix, 7 figures, re-submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 83%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05765 2026-04-08 cs.AI 83%

RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training

RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练

Haoran Sun, Yongjian Guo, Zhong Guan, Shuai Di, Xiaodong Bai, Jing Long, Tianyun Zhao, Mingxi Luo, Hongke Zhao, Likang Wu, Xiaotie Deng, Xu Chu, Xi Xiao, Sheng Wen, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Tsinghua University(清华大学) Tianjin University(天津大学) JDT AI Infra(京东科技AI基础设施) Swinburne University of Technology(斯威本科技大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 83%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 VLA模型 :vision-language-action(title,abstract);action model(abstract);分类 cs.RO

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 83%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 83%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO 83%

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25038 2026-03-27 cs.RO 83%

$π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation

$π$, 但使其飞行:基于物理的VLA模型向空中操作的转移

Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

机构 * Stanford University(斯坦福大学) Physical Intelligence

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出AirVLA系统,研究预训练VLA模型在空中抓取任务中的迁移性,通过引入负载感知指导机制和高斯点扩散管道合成数据,提升空中操作性能,实现导航任务100%成功和抓取任务50%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12665 2026-03-26 cs.RO 83%

TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation

TacVLA: 基于接触感知的触觉融合用于鲁棒的视觉-语言-动作操控

Kaidi Zhang, Heng Zhang, Zhengtong Xu, Zhiyuan Zhang, Md Rakibul Islam Prince, Xiang Li, Xiaojing Han, Yuhao Zhou, Arash Ajoudani, Yu She

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia(人机交互实验室,意大利理工学院) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova(机器人与智能机器国家级博士项目(DRIM)和热那亚大学) Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 TacVLA通过引入触觉模态提升视觉-语言-动作操控的鲁棒性,采用接触感知门控机制实现多模态融合,实验显示在拆解、箱内拾取和视觉遮挡场景中性能提升显著。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22899 2026-03-25 cs.RO 83%

Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring

Agile-VLA: 通过隐式 affordance 锚定实现少样本工业姿态校正

Teng Yan, Zhengyang Pei, Chengyu Shi, Yue Yu, Yikun Chen, Zilong Zhu, Zelin Fang, Kaile Guo, Zihang Wang, Peigen Tian, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出Agile-VLA框架,通过隐式affordance锚定机制将几何视觉线索映射为参数化动作原语,减少对高延迟语义推理的依赖,实现边缘设备上的高频率动态操作控制。

Comments 8 pages. Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20668 2026-03-24 cs.RO 83%

ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems

以目标区域驱动的视网膜注视用于视觉-语言-动作系统中的统一自体表示

Xinhai Sun, Xiang Shi, Menglin Zou, Wenlong Huang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出了一种以目标区域驱动的数据表示方法,通过单个外部相机投影末端执行器姿态,实现手眼协调的区域划分,提升跨机器人系统的数据重用性和跨体征对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16044 2026-03-18 cs.AI 83%

Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation

增强 VLA 的语言泛化能力:通过合成指令增强细调 OpenVLA

Dongik Shin

专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本文提出通过合成指令集提升 OpenVLA 的语言泛化能力,利用 LoRA 技术在增强数据上微调,增强复杂自然语言意图与机器人动作之间的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14972 2026-03-17 cs.RO 83%

Learning from Mistakes: Post-Training for Driving VLA with Takeover Data

从错误中学习:使用接管数据进行驾驶VLA的后训练

Yinfeng Gao, Deqing Liu, Qichao Zhang, Yupeng Zheng, Haochen Tian, Guang Li, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出TakeVLA框架,通过预接管语言监督和场景做梦方法,提升驾驶VLA的闭环性能与安全性,实验显示在Bench2Drive基准上优于SimLingo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 83%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07949 2026-03-13 cs.DC cs.RO 83%

RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models

RAPID: 为多样化VLA模型设计的冗余感知且兼容最优的边缘-云分区推理

Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO

AI总结 RAPID框架通过优化边缘-云分区策略,有效解决VLA模型在边缘计算中的冗余问题和噪声干扰,实现高效推理与低开销的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 83%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07647 2026-03-10 cs.RO 83%

TempoFit: Plug-and-Play Layer-Wise Temporal KV Memory for Long-Horizon Vision-Language-Action Manipulation

TempoFit: 无需训练的分层时间KV内存用于长时视觉-语言-动作操控

Jun Sun, Boyu Yang, Jiahao Zhang, Ning Ma, Chencheng Wu, Siqing Zhang, Yiou Huang, Qiufeng Wang, Shan Liang, Yaran Chen

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.RO

AI总结 TempoFit通过无需训练的分层时间KV内存提升长时视觉-语言-动作操控性能,有效解决记忆缺失问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07484 2026-03-10 cs.RO 83%

HSC-VLA: Hierarchical Scene-Clearing for Robust Bimanual Manipulation in Dense Clutter

HSC-VLA:分层场景清除用于密集杂乱环境中的鲁棒双臂操作

Zhen Liu, Xinyu Ning, Zhe Hu, XinXin Xie, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,abstract);action model(abstract);分类 cs.RO

AI总结 HSC-VLA 通过分层场景清除方法提升密集杂乱环境中的双臂操作鲁棒性,实现 86.7% 的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏