arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9209 篇

2604.21391 2026-06-16 cs.RO cs.AI 版本更新 88%

From Noise to Intent: Anchoring Generative VLA Policies with Residual Bridges

从噪声到意图:基于残差桥的生成式VLA策略锚定

Yiming Zhong, Yaoyu He, Zemin Yang, Pengfei Tian, Yifan Huang, Qingqiu Huang, Xinge Zhu, Yuexin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.AI

AI总结 提出ResVLA架构,通过频谱分析将机器人控制解耦为确定性低频锚点和随机高频残差,利用残差扩散桥聚焦局部动态精化,实现高效表示与强条件对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12396 2026-06-11 cs.CV cs.RO 新提交 88%

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

VLGA:用于自动驾驶的视觉-语言-几何-动作模型

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(Uber自动驾驶实验室) University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。

Comments Project page: https://yaojin17.github.io/VLGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01955 2026-06-02 cs.RO cs.CV 88%

WALL-WM: Carving World Action Modeling at the Event Joints

WALL-WM:在事件关节处雕刻世界动作建模

Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J. W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot Team(X Square机器人团队)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出WALL-WM世界动作模型,通过事件级视觉-语言-动作预训练解决固定长度动作块与语言、视觉、动作之间的粒度不匹配问题,实现跨语言、场景和任务的泛化,在大规模真实世界评估中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07399 2026-05-25 cs.AI cs.CV 88%

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation

VGAS: 价值引导的动作块选择用于少样本视觉-语言-动作适应

Changhua Xu, En Yu, Junyu Xuan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.CV、cs.AI

AI总结 提出VGAS框架,通过生成-选择范式和价值引导的动作块选择,解决少样本VLA适应中的几何歧义问题,提升成功率和鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI 88%

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16815 2025-09-19 cs.CV cs.AI cs.LG cs.RO 88%

ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning

Chi-Pin Huang, Yueh-Hua Wu, Min-Hung Chen, Yu-Chiang Frank Wang, Fu-En Yang

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,comments);action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments NeurIPS 2025. Project page: https://jasper0314-huang.github.io/thinkact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 88%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-17 cs.CV cs.AI cs.LG 版本更新 88%

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 88%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20771 2026-07-28 cs.RO cs.AI cs.LG 版本更新 88%

Emergent Compositional Skills in Mixture-of-Experts VLAs

混合专家VLA中的涌现组合技能

Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali, Dhruv Shah

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究从专家演示端到端学习组合机器人策略的问题,用简化MoE动作头训练VLA,发现其能将任务分解,学习到的专家可跨任务重用,MoE在展示专家专业化时与整体基线性能匹配,向模块化、可解释机器人策略迈进。

Comments Accepted to the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交 88%

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 88%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12772 2026-03-16 cs.CV cs.LG cs.RO 88%

PVI: Plug-in Visual Injection for Vision-Language-Action Models

PVI:插件式视觉注入用于视觉-语言-动作模型

Zezhou Zhang, Songxin Zhang, Xiao Xiong, Junjie Zhang, Zejian Xie, Jingyi Xi, Zunyao Mao, Zan Mao, Zhixin Mai, Zhuoyang Song, Jiaxing Zhang

机构 * Lionrock AI Lab(Lionrock人工智能实验室) China Merchants Group(中国商人集团)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出PVI模块,通过零初始化残差路径注入辅助视觉特征,提升视觉-语言-动作模型的时间信息处理能力,实验证明其在多阶段任务中优于静态图像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13876 2026-01-21 cs.CL 88%

Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education

为视觉-语言-动作模型的教育对齐:一个全面的框架,用于数据、架构和教育中的评估

Unggi Lee, Jahyun Jeong, Sunyoung Shin, Haeun Park, Jeongsu Moon, Youngchang Song, Jaechang Shim, JaeHwan Lee, Yunju Noh, Seungwon Choi, Ahhyun Kim, TaeHyeon Kim, Kyungtae Joo, Taeyeong Kim, Gyeonggeon Lee

机构 * Chosun University(全州大学) Seoul National University(首尔国立大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract)

AI总结 本文提出教育VLA框架,通过四个组件实现轻量级模型的教育对齐,提升科学教育中的任务表现和解释生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20818 2025-10-24 cs.RO cs.AI cs.LG 88%

VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation

Mateo Guaman Castro, Sidharth Rajagopal, Daniel Gorbatov, Matt Schmittle, Rohan Baijal, Octi Zhang, Rosario Scalise, Sidharth Talia, Emma Romig, Celso de Melo, Byron Boots, Abhishek Gupta

机构 * University of Washington(华盛顿大学) DEVCOM ARL

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19854 2025-04-29 cs.RO cs.AI cs.CV 88%

NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks

Chia-Yu Hung, Qi Sun, Pengfei Hong, Amir Zadeh, Chuan Li, U-Xuan Tan, Navonil Majumder, Soujanya Poria

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Lambda Labs(Lambda实验室)

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17043 2026-06-16 cs.RO cs.LG 新提交 87%

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

基于层级优势加权的在线RL微调VLA策略从稀疏回合结果

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

机构 * ACE Robotics Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.LG

AI总结 提出层级优势加权行为克隆(HABC),通过分离生存性和效率目标并自适应平衡,解决稀疏二元结果下VLA策略在线微调中的信用分配问题,在三个双臂接触任务上将成功率从12-44%提升至38-92%。

Comments Website: https://acerobotics-vla.github.io/HABC-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28726 2026-05-28 cs.RO cs.LG 87%

How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures

VLA如何以不同方式失败:黑盒动作监控揭示架构特定的失败特征

Krishnam Gupta

机构 * Independent Research(独立研究)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.LG

AI总结 本文通过黑盒动作监控发现,视觉-语言-动作(VLA)架构在电机指令层面以根本不同且可预测的方式失败,并证明架构匹配的监控器选择至关重要。

Comments Accepted at IEEE ICRA 2026 Workshop "From Data to Decisions: VLA Pipelines for Real Robots", Vienna, June 2026. Non-archival workshop. 5 pages, 2 figures, 22 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-08-26 cs.RO 版本更新 87%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-21 cs.RO 版本更新 87%

EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16697 2026-08-18 cs.AI 新提交 87%

FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

FabriMAE:我相信自己吗?基于马尔可夫注意力熵的视觉-语言-动作模型动作自评估

Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Amazon(亚马逊) East China University of Science and Technology(华东理工大学) Mese Technology Limited Co., Ltd.(迈泽科技有限公司) FabriX team at Youibot Robotics Co., Ltd.(优必科技有限公司FabriX团队)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本研究针对视觉-语言-动作模型的动作自评估难题,提出基于马尔可夫注意力熵(MAE)的自评估框架,构建LIBERO-Reflect基准,实验显示MAE性能优于现有方法,还提升了PI系列动作选择的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05498 2026-08-14 cs.RO 版本更新 87%

JailWAM: Jailbreaking World Action Models in Robot Control

JailWAM: 在机器人控制中对World Action Models进行劫持

Hanqing Liu, Songping Wang, Jiahuan Long, Jiacheng Hou, Jialiang Sun, Chao Li, Yang Yang, Wei Peng, Xu Liu, Tingsong Jiang, Yao Mu, Wen Yao

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部重点实验室) PR Lab, Nanjing University(南京大学PR实验室) Defense Innovation Institute, Chinese Academy of Military Science(军事科学院国防创新研究院)

专题命中 VLA模型 :action model(title,title_cn);分类 cs.RO

AI总结 本文提出JailWAM框架,通过三级安全分类体系和三个核心组件,系统评估WAM的安全性,实验表明其能有效暴露物理漏洞,攻击成功率高达84.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01205 2026-06-09 cs.RO 版本更新 87%

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Southern University of Science and Technology(南方科技大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。

Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03240 2026-06-03 cs.RO 87%

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

GeoAlign: VLA模型中的状态引导空间对齐超越语义

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Jingdezhen Ceramic University(景德镇陶瓷大学) Tsinghua University(清华大学) HONOR(HONOR公司) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 提出GeoAlign架构,通过RGB几何分支的后训练和机器人本体状态引导的几何特征查询,实现几何感知的空间对齐和动态可供性选择,在多个基准上取得高性能。

Comments 20 pages, 9 figures, 8 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06481 2026-05-08 cs.RO 87%

OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation

OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型

Yushan Liu, Peibo Sun, Shoujie Li, Yifan Xie, Lingfeng Zhang, Xintao Chao, Shiyuan Dong, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15692 2025-12-22 cs.RO cs.AI cs.CV cs.LG 87%

mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs

mimic-video: 用于超越VLAs的通用机器人控制的视频-动作模型

Jonas Pai, Liam Achenbach, Victoriano Montesinos, Benedek Forrai, Oier Mees, Elvis Nava

机构 * mimic robotics Microsoft Zurich(微软瑞士分公司) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) UC Berkeley(伯克利大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 mimic-video通过结合预训练的视频模型和基于流匹配的动作解码器,实现了更有效的机器人控制,提升了样本效率和收敛速度。

Comments Revised Introduction, Related Work, and Appendix. Additional minor notational and grammatical fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新 87%

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 87%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15620 2026-07-01 cs.CV cs.RO 版本更新 87%

Towards Generalizable Robotic Manipulation in Dynamic Environments

面向动态环境的通用机器人操作

Heng Fang, Shangru Li, Shuhan Wang, Xuanyang Xi, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Technologies Co. Ltd(华为技术有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出DOMINO数据集与基准,通过实验评估现有VLA模型,提出PUMA架构提升动态感知能力,实现动态任务中的高成功率。

Comments Accepted to ECCV 2026. Project Page: https://h-embodvis.github.io/DOMINO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09292 2026-06-02 cs.RO cs.CV 87%

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

看、规划、回退:面向鲁棒机器人操作的进度感知视觉-语言-动作模型

Tingjun Dai, Mingfei Han, Tingwen Du, Zhiheng Liu, Zihao Zhang, Zhihui Li, Salman Khan, Jun Yu, Xiaojun Chang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) University of Technology Sydney(新南威尔士大学) Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(人工智能与计算机视觉系,Mohamed Bin Zayed人工智能大学) The University of Hong Kong(香港大学) Institute of AI for Industry, Chinese Academy of Sciences(产业人工智能研究所,中国科学院) School of Intelligent Science and Engineering, Harbin Institute of Technology (Shenzhen)(智能科学与工程学院,哈尔滨工业大学(深圳))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 提出进度感知的视觉-语言-动作框架SPR,通过动态将语言指令映射为空间子目标序列,并利用闭环进度监控实现错误恢复,在LIBERO基准上提升5%性能,在LIBERO-Plus上展现最先进的鲁棒性。

Comments Suggested to CVPR Findings. https://tingjundai.github.io/SPRVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏