TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging
TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码
机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) ; Tongji University(同济大学)
专题命中 机器人基础模型 :embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。
Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)