FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies
FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐
机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) ; Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)
AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。
Comments 26 pages, 7 figures, 25 tables