CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models
CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力
机构 * University of California Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学)
AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。