LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beijing Zhongguancun Academy(北京中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhengzhou University(郑州大学) ; Beihang University(北航) ; East China Normal University(东华大学) ; DeepCybot Co., Ltd.(DeepCybot有限公司)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision language action(title);action model(title);vision-language-action(abstract)
AI总结 针对VLA模型在训练中因数据偏差导致语言信息被忽略的问题,提出LangForce框架,通过贝叶斯分解和潜在动作查询构建双分支架构,最大化动作与指令的点互信息,无需新数据即可显著提升泛化能力。
Comments ICML 2026