Vision-Language Models Unlock Task-Centric Latent Actions
视觉-语言模型解锁任务导向的潜在动作
机构 * Innopolis University(因诺波利斯大学) ; Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出利用视觉-语言模型的常识推理能力,通过可提示的表示分离可控变化与噪声,提升潜在动作质量,从而提高下游任务性能。
Comments Preprint