VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models
VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中
机构 * Nvidia(Nvidia公司) ; Microsoft(微软公司) ; University of Oxford(牛津大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。
Comments In submission. Project website: https://vista-vla.github.io/