Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
依意图行动:为视觉-语言-动作模型提炼行为意图
机构 * POSTECH(浦项科技大学) ; GSAI, POSTECH(浦项科技大学人工智能学院) ; IME, POSTECH(浦项科技大学工程学院)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 本文针对视觉-语言-动作(VLA)模型动作解码器未明确行为语义目标的问题,提出INDI方法提炼行为级意图,在多个基准及真实任务中显著提升了GR00T-N1.7的性能。
Comments Project page: https://leesangoh.github.io/indi-project-page/