FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
FM-VLA:用于接触丰富操作中视觉-语言-动作模型的基于力的记忆
机构 * Tsinghua University(清华大学) ; Microsoft Research(微软研究院) ; Fudan University(复旦大学) ; USTC(中国科学技术大学)
AI总结 研究针对视觉-语言-动作模型在接触丰富操作中的时间上下文推理问题,提出FM-VLA模型,通过基于力的记忆编码及投影,利用累积接触事件历史指导操作,在相关任务上评估,轻量级力记忆表现出色,显著优于基线方法。