EgoActor: Grounding Task Planning into Spatial-aware Egocentric Actions for Humanoid Robots via Visual-Language Models
EgoActor: 通过视觉语言模型将任务规划接地于空间感知的自我中心动作以实现人形机器人
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 EgoActor通过视觉语言模型将高层任务指令转化为精确的空间感知动作,实现人形机器人在真实和模拟环境中的稳健任务规划与运动执行。