HumanCLAW: Can Vision-Language Models Act Through a Body?
HumanCLAW:视觉-语言模型能否通过实体身体执行动作
机构 * Meta ; Nanyang Technological University(南洋理工大学) ; University of Washington(华盛顿大学) ; Brown University(布朗大学) ; Northwestern University(西北大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV
AI总结 本研究提出HumanCLAW框架与HumanCLAW-Bench基准,测试9个先进VLM发现其均未解决具身动作任务,最优仅16.8%成功率,核心缺失具身自我意识。
Comments Project page: https://human-claw.github.io/