Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration
探索视觉-语言模型中的碰撞接地以实现安全的人机协作
机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对安全人机协作,提出碰撞接地概念及物理基准TouchSafeBench,评估视觉-语言模型在分类当前安全状态和预警即将碰撞任务中的表现,发现现有模型不可靠,视觉流畅性不等于物理责任性。
Comments 31 pages, 9 figures