Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
揭示视觉-语言-动作模型中具身推理的幻觉
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; BeingBeyond
专题命中 具身推理 :robotic(abstract);分类 cs.RO
AI总结 本文通过BeTTER基准测试揭示现有VLA模型在动态场景中表现不佳,指出其根本问题在于架构瓶颈导致的语义表示退化,强调需解决高频率控制与高层推理间的矛盾。