PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
机构 * Beijing Jiaotong University(北京交通大学) ; Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) ; ObjectEye Inc(ObjectEye公司)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
Comments 39th Conference on Neural Information Processing Systemss (NeurIPS 2025)