SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力
Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Zhongguancun Academy(中关村学院)
;
Tsinghua University(清华大学)
;
Helsinki University(赫尔辛基大学)
Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht
机构
*
Visual Geometry Group, University of Oxford(视觉几何组,牛津大学)
;
Meta AI
SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?
SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?
Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez
机构
*
Computational Intelligence and Operations Laboratory(计算智能与运筹实验室)
;
Shahjalal University of Science and Technology(沙赫jalal科技大学)
;
BRAC University(BRAC大学)
;
North South University(北南大学)
;
Monash University(墨尔本大学)
;
Qatar Computing Research Institute(卡塔尔计算研究院)
AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
AugVLA-3D:基于深度的特征增强用于视觉-语言-动作模型
Zhifeng Rao, Wenlong Chen, Lei Xie, Xia Hua, Dongfu Yin, Zhen Tian, F. Richard Yu
机构
*
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
;
Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)
;
School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)
;
School of Information Technology, Carleton University(卡尔顿大学信息技术学院)
机构
*
Beijing University of Technology(北京理工大学)
;
Fudan University(复旦大学)
;
University of Hamburg(汉堡大学)
;
Hubei University of Chinese Medicine(湖北中医药大学)
;
Tsinghua University(清华大学)