机构
*
University of Oslo(奥斯陆大学)
;
Bosch Center for AI(博世人工智能中心)
;
University of Stuttgart(斯图加特大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
机构
*
Columbia University(哥伦比亚大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
Georgetown University(乔治城大学)
;
San Francisco State University(旧金山州立大学)
;
Loughborough University(拉夫堡大学)
;
Texas A&M University(德克萨斯农工大学)
专题命中
视觉问答
:visual question answering(title,abstract);multimodal large language model(abstract);分类 cs.CV
Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation
通过自我场景增强在多模态大语言模型中强化自我中心空间感知
Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)