Comprehending Spatio-temporal Data via Cinematic Storytelling using Large Language Models
Panos Kalnis. Shuo Shang, Christian S. Jensen
机构
*
King Abdullah University of Science and Technology (KAUST)(卡塔尔国王 Abdullah 科学与技术大学)
;
University of Electronic Science and Technology of China (UESTC)(中国电子科学与技术大学)
;
Aalborg University(奥尔堡大学)
VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models
Haidong Xu, Guangwei Xu, Zhedong Zheng, Xiatian Zhu, Wei Ji, Xiangtai Li, Ruijie Guo, Meishan Zhang, Min zhang, Hao Fei
机构
*
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
University of Macau(澳门大学)
;
University of Surrey(Surrey大学)
;
Nanjing University(南京大学)
;
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(新加坡国立大学)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
Yuyang Hong, Jiaqi Gu, Qi Yang, Lubin Fan, Yue Wu, Ying Wang, Kun Ding, Shiming Xiang, Jieping Ye
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
Alibaba Cloud Computing(阿里巴巴云计算)