机构
*
School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)
;
Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
InteractVLM: 3D Interaction Reasoning from 2D Foundational Models
Sai Kumar Dwivedi, Dimitrije Antić, Shashank Tripathi, Omid Taheri, Cordelia Schmid, Michael J. Black, Dimitrios Tzionas
机构
*
Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
;
University of Amsterdam (UvA)(阿姆斯特丹大学)
;
Inria(法国国家信息与自动化研究所)
;
École normale supérieure(巴黎高等师范学院)
;
CNRS(法国国家科学研究中心)
;
PSL Research University(巴黎文理研究大学)
LogiCity: Advancing Neuro-Symbolic AI with Abstract Urban Simulation
Bowen Li, Zhaoyu Li, Qiwei Du, Jinqi Luo, Wenshan Wang, Yaqi Xie, Simon Stepputtis, Chen Wang, Katia P. Sycara, Pradeep Kumar Ravikumar, Alexander G. Gray, Xujie Si, Sebastian Scherer
专题命中
视觉推理
:visual reasoning(abstract);分类 cs.AI
Comments25 pages, 8 figures, In Advances in Neural Information Processing Systems (NeurIPS) 37 D&B Track (2024): 69840-69864
Journal refAdvances in Neural Information Processing Systems, 37, 69840-69864 (2024)
XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?
Fengxiang Wang, Hongzhen Wang, Mingshuo Chen, Di Wang, Yulin Wang, Zonghao Guo, Qiang Ma, Long Lan, Wenjing Yang, Jing Zhang, Zhiyuan Liu, Maosong Sun
机构
*
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)
;
Tsinghua University(清华大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
Zhongguancun Academy(中关村学院)
;
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV