机构
*
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院)
;
Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
机构
*
Fudan University(复旦大学)
;
Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)
;
Tianjin University(天津大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Tsinghua University(清华大学)
;
City University of Hong Kong(香港城市大学)
机构
*
Zhejiang University(浙江大学)
;
Hunan University(湖南大学)
;
Tianjin University(天津大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Jilin University(吉林大学)
Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction
在预测之前想象:用于视频事件预测的交错潜在视觉推理
Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
City University of Hong Kong(香港城市大学)
;
Nanjing University(南京大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
University of Electronic Science and Technology of China(电子科技大学)
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments
SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试
Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao
机构
*
The University of New South Wales(新南威尔士大学)
;
The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Xinjiang University(新疆大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理
Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal
机构
*
Mila - Québec AI Institute(蒙特利尔AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
ServiceNow AI Research(ServiceNow人工智能研究)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
机构
*
College of AI, Tsinghua University(清华大学人工智能学院)
;
ByteDance(字节跳动)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
机构
*
Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室)
;
Beijing University of Posts(北京邮电大学)
;
Hong Kong University of Science(香港理工大学)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
增强视觉基础模型中的眼动推理以实现眼动跟随
Shijing Wang, Yaping Huang, Chaoqun Cui, David Wong, Yihua Cheng, Alexandros Neophytou, Hyung Jin Chang
机构
*
Beijing Jiaotong University(北京交通大学)
;
University of Birmingham(英国伯明翰大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部)
;
Microsoft, UK(微软公司(英国))
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Pengcheng Laboratory(鹏城实验室)
;
Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
;
Hainan University(海南大学)
;
University of California at Merced(加州大学默塞德分校)