Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
超越视频:统一视频推理与深度研究的开放世界视频智能体
Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song
机构
*
Shandong University(山东大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beihang University(北京航空航天大学)
;
City University of Hong Kong(香港城市大学)
;
Nanyang Technological University(南洋理工大学)
;
Kuaishou Technology(快手科技)
;
Southern University of Science and Technology(南方科技大学)
CommentsProject page: this https URL (https://e2hil.github.io/) Updated to the final IEEE RA-L version. The author list has been revised to match the published version, adding Yudong Lin and Qianzhun Wang. Main results and conclusions remain unchanged
机构
*
S-Lab Nanyang Technological University Singapore(南洋理工大学新加坡S-Lab)
;
College of Mathematics Nanjing University of Aeronautics and Astronautics China(南京航空航天大学数学学院)
;
College of Computing and Data Science Nanyang Technological University Singapore(南洋理工大学计算与数据科学学院)
;
Institute of Software Chinese Academy of Sciences China(中国科学院软件研究所)
;
School of Computer Science Shandong University China(山东大学计算机科学学院)
;
Department of Computer Science City University of Hong Kong China(香港城市大学计算机科学系)
;
SenseTime Research China(SenseTime研究院)
crossMoDA Challenge: Evolution of Cross-Modality Domain Adaptation Techniques for Vestibular Schwannoma and Cochlea Segmentation from 2021 to 2023
crossMoDA挑战赛:2021至2023年前庭神经鞘瘤与耳蜗分割的跨模态域自适应技术演进
Navodini Wijethilake, Reuben Dorent, Marina Ivory, Aaron Kujawa, Stefan Cornelissen, Patrick Langenhuizen, Mohamed Okasha, Anna Oviedova, Hexin Dong, Bogyeong Kang, Guillaume Sallé, Luyi Han, Ziyuan Zhao, Han Liu, Yubo Fan, Tao Yang, Shahad Hardan, Hussain Alasmawi, Santosh Sanjeev, Yuzhou Zhuang, Satoshi Kondo, Maria Baldeon Calisto, Shaikh Muhammad Uzair Noman, Cancan Chen, Ipek Oguz, Rongguo Zhang, Mina Rezaei, Susana K. Lai-Yuen, Satoshi Kasai, Yunzhi Huang, Chih-Cheng Hung, Mohammad Yaqub, Lisheng Wang, Benoit M. Dawant, Cuntai Guan, Ritse Mann, Vincent Jaouen, Tae-Eui Kam, Li Zhang, Jonathan Shapey, Tom Vercauteren
机构
*
School of BMEIS, King's College London, London, United Kingdom(伦敦国王学院生物医学工程与信息科学学院)
;
Harvard University, USA(哈佛大学)
;
Elisabeth-TweeSteden Hospital, Tilburg, Netherlands(蒂尔堡埃利斯贝特-特维德登医院)
;
King's College Hospital, London, United Kingdom(伦敦国王学院医院)
;
Center for Data Science, Peking University, Beijing, China(北京大学数据科学中心)
;
Center for Data Science in Health and Medicine, Peking University, Beijing, China(北京大学健康与医学数据科学中心)
;
Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea(韩国大学人工智能系)
;
Department of Radiology and Nuclear Medicine, Radboud University Medical Center, Geert Grooteplein 10, 6525 GA, Nijmegen, The Netherlands(拉德堡德大学医学中心放射科与核医学科)
;
Department of Radiology, The Netherlands Cancer Institute, Plesmanlaan 121, 1066 CX, Amsterdam, The Netherlands(荷兰癌症研究所放射科)
;
Nanyang Technological University, Singapore(南洋理工大学)
;
Vanderbilt University, USA(范德比尔特大学)
;
Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)
;
Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(阿布扎克穆罕默德·本·扎耶德人工智能大学)
;
School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院)
;
Center for Machine Vision and Security Research, Kennesaw State University, Marietta, MA 30060, USA(肯尼斯州立大学机器视觉与安全研究中心)
;
Muroran Institute of Technology, Hokkaido, Japan(北海道Muroran理工学院)
;
Niigata University of Health and Welfare, Niigata, Japan(Niigata健康与福利大学)
;
University of South Florida, Tampa, FL, USA(佛罗里达州立大学)
;
Infervision Advanced Research Institute, Beijing, China(北京Infervision高级研究 institutes)
;
Academy for Multidisciplinary Studies, Capital Normal University, Beijing, China(北京师范大学多学科研究学院)
;
School of Automation, Nanjing University of Information Science and Technology, Nanjing 210044, China(南京信息科学技术大学自动化学院)
A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs
整合时空模型与大语言模型(LLMs)的模块化多任务推理框架
Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)
;
Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院)
;
School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)