Saliency Guided Longitudinal Medical Visual Question Answering
基于显著性的纵向医学视觉问答
Jialin Wu, Xiaofeng Liu
机构
*
Dept. of Computer Science and Engineering University of California, San Diego(计算机科学与工程系,加州大学圣地亚哥分校)
;
Dept. of Radiology and Biomedical Imaging Yale University(放射学与生物医学成像系,耶鲁大学)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Beihang University(北航大学)
;
Jilin University(吉林大学)
;
National University of Singapore(新加坡国立大学)
;
Peking University(北京大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Huazhong University of Science And Technology(华中科技大学)
VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation
VOST-SGG:基于视觉语言模型的一阶段时空场景图生成
Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
;
Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所)
;
Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)
MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving
MindDrive: 一个整合世界模型和视觉-语言模型的全功能框架,用于端到端自动驾驶
Bin Sun, Yaoguang Cao, Yan Wang, Rui Wang, Jiachen Shang, Xiejie Feng, Jiayi Lu, Jia Shi, Shichun Yang, Xiaoyu Yan, Ziying Song
机构
*
School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
;
State Key Laboratory of Intelligent Transportation System, Beihang University(北京航空航天大学智能交通系统国家重点实验室)
;
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新院)
;
Contemporary Amperex Technology Co., Limited (CATL)(当代电动车技术有限公司(CATL))
;
Research Institute of Aero-Engine, Beihang University(北京航空航天大学航空发动机研究院)
;
School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
;
China Automotive Engineering Research Institute Co., Ltd.(中国汽车工程研究院股份有限公司)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
大规模多模态数据集与基准用于人类活动场景理解和推理
Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing
机构
*
The Chinese University of Hong Kong, Hong Kong(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Columbia University(哥伦比亚大学)
;
University of Pittsburgh(匹兹堡大学)
专题命中
视觉推理
:vision language model(abstract);分类 cs.CV、cs.AI
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai JiaoTong University(上海交通大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Zhejiang University(浙江大学)
TimeScope: Towards Task-Oriented Temporal Grounding In Long Videos
TimeScope: 向长视频中面向任务的时序定位迈进
Xiangrui Liu, Minghao Qin, Yan Shu, Zhengyang Liang, Yang Tian, Chen Jason Zhang, Bo Zhao, Zheng Liu
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
University of Trento(特伦多大学)
;
Singapore Management University(新加坡管理大学)