GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
Tianbin Li, Yanzhou Su, Wei Li, Bin Fu, Zhe Chen, Ziyan Huang, Guoan Wang, Chenglong Ma, Ying Chen, Ming Hu, Yanjun Li, Pengcheng Chen, Xiaowei Hu, Zhongying Deng, Yuanfeng Ji, Jin Ye, Yu Qiao, Junjun He
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
Nanjing University(南京大学)
;
East China Normal University(华东师范大学)
;
Fudan University(复旦大学)
;
Xiamen University(厦门大学)
;
Monash University(莫纳什大学)
;
University of Washington(华盛顿大学)
;
University of Cambridge(剑桥大学)
;
Stanford University(斯坦福大学)
机构
*
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
USC(南加州大学)
;
University of Michigan-Ann Arbor(密歇根大学安娜堡分校)
;
University of Washington(华盛顿大学)
;
University of Maryland(马里兰大学)
;
Lehigh University(理海大学)
;
UIUC(伊利诺伊大学厄巴纳-香槟分校)
;
Peking University(北京大学)
;
University of Rochester(罗切斯特大学)
;
University of California, Davis(加州大学戴维斯分校)
专题命中
视觉问答
:vision language model(title,abstract);VLM(abstract);分类 cs.CV
Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model
Wenke Huang, Jian Liang, Xianda Guo, Yiyang Fang, Guancheng Wan, Xuankun Rong, Chi Wen, Zekun Shi, Qingyun Li, Didi Zhu, Yanbiao Ma, Ke Liang, Bin Yang, He Li, Jiawei Shao, Mang Ye, Bo Du
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
school of Electronics and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院)
;
Department of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院)
;
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)
;
Institute of Artificial Intelligence (TeleAI)(人工智能研究院(腾讯AI Lab))
专题命中
视觉问答
:multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.AI
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Hong Kong Baptist University(香港浸会大学)
;
Hong Kong University of Science and Technology(香港科技大学)
Visual question answering: from early developments to recent advances -- a survey
Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Sunil Aryal, Imran Razzak, Hakim Hacid
机构
*
Deakin University(迪肯大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University of New South Wales(新南威尔士大学)
;
Technology Innovation Institute(技术创新研究院)
专题命中
视觉问答
:visual question answering(title,abstract);visual language model(abstract);分类 cs.CV
机构
*
OpenGVLab(开放通用视觉实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua University(清华大学)
;
SenseTime Research(商汤科技研究院)
;
Nanjing University(南京大学)
;
The University of Hong Kong(香港大学)
;
Beijing Institute of Technology(北京理工大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉问答
:multimodal large language model(title);visual question answering(abstract);MLLM(abstract);分类 cs.CV
SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization
Tan-Hanh Pham, Hoang-Nam Le, Phu-Vinh Nguyen, Chris Ngo, Truong-Son Hy
机构
*
Florida Institute of Technology(佛罗里达理工学院)
;
FPT University(FPT大学)
;
Uppsala University(乌普萨拉大学)
;
Knovel Engineering Lab(诺弗尔工程实验室)
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中
视觉问答
:visual question answering(title,abstract);visual language model(abstract);分类 cs.CV